איך בודקים סוכן AI שההתנהגות שלו משתנה בין הרצות
שתי הרצות תקינות של סוכן יכולות להתקדם במסלולים שונים. שלבו בדיקות רגרסיה, הערכת פלט והרצות חוזרות כדי לבדוק גם את התוצאה וגם את הבקרות שסביבה.
שתי הרצות של אותו סוכן AI על אותו מקרה יכולות להתקדם במסלולים שונים, ושתיהן להיות תקינות. עצם השונות אינה תקלה. השאלה עבור צוות ה־QA היא אם כל הרצה עומדת בדרישות העסקיות ובאותם גבולות פעולה.
השוואת טקסט מדויקת היא לעיתים דרישה צרה מדי לפלט של מודל שפה. זה לא הופך בדיקות תנאי (assertions) למיותרות. עדיין אפשר לבדוק במדויק שאישור נדרש התקבל, שמזהה חשבון תקין או שלא בוצע תשלום כפול. הדוגמה של Camunda לבדיקת סוכנים היא נקודת פתיחה שימושית להפרדה בין סוגי הבדיקות האלה.
מה משתנה כשהפלט אינו קבוע
בדיקות QA מסורתיות כבר מתמודדות עם מערכות אסינכרוניות והסתברותיות. בסוכנים מבוססי מודלי שפה, הניסוח, בחירת הכלים וסדר הפעולות עשויים להשתנות גם כשהמשימה זהה. בדקו את התכונות החשובות במקום לדרוש משפט אחד או מסלול אחד כשכמה אפשרויות תקינות.
בדיקות רגרסיה עדיין נחוצות. שמרו מקרים מייצגים, תעדו את המודל והתצורה, והריצו אותם מחדש כשההנחיות, הכלים או כללי התהליך משתנים.
שלוש שכבות בדיקה
הדוגמה של Camunda מפרידה בין שלוש שאלות מעשיות:
- לוגיקת התהליך, עם רכיבים מדומים: האם החיבורים לכלים, מיפויי הנתונים, הכללים והניתוב עובדים כשהבדיקה מספקת תשובות מודל מבוקרות?
- התנהגות המודל, עם מודל אמיתי: האם הסוכן משתמש בכלים הנדרשים, נמנע מפעולות אסורות ומפיק תוצאה שעומדת בדרישות?
- עקביות ועלות, לאורך כמה הרצות: באיזו תדירות מתקבלת כל תוצאה, ומה העלות של קריאות למודל, שימוש בכלים וצריכת טוקנים?
הריצו את השכבה הראשונה בתדירות גבוהה. השתמשו במודל אמיתי לשאלות שרכיבים מדומים אינם יכולים לענות עליהן, וחזרו על הבדיקות מספיק פעמים כדי לזהות שונות. מספר ההרצות המתאים תלוי בסיכון ובמידת הוודאות הנדרשת לטענה שתרצו לבסס.
הערכת פלט לצד בדיקות מדויקות
שתי שיטות שימושיות משלימות את הבדיקות המדויקות:
- מודל כשופט (LLM-as-judge): מודל מעריך תשובה לפי מחוון. הציון עלול להיות שגוי או מוטה, ולכן צריך להשוות אותו לשיפוט אנושי בדוגמאות מייצגות ולתעד את מודל השופט, ההנחיות והסף.
- דמיון סמנטי: ייצוגים מספריים של טקסט (embeddings) מעריכים את הקרבה במשמעות בין שני טקסטים. ציון גבוה אינו מוכיח שסכומים, שמות או התחייבויות נכונים. את הפרטים האלה יש לבדוק בנפרד.
בדיקת השופט של Camunda Process Test מתעדת סף ברירת מחדל של 0.5. זו הגדרה של הספרייה, לא הסתברות שהתשובה נכונה ולא סף קבלה שמתאים לכל תהליך. גם התמיכה בדמיון סמנטי תלויה בגרסת הספרייה; בדקו את התיעוד של הגרסה שאתם מפעילים.
מדריך ההערכה של Anthropic מתאר שילוב בין בדיקות בקוד, הערכה באמצעות מודל ובדיקה אנושית. התאימו את השיטה לדרישה: מודל שופט אינו תחליף לבדיקה מדויקת שסכום תשלום תואם לסכום שאושר.
מה התזמור מוסיף לתיעוד הבדיקה
מודל BPMN יכול להציג במפורש שלבים נדרשים ומסלולי חריגה. תיעוד בדיקה שימושי מקשר את מופע התהליך לקריאות לכלים, לקלט ולפלט, לאישורים, לחותמות זמן ולתצורת המודל. התיעוד הזה דורש מנגנוני רישום והגדרות שמירה; הוא אינו נוצר אוטומטית מעצם השימוש ב־BPMN.
תיעוד ההגדרות והמופעים של סוכנים ב־Camunda מתאר רשומות סוכן מובנות ונתוני שימוש. נכון ל־30 בספטמבר 2026, זהו תיעוד של 8.10, שטרם שוחררה. הוא גם מבחין בין סוכנים מובנים לסוכנים חיצוניים, שהמידע הזמין עליהם תלוי בדיווח של סביבת הריצה שלהם. בדקו את היכולות בגרסה שאתם מפעילים לפני שתסתמכו על הרשומות האלה.
בארגון מפוקח, התיעוד יכול לתמוך בביקורת או בחקירת תקלה. מידת התאמתו תלויה בדרישות החלות, בשלמות הרשומות, בהרשאות הגישה ובמדיניות השמירה; פורמט לוג כשלעצמו אינו מבטיח שהרגולטור יקבל את התיעוד כמספק.
מה זה אומר לארגון שלכם
שמרו על בדיקות הרגרסיה והוסיפו הערכות לחלקים המשתנים. בדקו תשובות שגויות לצד כלים שנכשלו, אישורים שפג תוקפם, פעולות חוזרות והעברת טיפול לאדם. דווחו על מספר המקרים וסוגיהם, על ההרצות החוזרות, על שיעור הכשל ועל אי־הוודאות. קבוצה קטנה של הרצות מוצלחות תומכת במסקנה מוגבלת על המדגם, לא בטענה שהסוכן אמין בכל מצב.
ב־NG Workshop אנחנו משתמשים בגישת Process-First כדי לחבר בין איכות המודל לבקרות התפעוליות. הבדיקות צריכות להראות גם שהסוכן מבצע עבודה מועילה וגם שהתהליך סביבו מטפל בכשלים.
לקריאה נוספת: Human-in-the-Loop כמנגנון ממשל ומפיילוט לפרודקשן.
מקורות
- Camunda: How to Test an AI Agent That Never Does the Same Thing Twice
- Camunda Process Test: בדיקות תנאי
- Anthropic: Demystifying evals for AI agents
סיכום
- פלט משתנה דורש קריטריונים מתאימים לקבלה, לא ויתור על בדיקות רגרסיה.
- הפרידו בין בדיקות תהליך, הערכת מודל והרצות חוזרות לבחינת עקביות ועלות.
- תיעוד שניתן לעקוב אחריו תומך בביקורת; גם את שלמותו ואת התאמתו צריך לבדוק.
רוצים לבנות אסטרטגיית בדיקה לסוכני AI בארגון שלכם? דברו איתנו