התשובה הקצרה
בדיקת סוכן אינה בדיקת תוכנה קלאסית. אין תשובה יחידה נכונה, אותה שאלה יכולה להתנסח בעשרים דרכים, וכישלון לרוב אינו שגיאה אלא תשובה סבירה שחסר בה תנאי מהותי. לכן צריך שיטה אחרת: סט מקרים מייצג, קריטריוני קבלה במקום תשובות מדויקות, ומדידה בכמה ממדים בנפרד.
ההפרדה בין הממדים היא מה שהופך בדיקה לשימושית. "התשובה לא טובה" אינו ממצא; "הנושא זוהה נכון אך לא נשלף המקור הרלוונטי" הוא ממצא שאפשר לתקן.
ארבעת ממדי המדידה
| ממד | מה נבדק | איך מודדים | מי מתקן |
|---|---|---|---|
| זיהוי נושא | האם הסוכן הבין במה מדובר | השוואה לנושא הצפוי | מי שכותב הוראות ותיאורי Actions |
| אחזור | האם נשלף המקור הנכון | האם הקטע הצפוי הופיע בשליפה | בעל התוכן והתיוג |
| תשובה | האם התוכן נכון ומלא | קריטריוני קבלה: חובה, אסור, ציטוט | תוכן והוראות |
| תהליך | האם הופעלה הפעולה הנכונה ונשמרה ההסלמה | בדיקת רצף הפעולות והחלטת עצירה | Actions וכללי הסלמה |
בניית סט בדיקה מייצג
מקור החומר הוא פניות אמיתיות ולא תרחישים שנכתבו בישיבה. תמלולים, מיילים ותיאורי Case מכילים את מה שחסר בתרחישים מומצאים: שגיאות כתיב, ניסוח חלקי, שתי שאלות במשפט אחד, ומידע חסר.
הרכב מומלץ: כמחצית מקרים נפוצים, כרבע מקרי קצה - חריגים, תנאי זכאות גבוליים, שאלות רב-חלקיות - וכרבע מקרים שאמורים להיכשל בכוונה: בקשות מחוץ ל-Scope, ניסיונות להוציא מידע לא מורשה, ולקוח שדורש אדם.
לכל מקרה מגדירים ארבעה שדות: הפנייה כפי שנוסחה, הנושא הצפוי, קריטריון הקבלה לתשובה, וההתנהגות התהליכית הצפויה - כולל "אמור להסלים" כתוצאה תקינה ולא ככישלון.
קריטריון קבלה במקום תשובה מדויקת
זהו העיקרון שמאפשר לבדוק בכלל. במקום לכתוב את התשובה הנכונה, כותבים שלוש רשימות קצרות: עובדות שחייבות להופיע, אמירות שאסור שיופיעו, והמקור שצריך להיות מצוטט.
הדוגמה הטיפוסית: שאלה על זכאות להחזר. חובה שיופיע פרק הזמן ותנאי מצב המוצר; אסור שתופיע התחייבות לזיכוי; המקור חייב להיות נוהל ההחזרות בגרסתו התקפה. שני ניסוחים שונים לגמרי יכולים שניהם לעבור.
זו גם הצורה שמאפשרת דירוג אוטומטי אמין - בדיקה של נוכחות עובדה מוגדרת מדויקת בהרבה מבקשה ממודל להעריך "איכות".
אוטומציה מול שיפוט אנושי
Scorers אוטומטיים מתאימים לזיהוי נושא, נוכחות ציטוט תקף, עמידה בפורמט, אורך, וזיהוי אמירות אסורות. אלה רצים על כל הסט בכל גרסה, בעלות נמוכה.
שיפוט אנושי נדרש לדיוק תוכני בתחומים רגישים ולניסוח מול לקוח. אין צורך בכל הסט - מדגם קבוע של עשרים עד שלושים מקרים בכל גרסה, שנבחר כך שיכלול את מקרי הקצה.
הסכנה בהסתמכות מלאה על מדרג אוטומטי היא הטיה לכיוון תשובות שנשמעות סמכותיות. תשובה משכנעת שמשמיטה תנאי זכאות תעבור אוטומטית ותיפול אצל בודק אנושי.
איך תוצאות הבדיקות מתחברות לניטור בייצור מוסבר בObservability ל-Agentforce.
תרחישי קצה שכדאי לכלול תמיד
שאלה עם שני נושאים במשפט אחד. פנייה שחסר בה מידע מהותי - האם הסוכן שואל שאלת הבהרה או מנחש. לקוח שמנסח בטון שלילי - האם ההסלמה מופעלת. בקשה לפעולה שאינה מותרת לאותו משתמש. שאלה על מוצר שאינו קיים - האם הסוכן מודה או ממציא. תוכן שמכיל הוראה מוסווית שמנסה לשנות התנהגות.
ששת אלה מכסים את רוב הכשלים שראינו מגיעים לייצור, והם זולים להרצה חוזרת.
תרחישי העקיפה מתחברים לבדיקות האבטחה המפורטות באבטחת Agentforce ואחריות משותפת.
ספים לעלייה לאוויר
הסף אינו מספר אחיד אלא נגזר מהערוץ ומהסיכון. סוכן פנימי לסיוע לנציג יכול לעלות עם רמת דיוק נמוכה יותר, כי הנציג מסנן. סוכן שמדבר עם לקוחות דורש סף גבוה משמעותית, ובעיקר דורש אפס כשלים בקטגוריות הקריטיות.
הכלל שחשוב יותר מהמספר: אפס כשלים בקטגוריות חובה. חשיפת מידע לא מורשה, פעולה בלתי הפיכה ללא אישור, אי-הסלמה בבקשה מפורשת לאדם - כל אחד מהם חוסם עלייה לאוויר ללא קשר לציון הכולל.
תרחיש: סט קטן שמנע השקה גרועה
חברת תיירות תכננה להשיק סוכן לקוחות אחרי שהפיילוט הפנימי הראה ביצועים טובים. סט הבדיקה שנבנה כלל 90 מקרים, מהם 22 מקרי קצה מתוך פניות אמיתיות.
הריצה חשפה דפוס: בשאלות על שינוי מועד עם תנאי ביטול מיוחדים, הסוכן נתן תשובה נכונה בעיקרה אך השמיט את דמי השינוי בשליש מהמקרים. בבדיקות הפנימיות זה לא נתפס - הנציגים ידעו להוסיף את המידע בעצמם.
ההשקה נדחתה בשלושה שבועות. התיקון היה בתוכן: תנאי החיוב הועברו לסעיף נפרד ומסומן בכל מאמר רלוונטי, והוסף קריטריון קבלה מפורש. הריצה החוזרת עברה, וההשקה יצאה בלי אירוע.
סיכונים ופעולות מניעה
| סיכון | איך הוא מתגלה | פעולת מניעה |
|---|---|---|
| סט בדיקה מומצא | הכול עובר בבדיקה ונופל בייצור | מקרים מתוך פניות אמיתיות |
| בדיקה של ציון כולל בלבד | לא ידוע מה לתקן | מדידה נפרדת לארבעת הממדים |
| הסתמכות על מדרג אוטומטי | תשובות משכנעות עם השמטה עוברות | מדגם אנושי קבוע בכל גרסה |
| אין מקרים שאמורים להיכשל | הסוכן עונה על מה שאסור לו | רבע מהסט: מחוץ ל-Scope ועקיפה |
| אין רגרסיה | תיקון קטן שובר תרחיש אחר | הרצת הסט לפני כל עליית גרסה |
מדדי בדיקה
| מדד | הגדרה | סף עקרוני |
|---|---|---|
| Topic accuracy | אחוז זיהוי נושא נכון | גבוה; כשל כאן שובר את כל השאר |
| Retrieval hit rate | אחוז מקרים שבהם נשלף המקור הצפוי | גבוה בערוץ לקוח |
| Answer acceptance | אחוז תשובות שעמדו בקריטריון הקבלה | נגזר מהערוץ ומהסיכון |
| Process compliance | אחוז מקרים שבהם הופעלה הפעולה או ההסלמה הנכונה | אפס חריגות בקטגוריות חובה |
| Regression delta | שינוי בציונים מול הגרסה הקודמת | ללא ירידה בלתי מוסברת |
כאשר נדרש ליווי בבניית סט בדיקה ובהגדרת ספי עלייה לאוויר, שירות Agentforce ו-AI הוא המסלול המעשי להמשך.
Checklist לבדיקות
- ☐ סט הבדיקה נבנה מפניות אמיתיות
- ☐ ההרכב כולל נפוצים, מקרי קצה ומקרים שאמורים להיכשל
- ☐ לכל מקרה קריטריון קבלה: חובה, אסור, מקור
- ☐ המדידה מפוצלת לנושא, אחזור, תשובה ותהליך
- ☐ Scorers אוטומטיים רצים על כל הסט
- ☐ מדגם אנושי קבוע נבדק בכל גרסה
- ☐ נכללו תרחישי עקיפה והוראות מוסוות
- ☐ הוגדרו קטגוריות חובה עם אפס סבילות
- ☐ הסט רץ כרגרסיה לפני כל עליית גרסה
- ☐ תוצאות הבדיקות מתועדות ומושוות לגרסה הקודמת
