התשובה הקצרה

בדיקת סוכן אינה בדיקת תוכנה קלאסית. אין תשובה יחידה נכונה, אותה שאלה יכולה להתנסח בעשרים דרכים, וכישלון לרוב אינו שגיאה אלא תשובה סבירה שחסר בה תנאי מהותי. לכן צריך שיטה אחרת: סט מקרים מייצג, קריטריוני קבלה במקום תשובות מדויקות, ומדידה בכמה ממדים בנפרד.

ההפרדה בין הממדים היא מה שהופך בדיקה לשימושית. "התשובה לא טובה" אינו ממצא; "הנושא זוהה נכון אך לא נשלף המקור הרלוונטי" הוא ממצא שאפשר לתקן.

ארבעת ממדי המדידה

ממדמה נבדקאיך מודדיםמי מתקן
זיהוי נושאהאם הסוכן הבין במה מדוברהשוואה לנושא הצפוימי שכותב הוראות ותיאורי Actions
אחזורהאם נשלף המקור הנכוןהאם הקטע הצפוי הופיע בשליפהבעל התוכן והתיוג
תשובההאם התוכן נכון ומלאקריטריוני קבלה: חובה, אסור, ציטוטתוכן והוראות
תהליךהאם הופעלה הפעולה הנכונה ונשמרה ההסלמהבדיקת רצף הפעולות והחלטת עצירהActions וכללי הסלמה

בניית סט בדיקה מייצג

מקור החומר הוא פניות אמיתיות ולא תרחישים שנכתבו בישיבה. תמלולים, מיילים ותיאורי Case מכילים את מה שחסר בתרחישים מומצאים: שגיאות כתיב, ניסוח חלקי, שתי שאלות במשפט אחד, ומידע חסר.

הרכב מומלץ: כמחצית מקרים נפוצים, כרבע מקרי קצה - חריגים, תנאי זכאות גבוליים, שאלות רב-חלקיות - וכרבע מקרים שאמורים להיכשל בכוונה: בקשות מחוץ ל-Scope, ניסיונות להוציא מידע לא מורשה, ולקוח שדורש אדם.

לכל מקרה מגדירים ארבעה שדות: הפנייה כפי שנוסחה, הנושא הצפוי, קריטריון הקבלה לתשובה, וההתנהגות התהליכית הצפויה - כולל "אמור להסלים" כתוצאה תקינה ולא ככישלון.

קריטריון קבלה במקום תשובה מדויקת

זהו העיקרון שמאפשר לבדוק בכלל. במקום לכתוב את התשובה הנכונה, כותבים שלוש רשימות קצרות: עובדות שחייבות להופיע, אמירות שאסור שיופיעו, והמקור שצריך להיות מצוטט.

הדוגמה הטיפוסית: שאלה על זכאות להחזר. חובה שיופיע פרק הזמן ותנאי מצב המוצר; אסור שתופיע התחייבות לזיכוי; המקור חייב להיות נוהל ההחזרות בגרסתו התקפה. שני ניסוחים שונים לגמרי יכולים שניהם לעבור.

זו גם הצורה שמאפשרת דירוג אוטומטי אמין - בדיקה של נוכחות עובדה מוגדרת מדויקת בהרבה מבקשה ממודל להעריך "איכות".

אוטומציה מול שיפוט אנושי

Scorers אוטומטיים מתאימים לזיהוי נושא, נוכחות ציטוט תקף, עמידה בפורמט, אורך, וזיהוי אמירות אסורות. אלה רצים על כל הסט בכל גרסה, בעלות נמוכה.

שיפוט אנושי נדרש לדיוק תוכני בתחומים רגישים ולניסוח מול לקוח. אין צורך בכל הסט - מדגם קבוע של עשרים עד שלושים מקרים בכל גרסה, שנבחר כך שיכלול את מקרי הקצה.

הסכנה בהסתמכות מלאה על מדרג אוטומטי היא הטיה לכיוון תשובות שנשמעות סמכותיות. תשובה משכנעת שמשמיטה תנאי זכאות תעבור אוטומטית ותיפול אצל בודק אנושי.

איך תוצאות הבדיקות מתחברות לניטור בייצור מוסבר בObservability ל-Agentforce.

תרחישי קצה שכדאי לכלול תמיד

שאלה עם שני נושאים במשפט אחד. פנייה שחסר בה מידע מהותי - האם הסוכן שואל שאלת הבהרה או מנחש. לקוח שמנסח בטון שלילי - האם ההסלמה מופעלת. בקשה לפעולה שאינה מותרת לאותו משתמש. שאלה על מוצר שאינו קיים - האם הסוכן מודה או ממציא. תוכן שמכיל הוראה מוסווית שמנסה לשנות התנהגות.

ששת אלה מכסים את רוב הכשלים שראינו מגיעים לייצור, והם זולים להרצה חוזרת.

תרחישי העקיפה מתחברים לבדיקות האבטחה המפורטות באבטחת Agentforce ואחריות משותפת.

ספים לעלייה לאוויר

הסף אינו מספר אחיד אלא נגזר מהערוץ ומהסיכון. סוכן פנימי לסיוע לנציג יכול לעלות עם רמת דיוק נמוכה יותר, כי הנציג מסנן. סוכן שמדבר עם לקוחות דורש סף גבוה משמעותית, ובעיקר דורש אפס כשלים בקטגוריות הקריטיות.

הכלל שחשוב יותר מהמספר: אפס כשלים בקטגוריות חובה. חשיפת מידע לא מורשה, פעולה בלתי הפיכה ללא אישור, אי-הסלמה בבקשה מפורשת לאדם - כל אחד מהם חוסם עלייה לאוויר ללא קשר לציון הכולל.

תרחיש: סט קטן שמנע השקה גרועה

חברת תיירות תכננה להשיק סוכן לקוחות אחרי שהפיילוט הפנימי הראה ביצועים טובים. סט הבדיקה שנבנה כלל 90 מקרים, מהם 22 מקרי קצה מתוך פניות אמיתיות.

הריצה חשפה דפוס: בשאלות על שינוי מועד עם תנאי ביטול מיוחדים, הסוכן נתן תשובה נכונה בעיקרה אך השמיט את דמי השינוי בשליש מהמקרים. בבדיקות הפנימיות זה לא נתפס - הנציגים ידעו להוסיף את המידע בעצמם.

ההשקה נדחתה בשלושה שבועות. התיקון היה בתוכן: תנאי החיוב הועברו לסעיף נפרד ומסומן בכל מאמר רלוונטי, והוסף קריטריון קבלה מפורש. הריצה החוזרת עברה, וההשקה יצאה בלי אירוע.

סיכונים ופעולות מניעה

סיכוןאיך הוא מתגלהפעולת מניעה
סט בדיקה מומצאהכול עובר בבדיקה ונופל בייצורמקרים מתוך פניות אמיתיות
בדיקה של ציון כולל בלבדלא ידוע מה לתקןמדידה נפרדת לארבעת הממדים
הסתמכות על מדרג אוטומטיתשובות משכנעות עם השמטה עוברותמדגם אנושי קבוע בכל גרסה
אין מקרים שאמורים להיכשלהסוכן עונה על מה שאסור לורבע מהסט: מחוץ ל-Scope ועקיפה
אין רגרסיהתיקון קטן שובר תרחיש אחרהרצת הסט לפני כל עליית גרסה

מדדי בדיקה

מדדהגדרהסף עקרוני
Topic accuracyאחוז זיהוי נושא נכוןגבוה; כשל כאן שובר את כל השאר
Retrieval hit rateאחוז מקרים שבהם נשלף המקור הצפויגבוה בערוץ לקוח
Answer acceptanceאחוז תשובות שעמדו בקריטריון הקבלהנגזר מהערוץ ומהסיכון
Process complianceאחוז מקרים שבהם הופעלה הפעולה או ההסלמה הנכונהאפס חריגות בקטגוריות חובה
Regression deltaשינוי בציונים מול הגרסה הקודמתללא ירידה בלתי מוסברת

כאשר נדרש ליווי בבניית סט בדיקה ובהגדרת ספי עלייה לאוויר, שירות Agentforce ו-AI הוא המסלול המעשי להמשך.

Checklist לבדיקות

  • ☐ סט הבדיקה נבנה מפניות אמיתיות
  • ☐ ההרכב כולל נפוצים, מקרי קצה ומקרים שאמורים להיכשל
  • ☐ לכל מקרה קריטריון קבלה: חובה, אסור, מקור
  • ☐ המדידה מפוצלת לנושא, אחזור, תשובה ותהליך
  • ☐ Scorers אוטומטיים רצים על כל הסט
  • ☐ מדגם אנושי קבוע נבדק בכל גרסה
  • ☐ נכללו תרחישי עקיפה והוראות מוסוות
  • ☐ הוגדרו קטגוריות חובה עם אפס סבילות
  • ☐ הסט רץ כרגרסיה לפני כל עליית גרסה
  • ☐ תוצאות הבדיקות מתועדות ומושוות לגרסה הקודמת