התשובה הקצרה
ארגונים נוטים להתייחס אל בדיקות Agentforce כאל פרויקט מערכת. בפועל מדובר בשינוי של תהליך, אחריות ומידע. המטרה היא למדוד Topic matching, איכות תשובה ועמידה בתהליך לפני Production. לכן איכות העבודה נמדדת פחות במספר הרכיבים שנבנו ויותר ביכולת של משתמשים ומנהלים לבצע תהליך אמין מקצה לקצה.
הגישה המומלצת היא להתחיל בהחלטה ובתהליך, לא בכלי. מטרת העבודה היא למדוד Topic matching, איכות תשובה ועמידה בתהליך לפני Production. לאחר מכן מתכננים את המידע, ההרשאות, האינטגרציות, הבדיקות והאימוץ בהתאם לרמת הסיכון. אם אחד המרכיבים עדיין אינו ידוע, מציינים זאת כהנחה ומקצים שלב שמטרתו לצמצם אי-ודאות לפני התחייבות רחבה.
החלטה זו בתחום בדיקות Agentforce נשענת לרוב על עבודה מקדימה שמתוארת בAgentforce לארגונים.
מה ההחלטה שהמאמר עוזר לקבל?
המטרה איננה לייצר עוד רשימת Best Practices, אלא לאפשר לארגון לקבל החלטה אחראית לגבי בדיקות Agentforce. החלטה טובה מגדירה ארבעה דברים: תוצאה עסקית, Owner, גבולות פתרון וראיה שתוכיח שהפתרון עובד. ב-Salesforce יש כמעט תמיד כמה דרכי מימוש אפשריות; הערך של ארכיטקטורה הוא לבחור ביניהן לפי ההקשר ולתעד את ה-Trade-offs.
ארבעת מוקדי ההחלטה
| נושא החלטה | שאלה עסקית | שאלה ארכיטקטונית | ראיה נדרשת |
|---|---|---|---|
| Test design ו-Coverage | איזה Outcome עסקי נדרש ומי אחראי עליו? | מהו מקור האמת ואילו הרשאות חלות? | תהליך מאושר ו-Baseline |
| Standard expectations | מה נכנס ל-Scope ומה נשאר במפורש בחוץ? | אילו מערכות, נתונים והחלטות תלויות בכך? | Scope, ADR ותלויות מתועדות |
| Custom scorers | מי מבצע את העבודה ומה משתנה ביום-יום? | כיצד מטפלים בחריג, בעומס ובכשל חלקי? | תרחיש End-to-End ותוצאת בדיקה |
| Regression, Red Teaming ו-Gates | איזה KPI יוכיח שההחלטה יצרה ערך? | כיצד בודקים, מנטרים ומשנים בבטחה? | Dashboard, Sign-off ותוכנית תפעול |
Test design ו-Coverage
השלב של Test design ו-Coverage קובע את איכות ההחלטות שבאות אחריו. במקרה של בדיקות Agentforce, המשמעות היא בחירת Job-to-be-done מדיד במקום התחלה מצ'אטבוט כללי. צריך לכתוב מי מקבל את ההחלטה, מהו הגבול ואיזו ראיה נדרשת לפני שמתקדמים. אחרת, פער קטן בהגדרה מתגלגל ל-Data Model, לאוטומציות, לבדיקות ולחוזה.
מבחינה ארכיטקטונית ותפעולית, יש לבחון את Test design ו-Coverage דרך בעלות על מידע, הרשאות, סדר ריצה וטיפול בכשל חלקי. בדיקה מקצועית כוללת לא רק את ה-Happy Path אלא גם נתון חסר, משתמש ללא הרשאה, עומס, שינוי דרישה וכשל של מערכת תלויה. העיקרון המנחה כאן הוא Actions עם הרשאות מצומצמות, Validation ונקודות Human Approval.
תוצר עבודה מתאים הוא מסמך תכנון שניתן לבדיקה ובו Owner, תלויות וקריטריוני קבלה. הוא צריך להיות קצר מספיק לשימוש ושיטתי מספיק לביקורת: מטרה, Owner, הנחות, חלופות, החלטה, קריטריון קבלה ותאריך לבחינה מחדש. אם אין קריטריון קבלה או Decision Record עבור Test design ו-Coverage, הנושא עדיין אינו בשל לפיתוח או להתחייבות מסחרית.
מי שנמצא בשלב מוקדם יותר מבדיקות Agentforce ימצא רקע משלים בAgentforce שירות לקוחות.
Standard expectations
Standard expectations הוא המקום שבו הנחות עמומות הופכות להתחייבויות תפעוליות. במקרה של בדיקות Agentforce, המשמעות היא Grounding במקורות מידע מאושרים, עדכניים ומורשי גישה. צריך לכתוב מי מקבל את ההחלטה, מהו הגבול ואיזו ראיה נדרשת לפני שמתקדמים. כאשר ההבחנה אינה ברורה, הצוות בונה לפי פרשנות והעסק בודק לפי ציפייה אחרת.
מבחינה ארכיטקטונית ותפעולית, יש לבחון את Standard expectations דרך נפח, Latency, יכולת בדיקה ויכולת חזרה לאחור. בדיקה מקצועית כוללת לא רק את ה-Happy Path אלא גם נתון חסר, משתמש ללא הרשאה, עומס, שינוי דרישה וכשל של מערכת תלויה. העיקרון המנחה כאן הוא בדיקות איכות ושימוש בתרחישי קצה לפני חשיפה ללקוחות או לעובדים.
תוצר עבודה מתאים הוא תרחיש End-to-End שמתחיל באירוע עסקי ומסתיים בתוצאה נמדדת. הוא צריך להיות קצר מספיק לשימוש ושיטתי מספיק לביקורת: מטרה, Owner, הנחות, חלופות, החלטה, קריטריון קבלה ותאריך לבחינה מחדש. אם אין קריטריון קבלה או Decision Record עבור Standard expectations, הנושא עדיין אינו בשל לפיתוח או להתחייבות מסחרית.
Custom scorers
כדי לנהל נכון את Custom scorers, צריך להפריד בין צורך, אילוץ ופתרון. במקרה של בדיקות Agentforce, המשמעות היא Actions עם הרשאות מצומצמות, Validation ונקודות Human Approval. צריך לכתוב מי מקבל את ההחלטה, מהו הגבול ואיזו ראיה נדרשת לפני שמתקדמים. הפער בדרך כלל אינו מופיע ב-Demo הראשון; הוא מופיע בחריג, בעומס או בשינוי הבא.
מבחינה ארכיטקטונית ותפעולית, יש לבחון את Custom scorers דרך Source of Truth, תלויות, חריגים ויכולת תחזוקה. בדיקה מקצועית כוללת לא רק את ה-Happy Path אלא גם נתון חסר, משתמש ללא הרשאה, עומס, שינוי דרישה וכשל של מערכת תלויה. העיקרון המנחה כאן הוא Observability, משוב ו-Governance כחלק ממחזור החיים של הסוכן.
תוצר עבודה מתאים הוא מפת אחריות המפרידה בין העסק, צוות Salesforce, ספקים ומערכות חיצוניות. הוא צריך להיות קצר מספיק לשימוש ושיטתי מספיק לביקורת: מטרה, Owner, הנחות, חלופות, החלטה, קריטריון קבלה ותאריך לבחינה מחדש. אם אין קריטריון קבלה או Decision Record עבור Custom scorers, הנושא עדיין אינו בשל לפיתוח או להתחייבות מסחרית.
את ההשלכות המעשיות של הנקודה הזו על בדיקות Agentforce פירטנו בנפרד בHuman in the Loop Agentforce.
Regression, Red Teaming ו-Gates
ב-Regression, Red Teaming ו-Gates חשוב לאשר את ההיגיון לפני שמאשרים את המימוש. במקרה של בדיקות Agentforce, המשמעות היא בדיקות איכות ושימוש בתרחישי קצה לפני חשיפה ללקוחות או לעובדים. צריך לכתוב מי מקבל את ההחלטה, מהו הגבול ואיזו ראיה נדרשת לפני שמתקדמים. העלות האמיתית של החלטה עמומה מתגלה לאחר שהפתרון כבר תלוי במערכות ובצוותים נוספים.
מבחינה ארכיטקטונית ותפעולית, יש לבחון את Regression, Red Teaming ו-Gates דרך Auditability, Least Privilege, ניטור ותהליך שינוי. בדיקה מקצועית כוללת לא רק את ה-Happy Path אלא גם נתון חסר, משתמש ללא הרשאה, עומס, שינוי דרישה וכשל של מערכת תלויה. העיקרון המנחה כאן הוא בחירת Job-to-be-done מדיד במקום התחלה מצ'אטבוט כללי.
תוצר עבודה מתאים הוא Decision Log קצר שמציג את החלופות, ההנחות והסיבה לבחירה. הוא צריך להיות קצר מספיק לשימוש ושיטתי מספיק לביקורת: מטרה, Owner, הנחות, חלופות, החלטה, קריטריון קבלה ותאריך לבחינה מחדש. אם אין קריטריון קבלה או Decision Record עבור Regression, Red Teaming ו-Gates, הנושא עדיין אינו בשל לפיתוח או להתחייבות מסחרית.
תהליך עבודה מומלץ
1. בחרו תהליך אחד ותוצאה עסקית
יש לנסח את התוצאה במונחי תהליך או סיכון: זמן מחזור, שיעור השלמה, איכות, קיבולת או חשיפה. יעד כמו 'להטמיע Salesforce' אינו מדד משום שהוא מתאר אמצעי ולא תוצאה. בהקשר של בדיקות Agentforce, השלב קשור במיוחד ל-Test design ו-Coverage. העיקרון המקצועי הוא Grounding במקורות מידע מאושרים, עדכניים ומורשי גישה. התוצר צריך לציין קלט, Owner, החלטה, קריטריון קבלה ותלות; רק כך ניתן לדעת שהצוות התקדם ולא רק השקיע זמן.
2. מפו נתונים, ידע, הרשאות וסיכונים
האיסוף צריך להתבסס על ראיונות, צפייה בעבודה ונתונים קיימים. מסמך הנהלה לבדו כמעט תמיד מחמיץ חריגים, Shadow Systems ועבודה ידנית שמבצעים המשתמשים. בהקשר של בדיקות Agentforce, השלב קשור במיוחד ל-Standard expectations. העיקרון המקצועי הוא Actions עם הרשאות מצומצמות, Validation ונקודות Human Approval. התוצר צריך לציין קלט, Owner, החלטה, קריטריון קבלה ותלות; רק כך ניתן לדעת שהצוות התקדם ולא רק השקיע זמן.
3. הגדירו Topics, Instructions ו-Actions
ב-To-Be יש להסיר שלבים שאינם יוצרים ערך לפני שמבצעים להם אוטומציה. כל דרישה מסווגת כ-Must, Should או Later ומקבלת Owner ותלות. בהקשר של בדיקות Agentforce, השלב קשור במיוחד ל-Custom scorers. העיקרון המקצועי הוא בדיקות איכות ושימוש בתרחישי קצה לפני חשיפה ללקוחות או לעובדים. התוצר צריך לציין קלט, Owner, החלטה, קריטריון קבלה ותלות; רק כך ניתן לדעת שהצוות התקדם ולא רק השקיע זמן.
4. הוסיפו Guardrails ו-Human-in-the-loop
הארכיטקטורה צריכה להיות מתועדת בהחלטות קצרות: מודל נתונים, גישה, Automation, Integration, Failure handling ויכולת תחזוקה. לכל החלטה מציינים חלופה שנפסלה והסיבה. בהקשר של בדיקות Agentforce, השלב קשור במיוחד ל-Regression, Red Teaming ו-Gates. העיקרון המקצועי הוא Observability, משוב ו-Governance כחלק ממחזור החיים של הסוכן. התוצר צריך לציין קלט, Owner, החלטה, קריטריון קבלה ותלות; רק כך ניתן לדעת שהצוות התקדם ולא רק השקיע זמן.
5. בנו Test Set וקריטריוני איכות
בנייה במחזורים קצרים אינה פוטרת מתכנון. כל מחזור צריך להציג Vertical Slice עובד, עם נתונים והרשאות מייצגים, ולא אוסף מסכים שאינם משלימים תהליך. בהקשר של בדיקות Agentforce, השלב קשור במיוחד ל-Test design ו-Coverage. העיקרון המקצועי הוא בחירת Job-to-be-done מדיד במקום התחלה מצ'אטבוט כללי. התוצר צריך לציין קלט, Owner, החלטה, קריטריון קבלה ותלות; רק כך ניתן לדעת שהצוות התקדם ולא רק השקיע זמן.
6. השיקו לקבוצה מצומצמת ונטרו Traces
לפני Go Live מריצים תרחישים מלאים, עומסים רלוונטיים ו-Rehearsal. תקלות מסווגות לפי השפעה עסקית, ובעלי התהליך חותמים על קריטריוני הקבלה. בהקשר של בדיקות Agentforce, השלב קשור במיוחד ל-Standard expectations. העיקרון המקצועי הוא Grounding במקורות מידע מאושרים, עדכניים ומורשי גישה. התוצר צריך לציין קלט, Owner, החלטה, קריטריון קבלה ותלות; רק כך ניתן לדעת שהצוות התקדם ולא רק השקיע זמן.
7. שפרו ורק לאחר מכן הרחיבו שימוש
לאחר ההשקה מודדים שימוש, איכות ותוצאה מול Baseline. פריטים שלא עמדו ביעד נכנסים ל-Improvement Backlog עם Owner, עדיפות ותאריך בדיקה. בהקשר של בדיקות Agentforce, השלב קשור במיוחד ל-Custom scorers. העיקרון המקצועי הוא Actions עם הרשאות מצומצמות, Validation ונקודות Human Approval. התוצר צריך לציין קלט, Owner, החלטה, קריטריון קבלה ותלות; רק כך ניתן לדעת שהצוות התקדם ולא רק השקיע זמן.
תרחיש ארגוני לדוגמה
נניח רשת קמעונאית שבוחנת בדיקות Agentforce. הארגון מפעיל כמה צוותים, חלק מהמידע נמצא ב-Salesforce וחלקו במערכות נוספות, והנהלה רוצה להתקדם מהר. בתרחיש כזה, התחלה מפיתוח הייתה מסתירה את המחלוקת לגבי Test design ו-Coverage. הצוות בוחר תחילה תהליך אחד, מגדיר Owner, נתוני קלט ותוצאה רצויה, ורושם אילו מקרים יישארו מחוץ לגרסה הראשונה.
בסדנת התכנון מתגלה כי Standard expectations הוא התלות האמיתית. במקום להוסיף שדה או Flow נקודתי, הארגון מגדיר כלל עסקי, מקור אמת ותרחיש בדיקה. לאחר מכן נבנית גרסה מצומצמת בסביבה נפרדת, נבדקת עם משתמשים מייצגים ומושווית ל-Baseline. התוצאה אינה 'הצלחה מובטחת', אלא החלטה שמצמצמת סיכון ומייצרת ראיות לפני הרחבה.
מה שהתרחיש מלמד על בדיקות Agentforce הוא שסדר הפעולות קובע לא פחות מהבחירה הטכנולוגית: קודם מגדירים את התוצאה העסקית, אחריה מאמתים נתונים והרשאות, ורק אז בונים, בודקים ומרחיבים. בהקשר של Agentforce ו-AI, דילוג על אחד השלבים הוא בדרך כלל מה שמייצר עבודה חוזרת בהמשך.
כדי לתרגם את העיקרון הזה לתוכנית עבודה סביב בדיקות Agentforce, כדאי לקרוא גם אבטחת Agentforce.
סיכונים נפוצים ופעולות מניעה
| סיכון | כיצד הוא נראה בפועל | פעולת מניעה |
|---|---|---|
| Use case רחב מדי | אין דרך למדוד איכות או לשלוט בהתנהגות | להתחיל בתהליך אחד עם גבולות ברורים |
| Grounding חלש | תשובות נשענות על מידע לא מעודכן או לא מוסמך | מקורות מאושרים, Owner ו-SLA לעדכון |
| Actions ללא Guardrails | הסוכן מבצע פעולה רגישה ללא אימות | Least Privilege, Validation ו-Human Approval |
| בדיקות Happy Path בלבד | כשלי שפה, הקשר והרשאה מגיעים ל-Production | Test set מגוון ו-Red Teaming תפעולי |
| אין מדידת עלות | הצריכה גדלה בלי קשר לערך | תקציב, Telemetry ו-KPI עסקי לכל Use Case |
ברמת הניהול של בדיקות Agentforce, הטבלה הזו היא נקודת פתיחה ולא Risk Register מלא. עבור AI QA, Developers ו-Product Owners כדאי לתחזק רישום סיכונים ייעודי לאשכול Agentforce ו-AI, שבו לכל סיכון יש Owner, הסתברות, השפעה, פעולת מניעה ו-Trigger שמפעיל תוכנית תגובה לפני שהסיכון הופך לתקלה בייצור.
כיצד מודדים הצלחה
| תחום | מה מודדים | קצב בדיקה |
|---|---|---|
| Task success | שיעור השלמת המשימה בהתאם לקריטריון עסקי | שבועי |
| Escalation | העברות לאדם והסיבה להן | שבועי |
| Quality | דיוק Grounding, חריגות ותוצאות Scorers | בכל גרסה |
| Cost to outcome | צריכה ועלות ביחס למשימות שהושלמו | חודשי |
לצורך בדיקות Agentforce, כדאי לבחור שלושה עד חמישה מדדים בלבד לגרסה הראשונה. מדד טוב ניתן לחישוב לפני השינוי ולאחריו, קשור לבעל תהליך, ואינו ניתן לשיפור מלאכותי באמצעות הזנת נתונים טכנית בלבד. כאשר אין Baseline, יש להקדיש תקופה קצרה למדידת המצב הקיים ולא להציג שיפור על בסיס תחושה.
ארגונים שמעדיפים ליווי מקצועי בבדיקות Agentforce עושים זאת במסגרת שירות Agentforce ו-AI.
Checklist לפני קבלת החלטה
- ☐ הבעיה העסקית וה-Outcome מוגדרים במשפט אחד
- ☐ קיים Sponsor ובעל תהליך עם סמכות החלטה
- ☐ ה-Scope וה-Out of Scope כתובים
- ☐ מקורות המידע וה-Source of Truth ידועים
- ☐ מודל הרשאות ורגישות מידע נבדקו
- ☐ תרחישי חריג וכשל כלולים בתכנון
- ☐ קיימים קריטריוני קבלה שניתן לבדוק
- ☐ תלויות, הנחות וסיכונים מתועדים
- ☐ הוגדרו מדדי הצלחה ו-Baseline
- ☐ קיימת תוכנית תפעול, תמיכה ושינוי לאחר ההשקה
מקורות מקצועיים
- Salesforce – How Agentforce Works — https://www.salesforce.com/agentforce/how-it-works/
- Salesforce – Agentforce Guardrails — https://help.salesforce.com/s/articleView?id=ai.agent_plan_risks_guardrails.htm&language=en_US&type=5
- Salesforce – Agent Testing Custom Scorers — https://developer.salesforce.com/docs/ai/agentforce/guide/testing-api-custom-scorers.html
- HPI Pro – Agentforce ו-AI — https://hpi.pro/agentforce-ai
