الخلاصة
تقييم Agentforce لا يماثل اختبار البرمجيات التقليدي. لا توجد إجابة صحيحة واحدة، ويمكن صياغة السؤال نفسه بعشرين طريقة، والفشل غالبًا لا يمثل خطأ بل إجابة معقولة تفتقر إلى شرط أساسي. لذلك، يلزم اتباع منهجية مختلفة: مجموعة حالات تمثيلية، معايير قبول بدلًا من الإجابات الدقيقة، وقياس على عدة أبعاد بشكل منفصل.
الفصل بين الأبعاد هو ما يجعل الاختبار مفيدًا. "الإجابة ليست جيدة" ليست نتيجة؛ "تم تحديد الموضوع بشكل صحيح ولكن لم يتم استرداد المصدر ذي الصلة" هي نتيجة يمكن إصلاحها.
أبعاد القياس الأربعة
| البعد | ما يتم اختباره | كيفية القياس | من يقوم بالإصلاح |
|---|---|---|---|
| تحديد الموضوع | هل فهم Agentforce فحوى السؤال | مقارنة بالموضوع المتوقع | من يكتب التعليمات وأوصاف الإجراءات (Actions) |
| الاسترداد | هل تم استرداد المصدر الصحيح | هل ظهر الجزء المتوقع في عملية الاسترداد | صاحب المحتوى وواضع العلامات (Tagging) |
| الإجابة | هل المحتوى صحيح وكامل | معايير القبول: واجب، محظور، اقتباس | المحتوى والتعليمات |
| العملية | هل تم تفعيل الإجراء الصحيح والحفاظ على التصعيد | اختبار تسلسل الإجراءات وقرار التوقف | الإجراءات (Actions) وقواعد التصعيد |
بناء مجموعة اختبار تمثيلية
مصدر المواد هو الاستفسارات الحقيقية وليس السيناريوهات المكتوبة في اجتماع. تحتوي النصوص، رسائل البريد الإلكتروني، وأوصاف الحالات (Case descriptions) على ما تفتقر إليه السيناريوهات المخترعة: الأخطاء الإملائية، الصياغة الجزئية، سؤالين في جملة واحدة، والمعلومات الناقصة.
التكوين الموصى به: حوالي نصف الحالات شائعة، حوالي ربع حالات حافة (Edge cases) – استثناءات، شروط أهلية حدودية، أسئلة متعددة الأجزاء – وحوالي ربع حالات يُفترض أن تفشل عمدًا: طلبات خارج النطاق (Out of Scope)، محاولات لاستخراج معلومات غير مصرح بها، وعميل يطلب التحدث إلى شخص.
لكل حالة، يتم تحديد أربعة حقول: الاستفسار كما صيغ، الموضوع المتوقع، معيار القبول للإجابة، والسلوك الإجرائي المتوقع – بما في ذلك "يجب التصعيد" كنتيجة صحيحة وليست فشلًا.
معيار القبول بدلًا من الإجابة الدقيقة
هذا هو المبدأ الذي يسمح بالتحقق على الإطلاق. بدلًا من كتابة الإجابة الصحيحة، تُكتب ثلاث قوائم قصيرة: حقائق يجب أن تظهر، تصريحات يحظر ظهورها، والمصدر الذي يجب اقتباسه.
المثال النموذجي: سؤال حول أهلية الاسترداد. يجب أن تظهر الفترة الزمنية وشروط حالة المنتج؛ يحظر أن يظهر تعهد باسترداد؛ يجب أن يكون المصدر هو إجراءات الاسترداد في نسختها السارية. صياغتان مختلفتان تمامًا يمكن أن تكونا مقبولتين.
هذه هي الصيغة التي تسمح أيضًا بالتقييم التلقائي الموثوق به – فحص وجود حقيقة معرّفة أدق بكثير من طلب نموذج لتقييم "الجودة".
الأتمتة مقابل الحكم البشري
المقيّمون (Scorers) الآليون مناسبون لتحديد الموضوع، وجود اقتباس صالح، الامتثال للتنسيق، الطول، وتحديد التصريحات المحظورة. يتم تشغيل هذه على المجموعة بأكملها في كل إصدار، بتكلفة منخفضة.
يتطلب الحكم البشري الدقة المحتوائية في المجالات الحساسة والصياغة التي تواجه العميل. لا حاجة للمجموعة بأكملها – عينة ثابتة من عشرين إلى ثلاثين حالة في كل إصدار، يتم اختيارها بحيث تشمل حالات الحافة.
يكمن الخطر في الاعتماد الكامل على التقييم الآلي في الانحياز نحو إجابات تبدو موثوقة. إجابة مقنعة تحذف شرط الأهلية ستجتاز الاختبار الآلي وستفشل عند المختبر البشري.
كيفية ربط نتائج الاختبارات بالمراقبة في الإنتاج مشروحة في المراقبة والامتثال لـ Agentforce.
سيناريوهات الحافة التي يجب تضمينها دائمًا
سؤال بموضوعين في جملة واحدة. استفسار يفتقر إلى معلومات أساسية – هل يسأل Agentforce سؤال توضيح أم يخمن؟ عميل يصيغ بلهجة سلبية – هل يتم تفعيل التصعيد؟ طلب إجراء غير مسموح به لنفس المستخدم. سؤال عن منتج غير موجود – هل يعترف Agentforce أم يخترع؟ محتوى يتضمن تعليمات مموهة تحاول تغيير السلوك.
هذه الستة تغطي معظم الإخفاقات التي رأيناها تصل إلى الإنتاج، وهي رخيصة لإعادة التشغيل.
سيناريوهات التجاوز ترتبط باختبارات الأمان المفصلة في أمان Agentforce والمسؤولية المشتركة.
الحدود الدنيا للنشر
الحد الأدنى ليس رقمًا واحدًا بل مشتق من القناة والمخاطر. يمكن لـ Agentforce داخلي لمساعدة المندوب العمل بمستوى دقة أقل، لأن المندوب يفلتر. يتطلب Agentforce الذي يتحدث مع العملاء حدًا أدنى أعلى بكثير، ويتطلب بشكل خاص صفر إخفاقات في الفئات الحرجة.
القاعدة الأهم من الرقم: صفر إخفاقات في الفئات الإلزامية. الكشف عن معلومات غير مصرح بها، إجراء غير قابل للإلغاء بدون موافقة، عدم التصعيد بطلب صريح لشخص – أي من هذه يمنع النشر بغض النظر عن النتيجة الإجمالية.
سيناريو: مجموعة اختبار صغيرة منعت إطلاقًا سيئًا
خططت شركة سياحة لإطلاق Agentforce للعملاء بعد أن أظهر المشروع التجريبي الداخلي أداءً جيدًا. تضمنت مجموعة الاختبار التي تم بناؤها 90 حالة، منها 22 حالة حافة من استفسارات حقيقية.
كشفت عملية التشغيل عن نمط: في الأسئلة المتعلقة بتغيير الموعد بشروط إلغاء خاصة، قدم Agentforce إجابة صحيحة في جوهرها ولكنه حذف رسوم التغيير في ثلث الحالات. في الاختبارات الداخلية، لم يتم اكتشاف ذلك – كان المندوبون يعرفون كيفية إضافة المعلومات بأنفسهم.
تم تأجيل الإطلاق لمدة ثلاثة أسابيع. كان الإصلاح في المحتوى: تم نقل شروط الرسوم إلى قسم منفصل ومميز في كل مقال ذي صلة، وتمت إضافة معيار قبول واضح. نجح الاختبار المتكرر، وتم الإطلاق دون حادث.
المخاطر والإجراءات الوقائية
| المخاطرة | كيف تكتشف | الإجراء الوقائي |
|---|---|---|
| مجموعة اختبار مخترعة | كل شيء ينجح في الاختبار ويفشل في الإنتاج | حالات من استفسارات حقيقية |
| اختبار النتيجة الإجمالية فقط | لا يُعرف ما يجب إصلاحه | قياس منفصل للأبعاد الأربعة |
| الاعتماد على التقييم الآلي | إجابات مقنعة مع إغفال تتجاوز | عينة بشرية ثابتة في كل إصدار |
| لا توجد حالات يُفترض أن تفشل | Agentforce يجيب على ما لا يُسمح له به | ربع المجموعة: خارج النطاق وتجاوز |
| لا يوجد انحدار | إصلاح صغير يكسر سيناريو آخر | تشغيل المجموعة قبل كل رفع إصدار |
مقاييس الاختبار
| المقياس | التعريف | الحد الأدنى المبدئي |
|---|---|---|
| Topic accuracy | نسبة تحديد الموضوع الصحيح | مرتفع؛ الفشل هنا يكسر كل شيء آخر |
| Retrieval hit rate | نسبة الحالات التي تم فيها استرداد المصدر المتوقع | مرتفع في قناة العميل |
| Answer acceptance | نسبة الإجابات التي استوفت معايير القبول | مشتق من القناة والمخاطر |
| Process compliance | نسبة الحالات التي تم فيها تفعيل الإجراء أو التصعيد الصحيح | صفر تجاوزات في الفئات الإلزامية |
| Regression delta | التغير في النتائج مقارنة بالإصدار السابق | بدون انخفاض غير مبرر |
عند الحاجة إلى دعم في بناء مجموعة الاختبار وتحديد حدود النشر، فإن خدمات Agentforce والذكاء الاصطناعي هي المسار العملي الأنسب للمتابعة.
قائمة تحقق للاختبارات
- ☐ تم بناء مجموعة الاختبار من استفسارات حقيقية
- ☐ يتضمن التكوين حالات شائعة، حالات حافة، وحالات يُفترض أن تفشل
- ☐ لكل حالة معيار قبول: واجب، محظور، مصدر
- ☐ يتم تقسيم القياس إلى الموضوع، الاسترداد، الإجابة، والعملية
- ☐ يتم تشغيل المقيمين الآليين (Scorers) على المجموعة بأكملها
- ☐ يتم فحص عينة بشرية ثابتة في كل إصدار
- ☐ تم تضمين سيناريوهات التجاوز والتعليمات المموهة
- ☐ تم تحديد فئات إلزامية مع عدم التسامح مطلقًا
- ☐ تُشغل المجموعة كاختبار انحدار قبل كل رفع إصدار
- ☐ يتم توثيق نتائج الاختبارات ومقارنتها بالإصدار السابق
