تخطَّ إلى المحتوى
نانو للذكاء الاصطناعي
اختبارات المجموعة الذهبية (Golden-Set Evals)
core ai

اختبارات المجموعة الذهبية (Golden-Set Evals)

اختبارات المجموعة الذهبية هي اختبارات آلية تشغّل الوكيل الذكي على مجموعة ثابتة معتمدة بشرياً من رسائل عملاء حقيقية والإجابات المفترضة لها. تُظهر النتيجة إن كان تعديل التعليمات أو النموذج أو المعرفة قد حسّن الوكيل أو أضعفه.

المجموعة الذهبية هي مفتاح الإجابات المرجعي. يجمع الفريق بضع مئات من المدخلات الممثلة، رسائل واتساب حقيقية ونصوص مكالمات بعد حذف البيانات الشخصية، ويكتب أو يعتمد الرد المثالي لكل منها: السعر الصحيح، السياسة الصحيحة، الرفض الصحيح، التحويل الصحيح. قد يحمل كل بند أيضاً شروطاً مثل 'يجب أن يذكر مدة الاسترجاع 14 يوماً' أو 'يجب ألا يعد بموعد توصيل'. تُحفظ المجموعة بإصدارات وتبقى ثابتة لتكون النتائج قابلة للمقارنة عبر الزمن.

للعربية هذا ليس خياراً. النموذج الذي يجيب جيداً بالفصحى قد يسيء فهم 'وش' النجدية أو 'إزاي' المصرية، أو يتعثر مع العربيزي، أو ينزلق إلى أسلوب يبدو غريباً لعميل في الكويت. المعايير العامة لا تقيس شيئاً من هذا. المجموعة الذهبية المبنية من رسائل عملائك أنت، مقسّمة حسب اللهجة، هي الطريقة الوحيدة لمعرفة أداء الوكيل مع من يراسلونك فعلاً. تختبر Nano AI كل وكيل واتساب على مجموعات ذهبية للنجدية والحجازية والإماراتية والمصرية والعربيزي قبل الإطلاق.

عملياً تعمل الاختبارات تلقائياً عند أي تغيير: تعليمات جديدة، ترقية نموذج، كتالوج منتجات محدّث. تُقيَّم كل إجابة مرشحة بقواعد، أو بنموذج أقوى يعمل كحَكَم، أو بشخص في الحالات الصعبة، وتُقارن نسبة النجاح بالإصدار السابق. أي انخفاض يوقف الإصدار. هكذا يبقى الضبط الشهري آمناً: هو الفرق بين 'حسّنّا التعليمات' و'نستطيع إثبات أن التعليمات تحسّنت'.

تبحث عن استشارة مخصصة؟

دعنا نساعدك في فهم وتطبيق هذه التقنيات بما يتناسب مع متطلبات وأهداف شركتك.

احجز مكالمة استكشافية
تواصل عبر واتساب