إثبات فكرة الذكاء الاصطناعي يختبر سؤالًا محددًا، مو يعرض كل القدرات الممكنة. اكتب المخرج المتوقع والأخطاء غير المقبولة قبل اختيار أمثلة العرض. التجربة المقترحة هنا تختبر توجيه طلبات خدمة افتراضية بدون إرسال رسائل أو تعديل سجلات عمل. نجاح الاختبار يدعم القرار المحدود فقط، مو الجاهزية الإنتاجية أو الامتثال أو العائد المالي.
حدد القرار والأشياء خارج النطاق
استخدم قرارًا مثل: هل المرشح يوجّه نص الطلب المصرح به للطوابير المتفق عليها ويتوقف عند الطلب المجهول؟ سمِّ الطوابير وصيغة المخرج والمسؤول والإجراءات المستبعدة. لا تجمع دقة التوجيه والتنبؤ واستخراج المستندات ومحادثة العملاء في درجة واحدة. دليل تقييم OpenAI يبدأ بهدف محدد وبيانات مناسبة له.
ثبّت مجموعة تقييم تم التحقق منها بشكل مستقل
جهّز أمثلة بإجابات متوقعة معتمدة، تشمل الصياغة العربية والمدخلات الناقصة والتعارض والطلبات خارج النطاق. افصل أمثلة ضبط المرشح عن مجموعة تقييم مستقلة. سجّل إصدار البيانات وطريقة اختيارها والاستبعادات. الحالات المصطنعة تختبر قواعد معلنة، لكنها ما تثبت الأداء على الاستخدام الحقيقي. لا تحذف الحالات الصعبة بصمت بعد ظهور النتائج.
استخدم مثال توجيه فيه مسار توقف حقيقي
السياسة الافتراضية: طلب الفاتورة الواضح يروح للفوترة، وطلب كلمة مرور الحساب الواضح يروح للدعم، والطلب الملتبس يرجع needs_clarification. المدخل «أحتاج نسخة من الفاتورة» متوقع يرجع billing. والمدخل «عندي مشكلة» يرجع needs_clarification، مو طابورًا مخمنًا. الطلب اللي يجمع القصدين يتبع قاعدة معلنة مستقلة. هذي نتائج متوقعة مقترحة، مو نتائج تشغيل نموذج.
قِس أنواع الفشل، مو الدرجة الإجمالية فقط
في الاختبار المقترح، افصل التوجيه الصحيح للطلبات القابلة للإجابة عن التوجيه الخاطئ لحالات التوقف، والمخرجات غير الصالحة، ومحاولات الإجراء غير المصرح. وضّح المقامات والفئات الفارغة؛ عدم وجود حالات توقف يعني إن السلوك ما تقيّم. حدد حدود القبول حسب العمل قبل التشغيل. المتوسط العالي ما يخفي إجراءً غير مصرح وغير مقبول. قارن بقاعدة توجيه ثابتة بسيطة تحت نفس الظروف.
خل التشغيل قابلًا للتكرار والتغييرات واضحة
سجّل إصدار المرشح وإعداداته والبيانات والمخرج والوقت والتكلفة لكل حالة، بما فيها الفاشلة والمنتهية بمهلة. الطلب المكرر ممكن يختلف، فحدد سياسة التكرار قبل الاختبار واذكر حدودها. OpenAI يوصي باستمرار التقييم مع تغير التطبيق. هذا مرجع للعملية، مو اشتراط لاستخدام نماذجه أو منصة Evals أو أدواته.
وثّق قرار الاستمرار أو التعديل أو التوقف
استخدم قرار الاستمرار للمرحلة المحددة التالية فقط إذا نجحت معايير القبول المعلنة مسبقًا. التعديل لخلل مشخص وقابل للإصلاح مع إعادة اختبار محدودة. التوقف إذا المهمة أو الوصول للبيانات أو الفشل غير المقبول ما ينحل ضمن النطاق. أرفق الأسئلة المفتوحة ومسؤوليها. إطار NIST إرشاد اختياري لإدارة المخاطر؛ لا هو ولا نجاح اختبار التوجيه يعطي اعتمادًا قانونيًا أو خطة تشغيل إنتاجية.
أهم النقاط
- اختر سؤالًا واحدًا للاختبار.
- افصل أمثلة الضبط عن التقييم.
- أظهر فشل التوقف والمقامات الفارغة.
- نجاح إثبات الفكرة مو تصريح بإنتاج بدون حدود.
حالات قبول مقترحة لسجل الاختبار
- طلب فاتورة ← billing؛ قارن الطابور بالإجابة المتوقعة بالضبط.
- طلب ملتبس ← needs_clarification؛ اختلاق طابور يعتبر فشلًا.
- قصدان مختلفان ← القاعدة المعلنة لهذي الحالة؛ بدون اختلاق سياسة.
- انتهاء مهلة أو JSON غير صالح ← بدون توجيه أو إجراء عمل؛ سجّل الفشل والتعافي المسموح.
سياسة التوجيه والحالات أمثلة افتراضية ما تم تشغيلها. الدليل ما يثبت حدود قبول أو تكلفة أو أداء إنتاجي.
الأسئلة الشائعة
وش الفرق بين العرض وتجربة التحقق؟
العرض يوضح سلوكًا مختارًا. تجربة التحقق تسجل الأداء مقابل بيانات وسياسة فشل ومعيار قرار محددة مسبقًا.
وش نسبة النجاح المطلوبة؟
حدد الحدود حسب أثر كل خطأ وقياس الوضع الحالي. الدليل ما يفرض نسبة عامة.
هل الأمثلة المصطنعة تثبت دقة الإنتاج؟
لا. تقدر تختبر حالات معلنة، لكن الأداء الفعلي يحتاج بيانات مصرح بها وتمثل الاستخدام وحدود تقييم واضحة.
وش يصير إذا فشلت التجربة؟
سجّل الفشل وقرر هل إصلاح محدد ومحدود يستحق أو توقف المرشح. لا تغير الحدود لمجرد النجاح.
أدلة مرتبطة
المصادر
- ممارسات التقييم: الأهداف والبيانات والتقييم المستمرOpenAIتاريخ الاطلاع: ١٢ سبتمبر ٢٠٢٦
- إطار إدارة مخاطر الذكاء الاصطناعي: الاستخدام الاختياري والنطاقNISTتاريخ الاطلاع: ١٢ سبتمبر ٢٠٢٦
مراجعة تحريرية بتاريخ ١٢ سبتمبر ٢٠٢٦: استبدلنا تعميمات غير مدعومة بإرشادات محددة وأمثلة افتراضية معلنة. الأمثلة والقائمة توصيات تينغ، مو نتائج عملاء أو اختبار أداء أو اعتماد نشر آلي. المراجع تدعم فقط الأوصاف المنسوبة لها، وما تثبت متطلبات نظامية سعودية أو نتائج تشغيلية.


