معرفة واضحة وقائمة على المصادر لبرامج الذكاء الاصطناعي.

ابحث في استراتيجية الذكاء الاصطناعي أو الأتمتة أو الحوكمة...
فتح القائمة أو إغلاقها

تقييم الذكاء الاصطناعي

بناء مجموعة تقييم قائمة على السيناريوهات لنظام ذكاء اصطناعي للأعمال

منهج عملي لبناء مجموعة تقييم قائمة على السيناريوهات لنظام ذكاء اصطناعي للأعمال، من خريطة التغطية وسجل الحالة إلى الدرجات واختبار الإصدار المحمي.

يجتمع زملاء العمل حول طاولة خشبية لفحص مسار مادي من بطاقات فارغة ومجموعات حالات ملونة وملفات ومظروف مختوم.

تصل إلى مساعد داخلي لطلبات الشراء حزمة تبدو مكتملة، لكن رقم المورد في الطلب يخالف الرقم في عرض السعر، وخدمة استرجاع السياسة لا تستجيب، ويتضمن الملف المرفوع تعليمات موجهة إلى المساعد نفسه. لن تكشف مجموعة من الأسئلة المصقولة ما إذا كان النظام سيتوقف عند الأدلة الناقصة، أم سيخترع قاعدة، أم يتجاوز الموافقة البشرية. الدليل الأقوى يبدأ بسير عمل محدود ويعيد إنشاء هذه الظروف في حالات قابلة للتكرار، مع تعريف النتيجة المقبولة والسلوك المحظور وطريقة الحكم قبل رؤية مخرجات النظام.

الخلاصة التنفيذية

  • حدّد سير العمل ونسخة النظام وقرار التقييم والشرائح والبوابات قبل جمع النتائج.
  • مثّل العمل المعتاد، ثم أضف عمداً الحدود المهمة والإخفاقات المتحققة والسلوكيات المحظورة.
  • سجّل لكل حالة الإعداد والأدلة والأدوات والبدائل المقبولة والمحظورات والمنشأ والإصدارات وطريقة التقييم.
  • اختر أضيق مقيّم صالح، ولا تسمح لمتوسط الجودة بتعويض إجراء محظور.
  • استخدم الحالات المرئية للتطوير، واحمِ اختبار الإصدار من المحتوى الذي يوجّه التعديل.

ما الذي ينبغي أن تغطيه مجموعة التقييم القائمة على السيناريوهات؟

يُظهر المنظر العلوي للطاولة مساراً مركزياً من بطاقات فارغة متصلاً بمجموعات حالات محيطة وعلامات دائرية ملونة.

ينبغي أن تغطي المجموعة مزيج العمل المعتاد وحدوده المؤثرة والإخفاقات المعروفة والسلوكيات المحظورة ضمن سير عمل واحد محدد. ثبّت أولاً نسخة النظام، والمستخدمين المسموح لهم، والمدخلات والمعرفة والأدوات والصلاحيات، والقرار الذي ستدعمه النتائج. بهذه الحدود يصبح ممكناً بناء حالات واقعية وتوثيق طريقة القياس، بدلاً من اختبار «مساعد عام» لا يملك تعريفاً مستقراً للنجاح أو الفشل.

ابنِ خريطة التغطية من سجلات عمل مصرح بها، وطلبات الدعم، وأبحاث المستخدمين، وسجلات الحوادث، وجولات الخبراء في خطوات العملية. قد تساعد البيانات التشغيلية أو التاريخية أو التخصصية أو الاصطناعية أو المنسقة بشرياً، لكن لا تفترض أن السجلات التشغيلية كاملة أو ممثلة أو مسموحاً بنسخها. عندما تكون المراقبة ناقصة أو يكون النظام قبل الإطلاق، دوّن أن نسب العمل العادي فرضيات تحتاج إلى مراجعة، ولا تمنحها دقة مصطنعة.

  • العمل الممثل: الحالات اليومية وأدوار المستخدمين والمدخلات والظروف بنسب تستند إلى أدلة التشغيل المتاحة.
  • الحالات الطرفية المهمة: الغموض والنقص والتعارض والملفات غير المعتادة وحدود الصلاحية وفشل الأدوات.
  • الإخفاقات المعروفة: إعادة إنتاج مصغرة ومصرح بها لعيب أو حادث أو شكوى تم التحقق منها.
  • السلوك المحظور: محاولات مباشرة أو غير مباشرة لدفع النظام إلى إفشاء أو تنفيذ أو قرار غير مسموح.

في مثال مساعد طلبات الشراء، تشمل الحالات العادية طلباً كاملاً وسياسة متاحة، بينما تختبر الحدود مستنداً ناقصاً أو معرفات موردين متعارضة أو حقيقة لازمة غير موجودة. وتغطي الحالات المحظورة طلب اعتماد الإنفاق أو تجاوز بوابة بشرية أو اتباع تعليمات مخفية داخل عرض السعر. هذه القواعد توضيحية وخاصة بالمؤسسة؛ المهم هو تحديد الشرائح وبوابات الحظر وقرار الإصدار قبل إنشاء المخرجات أو فحصها، ثم عرض النتائج حسب المهمة والشريحة والعاقبة.

خريطة تغطية قابلة للتكييف من دون افتراض أعداد متساوية أو معادلة أخذ عينات عامة
عائلة التغطيةالسؤال الذي تجيب عنهأدلة المصدر المحتملةمنطق الإدراج
العمل الممثلهل ينجز النظام العمل المتوقع في ظروفه المعتادة؟سجلات مصرح بها، وأبحاث المستخدمين، وجولات خبراء المجالقرّب المزيج المرصود، واحفظ الشرائح المهمة، وصرّح بما لا تعرفه
الحالات الطرفية المهمةهل يتصرف النظام بصورة سليمة عند الحدود الصعبة لكنها المشروعة؟تحليل سير العمل، وطلبات الدعم، ومراجعة الخبراءاختبر جانبي الحد حتى لا يتعلم النظام القبول أو الرفض بلا تمييز
الإخفاقات المعروفةهل عاد عيب متحقق بعد الإصلاح؟حوادث وشكاوى ومخرجات مفاجئة تم التحقق منهااستخدم إعادة إنتاج مصغرة بعد إزالة أو حماية المعلومات الحساسة
السلوك المحظورهل يمتنع النظام عن نتيجة أو إجراء حرّمته السياسة أو الصلاحيات؟نموذج التهديد، وسياسة المنتج، ومراجعة المخاطرأدرج المحاولات المحتملة عمداً ولا تدع ندرتها تستبعدها

كيف ينبغي تسجيل كل سيناريو تقييم؟

يوضع ملف ورقي مفتوح بداخله أوراق فارغة بجوار مجلد أبيض ومكعبات خشبية وعلامات حالة خضراء ورمادية وحمراء.

ينبغي تسجيل كل سيناريو كسجل حالة يستطيع مقيّم آخر إعادة إنشائه وفهم ما يعد نجاحاً أو بديلاً مقبولاً أو نتيجة محظورة. ابدأ بمعرف ثابت ومالك وسجل تغييرات ونسخة، ثم أضف عائلة التغطية والمهمة والشرائح والعاقبة والمنشأ وإثبات الإذن ومجموعة الانتماء. لا تضع رابطاً إلى سجل أصلي حساس إلا عندما تسمح ضوابط الوصول بذلك؛ فالغرض هو قابلية التكرار لا توسيع الاطلاع.

صف الممثل وهدفه، وحالة سير العمل عند البداية، والطلب والملفات والسياق السابق، والمعرفة المصرح بها، والأدوات والصلاحيات ونتائج الأدوات والظروف البيئية وتعليمات النظام. بعد ذلك افصل التوقعات عن الإعداد: ما الحقائق أو تغييرات الحالة المطلوبة، وما المسارات البديلة الصحيحة، ومتى يلزم الاستيضاح أو الامتناع أو الرفض أو التصعيد؟ وسجّل المخرجات والإفصاحات واستدعاءات الأدوات وتغييرات الحالة المحظورة في حقل مستقل.

  • الهوية: معرف ثابت ومالك وحالة ونسخة ومنشأ وإذن وشريحة ومجموعة مقصودة.
  • الإعداد: دور المستخدم والحالة الأولية والمدخلات والسياق والأدوات والصلاحيات والتعليمات.
  • التوقعات: حقائق ونتائج مطلوبة وبدائل مقبولة ومحظورات وقواعد تصحيح وبوابات.
  • التشغيل: عدد المحاولات عند الحاجة، وقاعدة التجميع، ومؤهلات المراجع، ومسار التحكيم، وإصدارات جميع المكونات.

إذا كان النظام غير حتمي أو متعدد الخطوات، حدّد مسبقاً عدد المحاولات عند الحاجة وكيف ستجمع نتائجها؛ لا تختَر القاعدة بعد رؤية أفضل تشغيل. ثبّت أيضاً إصدارات النموذج والموجه ومستودع الاسترجاع والأدوات والسياسة وحزمة الاختبار. يمكن لحل مرجعي صالح أن يثبت قابلية إنجاز المهمة ويفضح مقيّماً معطلاً، لكنه ليس النص الوحيد المقبول عندما تسمح المهمة بصياغات أو مسارات متعددة. سجل الحالة الكامل هنا تركيب تحريري قابل للتكييف، لا معياراً مفروضاً.

الحالة المفيدة لا تطرح سؤالاً صعباً فحسب؛ بل تعيد إنشاء عمل محدود وتجعل النجاح والبدائل المقبولة والمحظورات قابلة للفحص.

كيف نقيّم كل سيناريو من دون مكافأة السلوك الخطأ؟

يقيّم المراجعون البطاقات بعلامات ملونة في محطات منفصلة، بينما يضع المشغّل بطاقة تحذير أمام بوابة توقف ميكانيكية حمراء.

قيّم كل حالة بأضيق طريقة تستطيع التمييز بصورة صالحة بين النجاح والفشل. استخدم فحصاً حتمياً لحقائق أو مخطط بيانات أو عملية حسابية أو وسيطات أداة أو حالة سجل يمكن التحقق منها موضوعياً، مع التأكد من أن الفحص كامل وأن المهمة قابلة للحل. وإذا كانت الحقائق أو الحالة النهائية محدودة لكن الصياغات والمسارات متعددة، فقارن بالعناصر المطلوبة في مرجع بدلاً من المطابقة الحرفية لإجابة نموذجية واحدة.

للجودة المفتوحة، افصل الأبعاد مثل الاكتمال والاستناد إلى الأدلة ووضوح التفسير، واربط كل درجة بعلامات يمكن ملاحظتها وأمثلة. يمكن لمقيّم قائم على نموذج أن يساعد، لكنه يحتاج إلى معايرة بأحكام بشرية مؤهلة في السياق نفسه؛ وقد أفادت OpenAI بأن المقيّم الآلي في GDPval لم يكن موثوقاً بما يكفي ليحل محل المقيّمين المهنيين ذوي الخبرة. أما التفسير التخصصي أو المنظم فيبقى لدى أشخاص مخولين.

  • فحص حتمي للحقائق والحسابات والمخططات وحالات السجلات والإجراءات المحظورة.
  • حقائق أو حل مرجعي عندما تكون النتيجة محدودة وتظل طرق الوصول إليها متعددة.
  • قاعدة ذات أبعاد وعلامات مشاهدة عندما تكون الجودة مفتوحة ولا تختزل في مطابقة.
  • حكم خبير مؤهل عندما لا تستطيع الأدوات الآلية حسم التفسير أو العاقبة بصورة صالحة.

امنح رصيداً جزئياً فقط عندما تمثل مكونات المهمة تقدماً ذا معنى، وأظهر المكوّن الذي فشل. أما إفشاء محظور أو إجراء بلا صلاحية فيفشل بوابة مستقلة مهما كانت الإجابة مصقولة؛ وهذا تصميم تحريري يجب أن يحدده مالك المنتج ومالك المخاطر مسبقاً. ثبّت نسخة القاعدة ومنطق البوابة وتعريفات الشرائح وتجميع المحاولات وقاعدة القرار قبل مقارنة الأنظمة، وسجّل أي تعديل لاحق كنسخة تقييم جديدة.

كيف نساعد المراجعين على تطبيق معايير التقييم باتساق؟

يجلس المراجعون متباعدين إلى طاولة طويلة ويقارنون الملفات الفارغة بشبكات متطابقة من البطاقات الملونة، مع ملف للتحكيم في الوسط.

يتطلب الاتساق دليلاً موجزاً يضع المراجع داخل سير العمل قبل عرض المخرج. اشرح الغرض ودور المستخدم والأدلة المتاحة والسلوك المسموح وحدود المنتج ونسخة قاعدة التقييم، ثم عرّف علامات مشاهدة لكل درجة مع أمثلة إيجابية وسلبية وحالات عند الحد. أضف خيار «أدلة غير كافية» أو «يتعذر التقييم» حتى لا يضطر المراجع إلى منح درجة لحالة ناقصة أو بيئة معطلة.

  1. شغّل حالات معايرة قبل المراجعة الحية وكررها عند تغير المهمة أو السياسة أو القاعدة أو فريق المراجعين.
  2. أخفِ هوية النظام ورتّب المخرجات عشوائياً عندما يكون ذلك عملياً في المقارنات.
  3. اجمع الدرجات والمبررات بصورة مستقلة قبل أي نقاش جماعي.
  4. افحص الخلاف بحثاً عن حالة معيبة أو حد غامض أو سياق ناقص أو بدائل مشروعة.
  5. عيّن مالكاً للتحكيم واحفظ التصنيفات والمبررات ونسخة القاعدة والقرار النهائي.

الخلاف ليس ضوضاء يجب محوها تلقائياً. قد يكشف أن سؤال الحالة غير قابل للحل، أو أن المقيّم رفض بديلاً صحيحاً، أو أن المؤسسة لم تحسم بعد ما ينبغي للنظام فعله. صحّح العيب عندما تكون الأدلة واضحة، وارفع قرار المنتج أو السياسة إلى صاحبه المخول عندما لا تكون كذلك، ولا تفرض الإجماع إذا كانت عدة نتائج مقبولة فعلاً. يوفر حفظ المبررات مادة لإعادة معايرة المراجعين والمقيّمين الآليين لاحقاً.

كيف تظل مجموعة التقييم مفيدة خلال التطوير وقرار الإصدار؟

يوضع صندوق ملفات أخضر مفتوح وممتلئ بملفات فارغة بجوار صندوق أرشيف أزرق داكن محكم بواقيات زوايا وحبل مطاطي.

تظل المجموعة مفيدة بفصل حالات التطوير المرئية عن اختبار إصدار محمي، ثم إدارة التعرض والتكرار والإصدارات في سجل واحد. يستطيع الفريق تشغيل مجموعة التطوير مراراً لتحسين الموجهات والاسترجاع والأدوات والسياسة وسير العمل، لكن نتيجتها تظل دليل تطوير لأن الفريق تعلّم من حالاتها. أما اختبار الإصدار فيُعيّن قبل التشغيل المعتاد، ويُستخدم على نحو محدود للمقارنة النهائية أو قرار الإصدار.

لا يكفي اختلاف أسماء المجموعات. ابحث عن النسخ المتطابقة وشبه المتطابقة والسجلات المصدرية المشتركة وإعادة الصياغة والحالات الشقيقة الناتجة من قالب واحد، وتتبع الوصول إلى المحتوى والإجابات المرجعية والقواعد والنتائج. إذا ساهمت حالة محمية في تشخيص عيب أو اختيار تعديل، فانقلها إلى التطوير أو الانحدار وأضف بديلاً مستقلاً ذا نسخة جديدة. يمكن للاختبار المحمي تغطية فئة الإخفاق نفسها، لكن عبر حالة غير مكررة لم توجه الإصلاح.

  • سجّل مالك الحالة ومنشأها وإذن استخدامها ومجموعتها وتعرضها وآخر مراجعة.
  • أصدر نسخاً مترابطة من المحتوى والتصنيفات والقواعد والسياسة وحزمة التشغيل.
  • أضف الإخفاقات المتحققة بعد تقليل البيانات الحساسة وتأكيد السلوك المتوقع.
  • أعد فحص التغطية بعد تغير المستخدمين أو السياسة أو المعرفة أو النموذج أو الأدوات أو الصلاحيات.
  • احتفظ بسبب كل تغيير أو نقل أو تقاعد حتى تظل مقارنة النتائج قابلة للتفسير.

اعرض النتائج حسب عائلة المهمة والتغطية والشريحة والعاقبة والبوابة، لا كمتوسط منفرد. ولا توجد قاعدة عامة لعدد الحالات أو نسبة التقسيم أو فترة التحديث؛ فالتركيب يعتمد على قرار الإصدار وتنوع العمل والعواقب وموثوقية التصحيح والأدلة المصرح بها. اجتياز الاختبار غير المتصل دليل واحد، وليس شهادة بالقيمة أو السلامة أو العدالة أو الامتثال أو الجاهزية. اربطه بالمراقبة وأبحاث المستخدمين ومراجعة الحوادث، وأبقِ الأحكام المنظمة لدى أشخاص مؤهلين ومخولين.

أسئلة شائعة عن مجموعات تقييم الذكاء الاصطناعي

كيف أبني مجموعة بيانات لتقييم الذكاء الاصطناعي في سير عمل تجاري؟

ابدأ بتحديد سير العمل ونسخة النظام والقرار الذي ستدعمه النتائج، ثم ارسم عائلات المهام والتباينات والشرائح والعواقب. اجمع العمل الممثل والحالات الطرفية والإخفاقات المعروفة والسلوكيات المحظورة، وأنشئ لكل حالة سجلاً قابلاً للتكرار ومقيّماً صالحاً. افصل حالات التطوير عن اختبار الإصدار، وأدرهما في سجل ذي نسخ وتتبع للتعرض.

ما المقصود بتقييم الذكاء الاصطناعي القائم على السيناريوهات؟

هو اختبار سير عمل محدود ومدعوم بالذكاء الاصطناعي من خلال حالات تعيد إنشاء ممثل وهدف وحالة بداية ومدخلات وسياقاً وأدوات وصلاحيات. تحدد كل حالة النتائج المطلوبة والبدائل المقبولة والمحظورات وطريقة التصحيح، بحيث يستطيع شخص آخر إعادة تشغيلها وفهم سبب الحكم.

كم حالة يجب أن تتضمنها مجموعة تقييم الذكاء الاصطناعي؟

لا يوجد عدد عام صالح لكل نظام. يتوقف الحجم والتركيب على القرار المطلوب، وتنوع سير العمل، والشرائح ذات العواقب المهمة، وموثوقية المقيّمين، والأدلة المصرح باستخدامها. الأفضل إثبات التغطية وتوثيق الفجوات بدلاً من مطاردة رقم لا يعكس المخاطر.

هل أستخدم إجابات مرجعية أم قواعد تقييم؟

استخدم فحوصاً حتمية للنتائج الموضوعية، وحقائق أو حلولاً مرجعية عندما تكون المتطلبات محدودة لكن الصياغة مرنة. استخدم قواعد ذات أبعاد وعلامات مشاهدة للجودة المفتوحة، وحكماً بشرياً مؤهلاً عندما يتطلب القرار تفسيراً تخصصياً. لا تجعل إجابة مرجعية واحدة تستبعد بديلاً صحيحاً.

ما الفرق بين مجموعة تقييم التطوير واختبار الإصدار المحمي؟

مجموعة التطوير مرئية وتُشغّل مراراً لتوجيه التحسين، لذلك تقيس الأداء على أدلة تعلّم منها الفريق. اختبار الإصدار يُعيّن مسبقاً ويُحمى ويُستخدم بصورة محدودة لتقديم دليل مختلف. إذا وجّهت حالاته أو إجاباته أو قواعده أو نتائجه تغييراً مادياً، فإنه يفقد استقلاله لذلك التغيير ويجب استبدال الحالة أو إعادة تصنيفها.

ModelFold logo

هيئة تحرير ModelFold

نغطي كيف يحطّ الذكاء الاصطناعي فعلياً داخل الشركات. نبدأ من مصادر معلنة، ونفصل ما توصّلنا إليه عمّا نراه، ونستعين بالذكاء الاصطناعي في البحث وإعداد المسوّدات ضمن ضوابط تحريرية موثّقة. ولسنا بديلاً عن مراجعة خبير مختص.