معلومات واضحة وقائمة على المصادر لبرامج الذكاء الاصطناعي في الأعمال.

ابحث في استراتيجية الذكاء الاصطناعي أو الأتمتة أو الحوكمة...
فتح القائمة أو إغلاقها

تقييم الذكاء الاصطناعي

كيف تبني مجموعة تقييم قائمة على السيناريوهات لنظام ذكاء اصطناعي في العمل؟

منهج عملي لبناء مجموعة تقييم قائمة على السيناريوهات لنظام ذكاء اصطناعي في العمل، من خريطة التغطية وسجل الحالة إلى التحكيم واختبار الإصدار المحمي.

يجتمع فريق عمل حول طاولة خشبية لفحص مسار مادي مكوّن من بطاقات فارغة ومجموعات حالات ملونة وملفات ومظروف مختوم.

مجموعة التقييم المفيدة لا تبدأ بكومة أسئلة تبدو صعبة، بل تبدأ بمشهد عمل محدد يمكن إعادته وفحص نتيجته. تخيل مساعداً داخلياً لاستقبال طلبات الشراء: وصل إليه طلب مقنع، لكن رقم المورد يختلف بين النموذج وعرض السعر، وخدمة استرجاع السياسة لا تعمل، كما يتضمن الملف المرفوع تعليمات موجهة إلى المساعد نفسه. أمثلة العرض المصقولة قد تمنحه درجة رائعة، لكنها لن تكشف هل سيطلب دليلاً ناقصاً، أم يخترع قاعدة، أم يتجاوز خطوة اعتماد بشرية.

الخلاصة التنفيذية

  • حدد مسار عمل واحداً وقرار التقييم وشرائحه وبواباته قبل جمع أي نتائج.
  • مثّل العمل المعتاد، ثم أضف عمداً الحدود المهمة والإخفاقات المؤكدة والسلوكيات المحظورة.
  • سجل لكل حالة نقطة البداية والأدلة والأدوات والنتائج المقبولة والمحظورات وطريقة التقدير والإصدارات.
  • استخدم أضيق مقيم صالح، ولا تسمح للمتوسط أو الدرجة الجزئية بتعويض إجراء محظور.
  • استخدم الحالات المرئية للتطوير، واحم حالات اختبار الإصدار ما دامت لم توجه التعديلات.

الهدف هو إنتاج دليل يساعد أصحاب المنتج والمخاطر على اتخاذ قرار معلوم، لا شهادة عامة بأن النظام جيد أو آمن. لذلك يجب تثبيت ما سيعد نجاحاً، وما سيعرض منفصلاً، وما سيوقف الإصدار قبل مشاهدة مخرجات النظام المرشح. ويظل مثال طلبات الشراء توضيحياً؛ فصلاحيات المساعد، وسياسة الموافقات، وطبيعة المستندات، والمحظورات الفعلية تختلف من مؤسسة إلى أخرى.

ما الذي ينبغي أن تغطيه مجموعة التقييم بالسيناريوهات؟

يظهر من أعلى الطاولة مسار مركزي من بطاقات فارغة متصل بمجموعات حالات محيطة وعلامات دائرية ملونة.

ينبغي أن تغطي المجموعة مزيج العمل المتوقع، والحدود المهمة، والإخفاقات المعروفة، والسلوكيات المحظورة داخل مسار محدد. ابدأ بإصدار واحد من النظام، ومستخدمين مسموح لهم، ومدخلات ومعرفة وأدوات وصلاحيات معلومة، وقرار واضح سيستفيد من النتيجة. التقييم الواقعي يحتاج إلى حالات تمثل ظروف الاستخدام المتوقعة، لكنه يحتاج أيضاً إلى حالات نادرة ذات عاقبة مهمة قد تختفي تماماً لو تركت التغطية لنسب المرور المعتادة وحدها.

ابن خريطة التغطية من أدلة عمل مصرح بها: سجلات تشغيل مناسبة، وطلبات دعم، وبحث مستخدمين، وسجلات حوادث، وجولات شرح مع خبراء المجال. يمكن استخدام حالات تاريخية أو مصطنعة أو منسقة بشرياً أيضاً؛ نوع المصدر لا يضمن الجودة. دوّن منشأ كل حالة، وصحة وسمها، ومدى تمثيلها، وأي نقص في التسجيل. ولا تنقل بيانات شخصية أو سرية أو مرخصة إلى المجموعة قبل التحقق من صلاحية استخدامها وتقليل محتواها وضبط الوصول إليها.

  • حدد عائلات المهام والأدوار وأنواع الملفات واللغات وحالات الأدوات ذات الصلة الفعلية بالمسار.
  • قدّر مزيج العمل العادي من دليل موثوق، أو صفه بوضوح كافتراض قبل الإطلاق إذا لم تتوافر حركة تشغيلية.
  • اختبر جانبي كل حد مهم حتى لا يتعلم النظام الرفض دائماً أو التنفيذ دائماً.
  • ثبت الشرائح وبوابات السلوك المحظور وقرار الإصدار قبل توليد المخرجات أو فحصها.

في مثال مساعد طلبات الشراء، تشمل الحالات العادية طلباً مكتملاً متسقاً وسياسة حالية متاحة. ثم تضاف حالات لوثيقة ناقصة، أو مبالغ ومعرفات مورد متعارضة، أو حقيقة لازمة لا توجد في الأدلة المصرح بها، أو تعطل الاسترجاع، أو تعليمات مزروعة داخل عرض السعر. وتضاف أيضاً محاولة لتجاوز الاعتماد البشري، ونسخة مصغرة من إخفاق سابق بعد التحقق منه وإزالة التفاصيل الحساسة.

خريطة قابلة للتكييف لعائلات التغطية، من دون افتراض أعداد متساوية أو معادلة أخذ عينات عامة.
عائلة التغطيةالسؤال الذي تجيب عنهأدلة محتملة للحالاتمنطق الإدراج
العمل التمثيليهل ينجز النظام العمل المعتاد المتوقع؟سجلات مصرح بها، وبحث مستخدمين، وجولات خبراءيعكس المزيج المرصود مع توثيق فجوات البيانات
الحالات الطرفية المهمةماذا يحدث عند حدود صحيحة لكنها صعبة؟استثناءات المسار، وتنوع الملفات، ونتائج الأدواتتدرج عمداً بحسب العاقبة لا بحسب التكرار وحده
الإخفاقات المعروفةهل عاد عيب سبق إثباته؟حوادث وشكاوى ونتائج مفاجئة تم التحقق منهاتحفظ كنسخة مصغرة ومصرح بها لاختبار الانحدار
السلوكيات المحظورةهل يحترم النظام حدود المنتج والصلاحيات؟سياسات معتمدة ونموذج الصلاحيات وتحليل المخاطرتختبر مباشرة وبصورة غير مباشرة كبوابات مستقلة

هذه العائلات الأربع تركيب تحريري يجمع أفكاراً متوافقة من عدة إرشادات، وليست تصنيفاً رسمياً تفرضه جهة واحدة. لا يعني وجود أربع عائلات توزيع الحالات بالتساوي بينها. المطلوب أن تعكس الحالات العادية العمل المرصود بقدر معقول، بينما تحصل الحدود ذات العواقب الكبيرة والمحظورات على حضور مقصود. واعرض النتائج حسب عائلة المهمة والشريحة والعاقبة والبوابة حتى لا يخفي المتوسط خللاً مركزاً في فئة بعينها.

كيف تسجل كل سيناريو بحيث يمكن تكراره؟

يوضع ملف ورقي مفتوح يحتوي على أوراق فارغة بجانب مجلد أبيض ومكعبات خشبية وعلامات حالة خضراء ورمادية وحمراء.

يسجل السيناريو الجيد كل ما يحتاجه مقيم آخر لإعادة نقطة البداية وتحديد المقبول والمحظور وتطبيق قاعدة التقدير نفسها. امنح الحالة معرفاً ثابتاً ومالكاً وتاريخ تغيير وعائلة تغطية وعائلة مهمة ووسوم شرائح وعاقبة ومصدر بيانات وسجل تصريح وعضوية مجموعة. بعد ذلك وثق دور المستخدم وهدفه، وحالة المسار الأولية، والطلب والملفات والسياق السابق، والمعرفة والأدوات والصلاحيات ونتائج الأدوات والتعليمات المتاحة للنظام.

  • الهوية: معرف الحالة، وإصدار المجموعة، والمالك، والحالة، وسجل التغييرات، وعضوية التطوير أو اختبار الإصدار.
  • الإعداد: الممثل والهدف، وحالة العمل، والمدخلات، والسجل السابق، والمعرفة المصرح بها، والأدوات والصلاحيات والظروف.
  • التوقعات: الحقائق أو تغييرات الحالة المطلوبة، والبدائل المقبولة، ومتى يلزم الاستيضاح أو الامتناع أو الرفض أو التصعيد.
  • المحظورات: المخرجات والإفصاحات واستدعاءات الأدوات والإجراءات وتغييرات الحالة التي لا يجوز حدوثها.
  • التشغيل: نوع المقيم والسلم والبوابات والحل المرجعي عند الحاجة، وإصدارات النموذج والمطالبة والاسترجاع والأدوات والسياسة وحزمة الاختبار.

لا تختزل مهمة مفتوحة في إجابة نموذجية واحدة. قد يكون المطلوب أن يذكر المساعد حقائق بعينها، ويميز النص المسترجع عن حقيقة غير محسومة، ثم يوجه الطلب إلى خطوة بشرية؛ ويمكن لصيغ وترتيبات متعددة أن تحقق ذلك. الحل المرجعي العامل مفيد لإثبات أن الحالة قابلة للحل وللتأكد من أن المقيم يلتقط المطلوب، لكنه لا يحول أسلوبه أو مساره إلى الإجابة الصحيحة الوحيدة.

حالة التقييم المفيدة لا تطرح سؤالاً صعباً فقط؛ إنها تعيد إنشاء قطعة عمل محدودة وتجعل النجاح والبدائل المقبولة والمحظورات قابلة للفحص.

إذا كان النظام غير حتمي أو متعدد الخطوات، فحدد قبل رؤية النتائج عدد المحاولات الملائم للقرار وكيف ستجمع أحكامها، من دون افتراض رقم عام لكل نظام. سجل أيضاً مؤهلات المراجع وإصدار المعايرة ومسار التحكيم والقيود المعروفة. قد يفشل السيناريو لأن بيئته معطلة أو نهايته غير قابلة للوصول، ولذلك يجب أن يسمح السجل بفصل عيب النظام عن عيب الحالة أو الأداة أو المقيم.

كيف تقدر السيناريو من دون مكافأة السلوك الخطأ؟

يقيّم المراجعون البطاقات بعلامات ملونة في محطات منفصلة، بينما يضع المشغّل بطاقة تحذير أمام بوابة توقف ميكانيكية حمراء.

اختر أضيق طريقة تقدير تستطيع فعلاً التمييز بين النجاح والإخفاق، وافصل المحظورات عن درجة الجودة القابلة للتعويض. استخدم فحصاً حتمياً عندما تكون الإجابة أو البنية أو الحساب أو وسيطة الأداة أو حالة السجل قابلة للتحقق موضوعياً. وافحص الفحص نفسه: قد يكون دقيق التنفيذ لكنه ناقص أو مبنياً على حالة يستحيل حلها أو يسمح للنظام باختصار غير مقصود.

  • استخدم الحقائق أو الحلول المرجعية عندما تكون الأدلة أو النتيجة النهائية محددة لكن الصياغات والمسارات متعددة.
  • استخدم سلماً ذا أبعاد منفصلة ونقاط ارتكاز قابلة للملاحظة للصفات المفتوحة مثل الاكتمال والفائدة والاستناد إلى الأدلة.
  • عاير المقيم القائم على نموذج بأحكام بشرية مؤهلة في السياق نفسه، ولا تفترض موضوعيته لمجرد اتفاقه مع حالات التطوير.
  • استخدم خبير مجال مخولاً عندما يتطلب الحكم تفسيراً لا يستطيع الفحص الآلي حسمه بصورة صالحة.
  • اسمح بدرجة جزئية للمكونات المفيدة، مع إبقاء الإفصاح أو الإجراء المحظور بوابة مستقلة غير قابلة للتعويض.

التقدير الموجه إلى النتيجة غالباً أقل هشاشة من اشتراط مسار حرفي واحد، لكن بعض المسارات تفرض فعلاً ترتيباً أو موافقة أو أداة بعينها. في مساعد الشراء، قد يحصل الرد على رصيد لأنه اكتشف المستند الناقص وصاغ ملاحظة واضحة، لكنه لا يمر إذا وافق الإنفاق أو كشف بيانات طلب آخر. تعريف هذه البوابة توصية تشغيلية؛ ويجب أن يحدد أصحاب المنتج والمخاطر المخولون المحظورات وعاقبة الإخفاق قبل المقارنة.

ثبت إصدار السلم ومنطق البوابات وتعريف الشرائح وطريقة جمع المحاولات وقاعدة القرار قبل عرض مخرجات المرشحين. وإذا كشف العمل أن معياراً غير صالح، صححه وسجل التغيير كتقييم جديد بدلاً من تعديل القاعدة بصمت لإنقاذ نتيجة مفضلة. أفادت OpenAI في عمل GDPval بأن مقيمها الآلي لم يكن موثوقاً بما يكفي لاستبدال المقيمين المهنيين؛ وهذا مثال على ضرورة إثبات صلاحية المقيم للمهمة، لا حكماً عاماً على كل تقدير آلي.

كيف يطبق المراجعون المعايير باتساق؟

يجلس المراجعون متباعدين إلى طاولة طويلة ويقارنون الملفات الفارغة بشبكات متطابقة من البطاقات الملونة، مع ملف للتحكيم في المنتصف.

يطبق المراجعون المعايير باتساق أكبر عندما يحصلون على دليل قصير يشرح غرض المسار ودور المستخدم والأدلة المتاحة والسلوك المسموح وحدود المنتج وإصدار السلم قبل عرض المخرج. عرّف لكل درجة علامات يمكن ملاحظتها، وأرفق أمثلة إيجابية وسلبية وحدية. وأضف خياراً واضحاً لعدم إمكان التقدير عندما تكون الحالة ناقصة أو الأدلة معيبة، حتى لا يتحول خلل الاختبار إلى حكم سلبي على النظام.

  • شغّل حالات معايرة قبل المراجعة الفعلية، وكررها عند تغير مزيج المهام أو السياسة أو السلم أو مجموعة المراجعين.
  • أخف هوية النظام ورتب المخرجات بصورة معماة حيث يكون ذلك عملياً في المقارنات.
  • اجمع الأحكام المستقلة ومبرراتها قبل النقاش حتى لا يمحو رأي أول ملاحظات الآخرين.
  • عيّن مالكاً للتحكيم، واحفظ الحكم والمبرر وإصدار السلم والنتيجة النهائية.

لا تتعامل مع الخلاف كضوضاء يجب التخلص منها فوراً. قد يكشف حالة غير قابلة للحل، أو حداً غامضاً بين درجتين، أو سياقاً ناقصاً، أو بدائل صحيحة متعددة، أو قرار منتج لم يتخذه أصحابه بعد. افحص المسار والدرجة والحالة والبيئة قبل نسبة الاختلاف إلى ضعف النظام. وإذا كانت عدة نتائج مقبولة فعلاً، وسع تعريف المقبول بدلاً من فرض اتفاق مصطنع حول صياغة واحدة.

الإجراء الكامل المقترح هنا تركيب عملي، وليس بروتوكولاً عاماً تفرضه المصادر. توضح ممارسات منشورة قيمة سياق المهمة والأمثلة والسلالم التفصيلية والتقدير المعمى وتحليل الخلاف، لكنها لا تحدد عدداً ثابتاً من المراجعين أو جولة معايرة موحدة. صمم الإجراء بحسب عاقبة القرار وتخصص المهمة، واحتفظ بالأحكام البشرية ومبرراتها حتى يمكن مراجعة السلم وإعادة معايرة أي مقيم آلي لاحقاً.

كيف تظل مجموعة التقييم مفيدة أثناء التطوير وعند الإصدار؟

يوضع صندوق ملفات أخضر مفتوح وممتلئ بملفات فارغة بجانب صندوق أرشيف أزرق داكن محكم بواقيات زوايا وحبل مطاطي.

تظل المجموعة مفيدة عندما تفصل بين حالات تطوير مرئية تدعم التكرار واختبار إصدار محمي يستخدم باعتدال كدليل نهائي. يمكن للفريق تشغيل مجموعة التطوير مراراً أثناء تعديل المطالبة أو الاسترجاع أو الأدوات أو السياسة أو سير العمل، لكن درجتها تصبح دليل تطوير لأن الفريق تكيف مع حالاتها. أما اختبار الإصدار فيعين قبل التشغيل المعتاد ولا ينبغي أن تقود حالاته أو إجاباته أو سلالمه أو نتائجه عملية التحسين.

  • عين عضوية المجموعة عند دخول الحالة إلى السجل، لا بعد رؤية أداء النظام عليها.
  • ابحث عبر المجموعتين عن التكرار الحرفي وشبه التكرار والسجلات المصدرية المشتركة وإعادة الصياغة وأشقاء القالب الواحد.
  • تتبع من وصل إلى محتوى الحالة والإجابة المرجعية والسلم والنتائج، بما في ذلك الأدوات الآلية.
  • إذا أثرت حالة محمية مادياً في تعديل، انقلها إلى التطوير أو الانحدار وأضف بديلاً مستقلاً ذا إصدار جديد.
  • اختبر فئة الإخفاق نفسها في الإصدار بحالة مستقلة لم توجه التشخيص أو الإصلاح.

لا توجد نسبة تقسيم أو سعة أو مدة صلاحية واحدة تصلح لكل نظام. يعتمد الحجم والتركيب على قرار الإصدار وتنوع المسار والشرائح ذات العواقب المهمة وموثوقية التقدير والأدلة المصرح بها. كما تتآكل مجموعات التحقق والاختبار مع كثرة الاستخدام. لذلك لا يكفي إبقاء اسم الحالة داخل خانة محمية؛ الاستقلال يتطلب ضبط المحتوى والإجابات والسلالم والنتائج والانكشاف الفعلي لها.

حافظ على سجل للإصدارات يضم مالك الحالة ومصدرها وتصريحها وعضوية المجموعة والانكشاف وتاريخ المراجعة وسبب التعديل أو التقاعد. راجع التغطية عندما يتغير المسار أو المستخدمون أو السياسة أو قاعدة المعرفة أو النموذج أو المطالبة أو الأدوات أو الصلاحيات أو بيئة التشغيل. أضف الإخفاقات المؤكدة بعد تقليل البيانات والتحقق من السلوك المتوقع، وافحص المراجع القديمة والأوسمة الخاطئة والمهام الغامضة والمقيمات التي ترفض بدائل صحيحة.

اعرض نتائج الإصدار حسب عائلة المهمة والتغطية والشريحة والعاقبة والبوابة، ولا تجعل المتوسط ملخص القرار الوحيد. النجاح غير المتصل دليل واحد فقط؛ فهو لا يثبت وحده القيمة التجارية أو السلامة أو العدالة أو الامتثال أو الجاهزية للإنتاج. اربطه بالمراقبة وبحث المستخدمين ومراجعة الحوادث وأدلة التشغيل المناسبة. وتبقى القرارات القانونية والطبية والمالية والوظيفية والأمنية والخصوصية وغيرها من الأحكام المنظمة أو عالية العواقب لدى أشخاص مؤهلين ومخولين.

أسئلة شائعة عن مجموعات تقييم الذكاء الاصطناعي

إزاي أبني مجموعة بيانات لتقييم نظام ذكاء اصطناعي في الشغل؟

حدد أولاً مسار العمل وإصدار النظام والقرار المطلوب دعمه. ارسم عائلات المهام والاختلافات، ثم اجمع عملاً تمثيلياً وحدوداً مهمة وإخفاقات مؤكدة ومحظورات، وسجل كل حالة بطريقة قابلة للتكرار. بعد ذلك اختر المقيمين، وافصل حالات التطوير عن اختبار الإصدار، وحافظ على سجل للإصدارات والانكشاف.

ما المقصود بتقييم الذكاء الاصطناعي بالسيناريوهات؟

هو اختبار مسار عمل محدود باستخدام حالات تعيد إنشاء موقف يمكن تكراره، بدلاً من الاكتفاء بأسئلة منفصلة. تحدد كل حالة الممثل ونقطة البداية والمدخلات والسياق والأدوات والنتائج المطلوبة والبدائل المقبولة والمحظورات وطريقة التقدير.

مجموعة تقييم الذكاء الاصطناعي تحتاج كام حالة؟

لا يوجد عدد عام مدعوم يصلح لكل نظام. يتحدد الحجم بحسب قرار الإصدار وتنوع العمل والشرائح المهمة وعواقب الإخفاق وموثوقية التقدير والأدلة المصرح بها. الأهم أن تعرف ما الذي تغطيه المجموعة وما الذي ما زال مجهولاً.

أستخدم إجابة مرجعية ولا سلم تقييم؟

استخدم فحصاً حتمياً للنتائج الموضوعية، وحقائق أو حلاً مرجعياً عندما تكون النتيجة محددة لكن التعبير عنها متنوع. استخدم سلماً ذا نقاط ارتكاز للجودة المفتوحة، وحكماً خبيراً عندما يلزم تفسير تخصصي. لا تجعل الحل المرجعي الصياغة الوحيدة إذا كانت البدائل صحيحة.

ما الفرق بين مجموعة التطوير واختبار الإصدار المحمي؟

مجموعة التطوير مرئية وتستخدم مراراً لتحسين النظام، لذلك تعكس الأداء على حالات عرفها الفريق. اختبار الإصدار منفصل ويستخدم باعتدال لتقديم دليل لم يوجه التعديل. إذا أثرت حالة محمية أو إجابتها أو نتيجتها مادياً في تغيير، تفقد استقلالها وتنتقل إلى التطوير أو الانحدار.

ModelFold logo

هيئة تحرير ModelFold

نرصد كيف يحطّ الذكاء الاصطناعي فعلًا داخل الشركات. ينطلق عملنا من مصادر محددة، ويفصل بين ما توصلنا إليه وما نراه، ويستعين بالذكاء الاصطناعي في البحث والصياغة وفق ضوابط تحريرية موثقة. ولسنا بديلًا عن مراجعة خبير مختص.