مراحل خط التشغيل15من تحميل Dataset إلى تجهيز الشهادة
حالات المعيار السعودي100Saudi Governance Benchmark v1.0
المزوّدSimulatedحتمي بالبذرة — Live يتطلب backend + credential
إعداد التقييم
اختر نوع التشغيل، ثم حدد الـ Dataset والنموذج والسياسات والـ Scorers وضوابط المحرك. التقدير يظهر قبل التشغيل.
Demo · محلي بالكامل
نوع التشغيل
تشغيل حالة واحدة محددة من Dataset أو نص حر.
الأدوات المسموحة
الـ Scorers (10)
ضوابط المحرك
demo: المقيّمون الحتميون متزامنون — يُحفظ كإعداد مرجعي في سجل الـ Run
التقدير…
وحدة التشغيل
idle
⏳جاري تحميل البيانات…
⚠️حدث خطأ غير متوقع.
📡 وضع غير متصل — البيانات من التخزين المؤقت المحلي.
0 / 0
مكتملة0
فاشلة0
حرجة0
الحالة الجارية—
التكلفة التراكمية0.0000 SAR
متوسط الزمن0ms
P50 / P950 / 0 ms
P990 ms
الأخطاء0
مراحل خط التشغيل (الحالة الجارية)
النتائج
الحالة
العنوان
الحكم
الإجراء
المخاطر
التكلفة
الزمن
P50/P95/P99
المؤشرات
Trace
لا توجد نتائج بعد. شغّل تقييمًا ليرى النتائج هنا.
محتوى الحوكمة (للأرشفة وفهرسة محركات البحث)
وش محرك التقييم (Evaluation Engine) في Kernel؟
محرك التقييم هو الطبقة اللي تشغّل الـ Datasets على الـ Scorers وتنتج قرار بوابة موثّق. يدعم سبعة أنواع تشغيل: حالة واحدة (single)، Dataset كامل (dataset)، مجموعة فرعية بفلتر قطاع/خطورة (subset)، عينة حتمية بالبذرة (sample)، محادثة متعددة الأدوار (multi-turn)، Agent بصلاحيات محدودة (agent)، وإعادة تشغيل الحالات الفاشلة فقط من Run سابق (rerun-failed).
كل حالة تمر بـ 15 مرحلة موثقة بـ Trace: تحميل Dataset، التحقق من صحة الحالات، إنشاء Evaluation Run، توليد Trace، فحص PII قبل الإرسال، فحص الحقن، تقييم المخاطر، تقييم السياسات، استدعاء النموذج، تقييم المخرجات، حساب التكلفة والزمن، توليد الدليل، تجميع النتائج، قرار البوابة، وتجهيز الشهادة.
7 أنواع تشغيل تغطي كل سيناريو اختبار: فردي، جماعي، فرعي، عيّنة، محادثة، وكيل، إعادة الفاشل
لا Passed لشغل ناقص — التشغيل المتوقف أو الملغي أو المتجاوز الميزانية = Incomplete بلا شهادة
لا تُفقد النتائج عند توقف المزوّد — كل حالة تُحفظ فور اكتمالها
ليش محرك التقييم مهم قبل اعتماد أي نموذج؟
قبل ما تضع نموذجاً في الإنتاج، تحتاج إجابة موثقة: هل النموذج يسرّب بيانات شخصية؟ هل يختلق مواد تنظيمية سعودية؟ هل يتبع السياسات؟ محرك التقييم يجيب على هذا بأرقام وأدلة: يشغّل Dataset المعيار السعودي (Saudi Governance Benchmark) على الـ Scorers الحتمية، يحسب التكلفة والزمن، ويخرج بقرار بوابة (Passed / Passed-with-findings / Review-required / Blocked / Incomplete) مع Trace قابل للمراجعة.
القواعد صارمة: تسريب PII حرج في المخرجات = Blocked (يمنع الإنتاج)، فشل Scorer حرج = Incomplete (لا شهادة)، وأي تشغيل متوقف أو ملغي أو متجاوز الميزانية = Incomplete — لا يوجد أي مسار يصدر Passed من شغل ناقص مهما كانت الدرجات. هذا يضمن أن الشهادة تعني فعلاً أن كل الحالات اكتملت ونُجحت بالحدود المطلوبة.
أسئلة شائعة عن محرك التقييم
وش الفرق بين محرك التقييم والـ Scorers؟
الـ Scorers هي المقاييس (33 مقيّماً على 5 فئات) تحكم على مخرج واحد. محرك التقييم يشغّل Dataset كامل (مئات الحالات) عبر الـ Scorers بضوابط تشغيل (توقف، استئناف، ميزانية) ويجمّع النتائج في قرار بوابة موثّق. السكوررز تجيب «هل هذا المخرج زين؟» والمحرك يجيب «هل هذا النموذج جاهز للاعتماد؟».
ليش لا يُصدر Passed لتشغيل ناقص؟
لأن الشهادة تعني اكتمالاً. لو توقف التشغيل أو أُلغي أو تجاوز الميزانية، فهناك حالات لم تُقيَّم — فلا يمكن الادعاء بأن النموذج اجتاز كل الحالات. أي تشغيل ناقص يخرج بحالة Incomplete ولا تُصدر شهادة، مهما كانت درجات الحالات المكتملة.
وش يصير لو توقف المزوّد أثناء التشغيل؟
لا تُفقد النتائج. كل حالة تُحفظ فور اكتمالها في التخزين المحلي (partial saving)، ويمكن استئناف التشغيل من آخر حالة مكتملة عبر زر الاستئناف. سياسة إعادة المحاولة (retry مع backoff) تعيد استدعاء المزوّد، وإذا فشل نهائياً تُحتسب الحالة خطأً ويُحفظ كل ما اكتمل.
وش يعني قرار البوابة Blocked؟
Blocked يعني اكتشاف تسريب PII حرج في مخرجات الحالات — النموذج سرّب هوية وطنية أو جوالاً أو آيباناً في مخرجاته. هذا يمنع الجاهزية للإنتاج نهائياً حتى تُصلح السياسة أو تُعاد المعالجة، وتظهر التوصية بإعادة التشغيل بعد الإصلاح.