Kernel

Kernel Evaluation Engine: محرك تقييم مخرجات الذكاء الاصطناعي في BrightAI Kernel

دليل محرك التقييم في Kernel: 7 أنواع تشغيل (حالة واحدة، Dataset كامل، مجموعة فرعية، عينة، محادثة متعددة الأدوار، Agent محدود، إعادة الفاشل)، 15 مرحلة خط تشغيل، ضوابط pause/cancel/resume والحفظ الجزئي، وقاعدة لا Passed لشغل ناقص.

آخر تحديث: عدّل على GitHub

الخلاصة السريعة

محرك التقييم هو الطبقة اللي تشغّل الـ Datasets على الـ Scorers وتنتج قرار بوابة موثّق. سبعة أنواع تشغيل و15 مرحلة لكل حالة مع Trace، وضوابط تشغيل كاملة (توقف، إلغاء، استئناف، حفظ جزئي، concurrency، retry، timeouts، budget). القاعدة الأهم: لا Passed لشغل ناقص — أي تشغيل متوقف أو ملغي أو متجاوز الميزانية = Incomplete بلا شهادة.

BrightAI Kernel
<p style="color: #9fb0c7; font-size: 1.1rem;">شغّل، راقب، قِس، واحكم بقرار موثّق — لا انطباع، بل أرقام وأدلة وضوابط</p>

الفكرة ببساطة

محرك التقييم (Evaluation Engine) هو الطبقة التي تشغّل مجموعات البيانات (Datasets) على المقاييس (Scorers) وتنتج قرار بوابة موثّق. كل حالة تمر بـ 15 مرحلة موثقة بخط تشغيل كامل: تحميل Dataset، التحقق من صحة الحالات، إنشاء Evaluation Run، توليد Trace، فحص PII قبل الإرسال، فحص الحقن، تقييم المخاطر، تقييم السياسات، استدعاء النموذج، تقييم المخرجات، حساب التكلفة والزمن، توليد الدليل، تجميع النتائج، قرار البوابة، وتجهيز الشهادة.

الناتج ليس درجة واحدة بل قرار بوابة (اجتاز / اجتاز مع ملاحظات / يحتاج مراجعة بشرية / محظور / غير مكتمل) مع Trace ID فريد لكل حالة وقابل للمراجعة أمام الجهات الرقابية.

وش تقدم الصفحة؟

  • 7 أنواع تشغيل: حالة واحدة · Dataset كامل · مجموعة فرعية (قطاع/خطورة) · عينة حتمية بالبذرة · محادثة متعددة الأدوار · Agent بصلاحيات محدودة · إعادة تشغيل الحالات الفاشلة فقط
  • لوحة إعداد كاملة: اختر النوع، Dataset، النموذج، السياسة، الـ Scorers، وضوابط المحرك (concurrency · retries · provider/scorer timeout · budget · seed)
  • وحدة تشغيل حية: تقدم، مكتملة، فاشلة، حرجة، الحالة الجارية، التكلفة التراكمية، متوسط الزمن، P50/P95، عدد الأخطاء
  • خط تشغيل 15 مرحلة: مرئي أثناء التشغيل لكل حالة جارية (بانتظار / جارٍ / تم / متجاوز)
  • ضوابط كاملة: pause · cancel · resume · استئناف آخر تشغيل · إعادة الفاشل — والنتائج محفوظة جزئياً في كل لحظة
  • قرار بوابة: لا Passed لشغل ناقص · تسريب PII حرج = Blocked · فشل Scorer حرج = Incomplete · Live/Demo/Simulated واضح

أنواع التشغيل السبعة

النوع الوصف الاستخدام
حالة واحدة (Single) تشغيل حالة واحدة محددة من Dataset أو نص حر. فحص سريع لطلب معين أو نص مخصص.
Dataset كامل تشغيل كل حالات Dataset المختار بالترتيب. شهادة شاملة على المعيار السعودي (100 حالة).
مجموعة فرعية (Subset) الحالات المطابقة لفلتر قطاع/خطورة. اختبار قطاع واحد (مثل SAMA أو SFDA).
عينة (Sample) عينة عشوائية حتمية (بالبذرة) بعدد محدد. فحص سريع قابل لإعادة الإنتاج.
محادثة متعددة الأدوار محادثة بعدة رسائل — كل رسالة تمر بخط التشغيل. اختبار التلاعب متعدد اللفات.
Agent محدود Agent بأدوات مسموحة ونقطة توقف بشرية. اختبار صلاحيات الوكيل قبل الإنتاج.
إعادة الفاشل يعيد تشغيل الحالات الفاشلة فقط من Run سابق محفوظ. تحقق من إصلاح السياسة دون إعادة كل شيء.

القواعد اللي يفرضها Kernel

  • لا Passed لشغل ناقص: أي تشغيل متوقف أو ملغي أو متجاوز الميزانية = Incomplete، لا شهادة مهما كانت الدرجات
  • لا تُفقد النتائج عند توقف المزوّد: كل حالة تُحفظ فور اكتمالها (partial saving) ويمكن استئناف التشغيل من آخر حالة مكتملة
  • Budget limit يوقف التشغيل: عند تجاوز الحد بالريال السعودي يتوقف المحرك تلقائياً ويُحفظ الجزئي
  • Provider/Scorer timeout + retry: استدعاء المزوّد يُعاد بمحاولات محدودة مع backoff مضاعف
  • Live / Demo / Simulated واضح: المزوّد هنا Simulated حتمي بالبذرة، والفحوصات الحتمية (regex للـ PII والحقن) تُنفَّذ فعلاً

ليش هذا مهم للمنشآت السعودية؟

قبل اعتماد أي نموذج في الإنتاج، الجهة الرقابية السعودية (NCA، SDAIA، SAMA، SFDA) تحتاج إثباتاً: هل النموذج يسرّب بيانات شخصية؟ هل يختلق مواد تنظيمية؟ هل يتبع السياسات؟ محرك التقييم يجيب بأرقام وأدلة: يشغّل معيار Saudi Governance Benchmark على الـ Scorers الحتمية، يحسب التكلفة والزمن، ويخرج بقرار بوابة مع Trace قابل للمراجعة — وثيقة جاهزة لأي مدقق.

جرّب عملياً: شغّل Dataset كامل ثم أوقف التشغيل (pause) — شوف كيف يتحول القرار إلى Incomplete ولا تُصدر شهادة. ثم جرّب خانة «جرّب انقطاع المزوّد» — شوف كيف يعيد المحرك المحاولة ويحفظ كل حالة اكتملت، لتستأنف من حيث توقفت.

خصوصية التجربة

السؤال الإجابة
هل بياناتي تُرسل لخادم؟ لا. كل العمليات تشتغل محلياً في المتصفح (vanilla JS) مع بيانات توضيحية. النتائج المحفوظة في localStorage للجلسة فقط.
هل التقييم حقيقي على نموذج؟ لا في الـ Demo. المزوّد Simulated حتمي بالبذرة، والفحوصات الحتمية (regex للـ PII والحقن والادعاءات التنظيمية المختلقة) تُنفَّذ فعلاً. لا ادعاء بتقييم نموذج حقيقي.
ليش لا تُصدر شهادة من تشغيل ناقص؟ لأن الشهادة تعني اكتمالاً. لو توقف التشغيل أو أُلغي، فهناك حالات لم تُقيَّم — فلا يمكن الادعاء بأن النموذج اجتاز كل الحالات.

نصيحة يزيد

من تجربتي مع الشركات السعودية:

ابدأ بتشغيل Dataset كامل على المعيار السعودي وشوف قرار البوابة. بعدها جرّب أوقفه في منتصفه (pause ثم cancel) — هذا أهم درس: لا يمكن إصدار Passed من شغل ناقص، فالتشغيل الكامل هو الشرط الأول لأي شهادة. وأخيراً جرّب خانة انقطاع المزوّد لتتأكد أن النتائج لا تضيع وأن الاستئناف يشتغل — هذا بالضبط ما يسأل عنه المدقق السعودي عند مراجعة أي عملية تقييم.

هل كانت هذه الوثيقة مفيدة؟

شاهد الحوكمة وهي تعمل على حالاتك الفعلية

احجز جلسة تعريفية لمراجعة احتياج منشأتك ومسار التطبيق المناسب.

احجز ديمو
العودة إلى مركز الوثائق