Kernel

Kernel Scorers: سجل ومشغّل مقاييس تقييم مخرجات الذكاء الاصطناعي في BrightAI Kernel

دليل Scorer Registry في Kernel: 33 مقيّماً عبر خمس فئات (الدقة، الهلوسة، PII، الحقن، الامتثال)، أنواع PII السعودية العشر، control mapping للامتثال، ومشغّل تقييم تفاعلي يوضح الدرجة والحالة والأدلة لكل نتيجة.

آخر تحديث: عدّل على GitHub

الخلاصة السريعة

سجل الـ Scorers هو مجموعة 33 مقيّماً قياسياً (دقة 8 · هلوسة 6 · PII 4 · حقن 9 · امتثال 6) يحكم على جودة وسلامة مخرجات الذكاء الاصطناعي. كل نتيجة تعرض الدرجة والحالة والمتوقع والفعلي والخطورة والشرح والسياسة والـ Trace والتوصية والأدلة. تسريب PII حرج يمنع الإنتاج، وفشل أي Scorer يجعل التشغيل Incomplete، ولا تُعرض Compliant بدون ضوابط مرقّمة.

BrightAI Kernel
<p style="color: #9fb0c7; font-size: 1.1rem;">كل مخرج يُقاس — لا انطباع، بل أرقام وأدلة وضوابط</p>

الفكرة ببساطة

الـ Scorers هي مقاييس قياسية تختبر جودة وسلامة مخرجات الذكاء الاصطناعي. كل Scorer له هوية ثابتة: id، اسم، إصدار، فئة، وصف، مدخلات، مدى مخرجات (0-100)، خطورة، عتبة نجاح، نوع مُقيِّم (مطابقة حرفية / تشابه دلالي / حكم نموذج / قواعد حتمية)، ومتطلبات أدلة.

السجل الكامل يضم 33 مقيّماً موزعة على خمس فئات: الدقة (8)، الهلوسة (6)، خصوصية البيانات PII (4)، الحقن (9)، والامتثال التنظيمي (6). وكل نتيجة تشغيل تعرض الحقول التسعة: الدرجة، الحالة، المتوقع، الفعلي، الخطورة، الشرح، السياسة، الـ Trace، والتوصية — مع عمود أدلة مستقل.

وش تقدم الصفحة؟

  • سجل كامل: 33 مقيّماً بجداول فئوية مع فلترة بالبحث والفئة — واضغط أي مقيّم لعرض تفاصيله وضوابطه وأدلته
  • مشغّل تفاعلي (Runner): الصق مدخلاً ومخرجات أو اختر مثالاً جاهزاً، وشغّل التقييم على السجل كاملاً
  • نتائج من تسعة حقول: الدرجة، الحالة، المتوقع، الفعلي، الخطورة، الشرح، السياسة، Trace، التوصية + الأدلة
  • كشف PII حقيقي: أنماط حتمية لأنواع PII السعودية العشر (هوية، جوال، آيبان، بطاقة، ملف مريض…) تُنفَّذ فعلاً في المتصفح
  • Control Mapping: سكوررز الامتثال الستة مرتبطون بضوابط مرقّمة (PDPL م.12، NCA ECC-01، SDAIA DG-01…) — لا Compliant بدونها
  • القواعد الخمس: تسريب PII حرج يمنع الإنتاج · فشل Scorer = Run Incomplete · لا Compliant بلا mapping · الدرجة ليست بديلاً عن الدليل · Live/Demo/Simulated واضح

فئات الـ Scorers الـ33

الفئة العدد أمثلة
الدقة (Accuracy) 8 مطابقة حرفية · تشابه دلالي · دقة واقعية · اتباع التعليمات · اكتمال · جودة العربية · المصطلحات السعودية · معالجة المجهول
الهلوسة (Hallucination) 6 ادعاءات بلا سند · دقة الاستشهاد · تناقض داخلي · معايرة الثقة · ادعاءات تنظيمية مختلقة · تجاوز طبي/قانوني
خصوصية PII 4 كشف · تصنيف · صحة التعمية · تسريب في المخرجات (يمنع الإنتاج عند الحرجة)
الحقن (Injection) 9 حقن أوامر · كسر القيود · استخراج التعليمات · استخراج أسرار · أدوات غير مصرح بها · تجاوز سياسات · تلاعب بالسجل · تجاوز موافقة بشرية · تلاعب متعدد اللفات
الامتثال (Compliance) 6 PDPL · NCA ECC · SDAIA · SAMA · SFDA · ISO/IEC 42001 — كل واحد بضوابط مرقّمة

القواعد اللي يفرضها Kernel

  • تسريب PII حرج يمنع الجاهزية للإنتاج: فشل مقيّم sc-pii-leakage بحالة حرجة = Blocked — لا شهادة Passed أبداً
  • فشل Scorer يجعل الـ Run Incomplete: حتى فشل واحد فقط من الـ33 = تشغيل ناقص لا يُصدر شهادة
  • لا Compliant بدون control mapping: ادعاء الامتثال يمر فقط مع ضوابط مرقّمة وأدلة مرتبطة
  • الدرجة ليست بديلاً عن الدليل: كل نتيجة تحمل مقتطفات وضوابط وTrace — المدقق يقرأ الدليل لا الرقم
  • Live / Demo / Simulated واضح: شارة البيئة في كل نتيجة وملخص التشغيل — المقيّمون الحتميون (regex) حقيقيون، والبقية Simulated بشارة

ليش هذا مهم للمنشآت السعودية؟

السوق السعودي له خصوصية تنظيمية: الادعاء التنظيمي المختلق (مثل «المادة 99 من نظام PDPL») كارثة أمام جهة رقابية، وتسريب هوية وطنية في مخرج نموذج جريمة بحد ذاتها. الـ Scorers السعودية تكشف هذي الأنماط تحديداً: الأنماط الحتمية ترصد الهوية والآيبان والملفات الطبية، ومقيّمي الادعاءات التنظيمية المختلقة والتجاوز الطبي/القانوني يمنعون الأخطاء الأغلى تكلفة — كل ذلك بأدلة قابلة للعرض أمام NCA أو SDAIA أو SAMA.

خصوصية التجربة

السؤال الإجابة
هل بياناتي تُرسل لخادم؟ لا. كل العمليات تشتغل محلياً في المتصفح (vanilla JS) مع بيانات توضيحية.
هل التقييم حقيقي على نموذج؟ لا في الـ Demo. المقيّمون الحتميون (regex) يُنفَّذون فعلاً على النص، لكن مقيّمي llm-judge/hybrid/semantic محاكاة حتمية موسومة Simulated — لا ادعاء بتقييم نموذج حقيقي.
ليش لا تُعرض Compliant بدون ضوابط؟ لأن ادعاء الامتثال بلا mapping لا قيمة له أمام المدقق — الضوابط المرقّمة (PDPL م.12، ECC-01…) هي ما يثبت تغطية المعالجة.

نصيحة يزيد

من تجربتي مع الشركات السعودية:

ابدأ بمثال «تسريب هوية + جوال في المخرجات» في المشغّل — وشوف كيف مقيّم التسريب (sc-pii-leakage) يقلب التشغيل كله إلى Blocked ويمنع الجاهزية للإنتاج. بعدها جرّب مثال «الادعاء التنظيمي المختلق» وشوف مقيّم sc-hal-fabricated-reg يكشفه حرفياً. هذي الحالتان هما أهم ما يركز عليه المدقق السعودي عند مراجعة أي نموذج.

هل كانت هذه الوثيقة مفيدة؟

شاهد الحوكمة وهي تعمل على حالاتك الفعلية

احجز جلسة تعريفية لمراجعة احتياج منشأتك ومسار التطبيق المناسب.

احجز ديمو
العودة إلى مركز الوثائق