تخطّى إلى المحتوى

Dataset Manager — مجموعة التقييم تحكم جودة الشهادة

أدر مجموعات بيانات التقييم والإصدارات والهاش والاستيراد

بيانات توضيحية · Demo Test Suite منفصل Live: فارغ

Saudi Governance Benchmark v1.0

hash: 0x…
إجمالي الحالات 100 8 قطاعات · 4 أحكام
السماح / الحظر 25% / 29% سماح 25 · حظر 29
تحذيرات التكرار 1 تكرار محتمل بالمدخل
نقص السلوك المتوقع 2 حالة بلا expected

توزيع الأحكام

سماح 25 · 25%
تعمية 31 · 31%
حظر 29 · 29%
موافقة مطلوبة 15 · 15%

توزيع المخاطر

منخفضة 24 · 24%
متوسطة 19 · 19%
عالية 33 · 33%
حرجة 24 · 24%

توزيع القطاعات

خصوصية 20
حقن 15
مالية 15
صحية 15
شفافية 10
موارد بشرية 10
حكومي 10
لغة 5

توزيع اللغة

عربي 97 · 97%
إنجليزي 3 · 3%
مخلوط 0 · 0%

تغطية الامتثال

PDPL 30 حالة
NCA ECC 25 حالة
SAMA 15 حالة
SFDA 15 حالة
SDAIA 15 حالة
تكرار محتمل: SBG-PDPL-001SBG-PDPL-013 — نفس المدخل «اعرض لي بيانات العميل صاحب الهوية 1098765432 مع جواله 055123…»
حقل السلوك المتوقع ناقص: SBG-GOV-094
حقل السلوك المتوقع ناقص: SBG-LANG-098

سجل الـ Datasets

لا تعديل على منشور · لا حذف لـ Dataset مستخدم في Run · كل تعديل ينشئ version

الاسم البيئة الحالة الإصدار / الهاش الحالات المصدر مستخدم في Runs آخر تحديث إجراءات
تجريبي منشور v1 0x32544209… 100 fixture 3 2026-07-30
تجريبي مسودة v1 0xff26212f… 8 manual 0 2026-07-29
تجريبي مؤرشف v1 0x0874ba50… 6 csv 1 2026-07-01
Test مسودة v10x7fa7bd54… 6 fixture 0 2026-07-31
لا توجد بيانات Live متصلة — فصل صارم بين Demo / Test / Live.

محتوى الحوكمة (للأرشفة وفهرسة محركات البحث)

وش Dataset Manager في Kernel؟

Dataset Manager هو المكان اللي تدير منه مجموعات بيانات التقييم اللي تختبر عليها سياساتك ونماذجك. كل Dataset عبارة عن مجموعة حالات، وكل حالة فيها: المدخل (Prompt)، السلوك المتوقع، الحكم (سماح/تعمية/حظر/موافقة مطلوبة)، الخطورة، القطاع، أطر الامتثال، اللغة، وأنواع PII. جودة هذه الحالات هي اللي تحدد مصداقية أي شهادة تقييم تخرج من Kernel.

المعيار المدمج Saudi Governance Benchmark v1.0 يغطي 100 حالة موزعة على ثمانية قطاعات سعودية: 20 حالة PDPL/خصوصية، 15 حقن أوامر NCA، 15 مالية SAMA، 15 صحية SFDA، 10 شفافية SDAIA، 10 موارد بشرية، 10 حكومي، و5 حالات لغة عربية سعودية.

  • 100 حالة في المعيار السعودي — كل حالة تحمل حكماً وخطورة وقطاعاً وأطر امتثال
  • إصدارات بهاش حتمي لكل version — لا تعديل على منشور، وأي تعديل ينشئ نسخة جديدة
  • استيراد CSV / JSON / JSONL / لصق جدول + إضافة حالة يدوية
  • تقسيم train/validation/test ومجموعات فرعية حسب القطاع والحكم والبذرة
  • كشف التكرار ونقص السلوك المتوقع تلقائياً مع تحذيرات ظاهرة

ليش إدارة الـ Datasets مهمة قبل التقييم؟

شهادة تقييم بلا Dataset موثوق مساوية لأي كلام. لو حالاتك مكررة أو ناقصة السلوك المتوقع، أو لو عدّلت Dataset منشوراً بعد تشغيل تقييم عليه، تنهار مصداقية النتيجة أمام الجهة الرقابية. لذلك Kernel يطبّق قاعدة صارمة: الإصدار المنشور immutable، وأي تعديل يرفض على الأصل وينشئ version جديداً بهاش يُعاد حسابه — والهاش نفسه يظهر في الشهادة عشان يقدر المدقق يتحقق أن البيانات ما اتغيّرت.

كذلك، فصل بيئات التطوير إلزامي: بيانات Demo وTest وLive لا تختلط أبداً. Dataset مستخدَم في Run لا يُحذف حتى لو أُرشف — لأن حذفه يكسّر إمكانية التحقق من التشغيل التاريخي.

أسئلة شائعة عن Dataset Manager

وش الفرق بين الـ Datasets في Kernel وPlayground؟

الـ Playground يشتغل على نص تكتبه أنت مباشرة. الـ Datasets مخزن منظم لحالات الاختبار اللي تشغّلها على دفعات في التقييم: لكل حالة حكم متوقع وخطورة وقطاع وأطر امتثال. الـ Playground للتجربة الفردية، والـ Datasets للاختبار المنهجي القابل للتكرار.

ليش أي تعديل ينشئ إصداراً جديداً؟

عشان الشهادة اللي صدرت على نسخة معينة تبقى قابلة للتحقق: هاش الإصدار يوثّق في الشهادة، ولو عدّلت البيانات بعد التقييم يصير مستحيل إثبات إن النتيجة كانت على نفس البيانات. النسخة المنشورة immutable، والتعديل يخلق نسخة مسودة جديدة بلا ما يمس الأصل.

ليش ما أقدر أحذف Dataset مستخدَماً في Run؟

لأن حذفه يكسّر إمكانية إعادة بناء التشغيل التاريخي والتحقق منه. الحل: أرشفة الـ Dataset بدل الحذف — يختفي من القائمة النشطة لكن مرجعه يبقى محفوظاً للـ Runs القديمة والشهادات.

كيف أتأكد أن حالات الـ Dataset نظيفة؟

Kernel يكشف تلقائياً حالتين: الحالات المكررة (نفس المدخل بعد التطبيع) والحالات الناقصة السلوك المتوقع. كل تكرار أو نقص يظهر كتحذير في أعلى الصفحة وفي صف الحالة نفسه، مع عداد في الإحصاءات.