الخلاصة

  • يقترح draft-abak-ai-evaluation-claim-preservation-00 متطلبات لإبقاء الإسناد والمعنى والنطاق والقيود الجوهرية عند تحويل أدلة تقييم الذكاء الاصطناعي.
  • اسم العرض أو البصمة التي يعلنها المصدر لا يثبتان أن النموذج أو الحاوية أو البيانات المشار إليها هي التي نُفذت؛ يحتاج هذا الاستنتاج إلى إجراء تحقق محدد وأدلة تقبلها الجهة المستهلكة.
  • صحة الغلاف أو التوقيع لا ترفع الادعاء المعلن إلى هوية متحققة، ولا تحول نتيجة منقولة إلى قرار مخول أو أثر منفذ.

الاسم ليس هوية تنفيذ

قد يكتب مشغل التقييم اسماً معروفاً في حقل النموذج. وقد يضيف بصمة لحاوية أو ملف أوزان. يستطيع المحول نقل الحقلين بلا تغيير، ثم توقيع السجل الناتج. كل ذلك مفيد لتتبع ما قاله المصدر.

لكنه لا يجيب وحده عن سؤال مختلف: ما البايتات التي عملت بالفعل؟

المراجعة 00 تطلب التمييز بين الأسماء المعروضة والتصريحات من جهة، والهويات التي أثبتها إجراء تحقق محدد من جهة أخرى. إذا كان الاستنتاج يتطلب checkpoint بعينه أو إعداداً أو dataset أو harness أو بيئة تشغيل، فعلى profile أن يحدد الدليل اللازم لذلك الاستنتاج.

غياب الدليل يمنع الاستنتاج القوي، لكنه لا يمنع حمل ادعاء أضيق. يمكن القول: «المصدر أعلن الاسم كذا وقدم البصمة كذا». لا يجوز تحويل العبارة إلى: «تحققنا من أن تلك الأوزان هي التي نُفذت».

هذا الفصل يحمي السجل من تضخم لغوي شائع. كل مرحلة تنقل التصريح نفسه، فيبدو تكراره عبر أنظمة متعددة كأنه تحقق مستقل. الواقع أن الأنظمة قد تكون كلها تعيد نشر الادعاء الأصلي.

البصمة تعرف البايتات لا قواعد تفسيرها

حتى حين تكون البصمة قد أُعيد حسابها فعلاً، فهي تحدد مجموعة بايتات تحت خوارزمية وقاعدة اختيار معلومتين. لا تحدد بذاتها القواعد الدلالية المستخدمة في تفسير تلك البايتات.

حساب hash لملف JSON الأصلي يختلف عن حسابه لتمثيل canonical. يجب تسمية الخوارزمية، واختيار البايتات، وقاعدة canonicalization. وإلا فقد يستخدم طرفان القيمة بوصفها «بصمة المحتوى» بينما يشيران إلى عمليتين مختلفتين.

كما يجب التمييز بين بصمة أعاد actor حسابها من بايتات متاحة له، وبصمة نسخها من تقرير طرف آخر، وحالة لا تتوفر فيها معرفة بالبصمة. قد تتساوى السلسلة السداسية في الحالتين الأوليين، لكن المعرفة التي يملكها كل طرف ليست متساوية.

وإذا كانت مراجعة format الأصلية مجهولة، فيجب أن تبقى مجهولة. لا يجوز افتراض النسخة الحالية لمجرد أنها أسهل في التفسير. إصدار جديد يحمل اسم الحقل نفسه قد يغير معنى metric أو direction أو scale.

اكتمال العملية ليس نجاح المعيار

يعرض المشروع مثالاً تركيبياً مستنداً إلى الفصل الذي توثقه Inspect بين حالة التشغيل ونتائج scoring. يحتوي المثال على status: success وقيمة accuracy تساوي 0.734، من دون معيار ظاهر.

قد تعني success أن العملية اكتملت بلا خطأ تشغيلي. وقد تعني 0.734 أن metric محددة أنتجت ملاحظة. لا يثبت أي منهما أن evaluator الأصلي طبق threshold أو أعلن PASS.

هناك فرق آخر بين «المصدر صرح بأنه لم يطبق معياراً» و«المادة المتاحة لا تثبت إن كان معيار موجوداً». لا يحول غياب الحقل الحالة الثانية إلى الأولى إلا إذا عرّف format الأصلي ذلك الغياب بوضوح.

يمكن للمستهلك أن يطبق معياراً جديداً، بشرط تسجيل assessment منفصل يذكر actor والمدخلات والقاعدة والإصدار والنطاق والنتيجة. لا ينسب هذا الحكم إلى evaluator الأصلي، ولا يدعي أن المعيار سبق التشغيل من دون دليل ترتيب.

رقم التشغيل لا يحدد المقياس

توثق LightEval نتائج رقمية مرتبة بحسب task. وفي المثال التركيبي للمشروع يوجد مقياسان تحت run واحد: 0.62 و0.8. العبارة «run-17 تجاوز 0.75» لا تحدد أياً منهما.

يجب أن يحتفظ profile، حين يتغير الادعاء بها، بـ task وscorer وmetric والمحاولة والـaggregation والـdataset أو split والـpopulation. لا يحل الغموض باختيار أول نتيجة أو آخرها أو أكبرها أو أنسبها.

يمكن لـ JSON Pointer تحديد قيمة داخل snapshot معلوم، لكنه لا يحمل تعريف metric ولا يثبت اكتمال population. وإذا أشار إلى URL متغير فقد يصبح المرجع القديم موجهاً إلى محتوى جديد.

لذلك يجب ربط source object والاختيار ومعلومات mapping والمخرج. تشابه الأسماء أو تقارب timestamps أو وجود العناصر في ملف واحد لا يصنع هذه العلاقة.

النسبة تحتاج إلى المقام

يفترض مثال آخر مئة عينة مخطط لها، وثمانين عينة نُفذت، وستاً وسبعين حققت معياراً وأربعاً لم تحققه، وعشرين لم تُشغل. النسبة بين المكتمل هي 76/80، أي 0.95.

لا تثبت هذه النسبة أن 95 عينة من أصل المئة نجحت. تصدير 0.95 وحده يمحو العينات العشرين غير المنفذة. إعادة المحاولة، والتكرار، والاستبعاد، والإبطال، وتغير مجموعة العينات كلها تغير المقام.

الادعاء عن حملة كاملة يحتاج population معروفة أو قاعدة إدراج قابلة للتكرار وطريقة حساب. إذا كان العدد مجهولاً، يبقى مجهولاً. وحتى حفظ كل السجلات التي قدمها المصدر لا يثبت أنه قدم كل المحاولات الواقعية.

التقريب حكم جديد حين يغير النتيجة

يعرض المشروع القيمة الأصلية 0.94996 والقيمة المعروضة 0.950 مع معيار >= 0.95. المقارنة بالأصل تفشل، والمقارنة بالعرض تنجح.

التقريب مسموح، لكنه يصبح derivation معلنة حين يؤثر في المعنى. يجب حفظ المدخل والقاعدة والدقة والفاعل. وإذا اختار المستهلك سياسة تعتمد القيمة المقربة، فهي assessment جديدة وليست verdict المصدر.

الوحدة، والـscale، وتعريف metric، واتجاه المقارنة، والدقة، وعدم اليقين أجزاء من الادعاء عندما تؤثر في تفسيره. غياب معلومات عدم اليقين لا يعني أن عدم اليقين صفر.

المرجع ليس البايتات

قد يحصل ناشر على رابط خاص إلى log من دون إذن للوصول. يستطيع حفظ الرابط والتصريح بأنه لم يسترجع object ولم يعِد حساب digest وأن وجوده قائم على تصريح المصدر فقط.

لا يستطيع اختراع hash أو الادعاء بأنه فحص المحتوى أو ضمان الاحتفاظ به. الموقع العام، والإذن، والاسترجاع الناجح، والاستمرارية خصائص منفصلة.

كما أن المرجع ليس إذناً بالتنزيل أو التنفيذ. Logs وprompts ومخرجات الأدوات تبقى بيانات غير موثوقة داخل سجل موقع. يحتاج المستهلك إلى قواعد للوجهات وredirects وschemes وحجم الفك والعمق والموارد.

التوقيع اللاحق لا يصلح فقداً سابقاً

يفصل RATS بين evidence appraisal وسياسة relying party. يوفر SCITT شفافية للبيانات الموقعة وإيصالات. ويقدم in-toto subjects مرتبطة بالـdigest وpredicates محددة النوع. تستطيع هذه الآليات حماية سجلات التحويل.

لكنها لا تستنتج أن metric فُسرت بأمان. إذا حذف التحويل الأول population واحتفظ بـ0.95، فإن توقيع التحويل الثاني يصدق الملخص الناقص ولا يعيد العينات المفقودة.

يمكن لطرف لاحق الرجوع مباشرة إلى المصدر وبناء view جديدة، وعليه تسجيل هذا الفحص. لا يقدم السياق المستعاد كما لو أنه عبر المرحلة الخاسرة. كذلك فإن loss manifest موقعاً يبقى تصريحاً ولا يثبت أنه أحصى كل فقد.

Structural validation وإعادة حساب digest والتحقق من signature وattestation appraisal وmapping verification والحكم الموضوعي اختبارات مختلفة. قد يكون carrier صحيحاً بينما semantic profile غير مدعوم. يمكن تمريره كجسم opaque، لا كادعاء مثبت.

الحفظ لا يثبت الحقيقة أو السلطة

يمكن حفظ ادعاء كاذب أو متحيز أو انتقائي بأمانة كاملة. Claim preservation لا يثبت نزاهة المصدر، كفاءة evaluator، الصلاحية العلمية للـbenchmark، هوية النموذج المنفذ أو سلامة deployment.

ولا يخلق تفويضاً. قد تطبق جهة مستهلكة سياسة جديدة وتستخدمها في قرار. لا يثبت السجل أن صاحب القرار مخول، أو أن control وصل، أو أن التنفيذ وقع، أو أن الأثر الخارجي تحقق.

المراجعة 00 تقدم متطلبات وسيناريوهات تركيبية، لا wire format أو certification أو implementation. لا تدعي interoperability. قبول schema ليس اختبار mapping دلالي، واختبارات المؤلف نفسه ليست استقلالاً.

اختبار طبقات الواقع

وفق قراءة Heng Lu، بايتات المصدر والنتيجة المختارة والادعاء الدلالي والغلاف الموثق وحكم المستهلك والقرار المخول والتنفيذ والأثر المرصود طبقات مرتبطة لا تحل واحدة محل الأخرى.

Minimum initial specification تعني تحديد مجموعة ادعاءات ضيقة وحفظ الحد الأدنى الكامل اللازم لها، مع إبقاء الادعاءات الأقوى غير مدعومة. لا تعني اختزال الهوية في display name.

Running-code primacy تسأل عن سلوك قابل للرصد بين producer وconsumer مستقلين بإصدارات ثابتة. هل يميزان الاسم المعلن عن هوية التنفيذ؟ هل يرفضان profile جديداً تحت قواعد قديمة؟ هل يبقيان unknown ظاهراً؟ من دون ذلك تبقى عبارة «claim-preserving» وصفاً لا دليلاً.

المصادر والحدود

جُمّدت المصادر في 30 سبتمبر 2026 بتوقيت Asia/Shanghai. المراجعة 00 Internet-Draft فردية نشطة تستهدف Informational. ليست RFC أو إجماع IETF أو ناتج Working Group أو benchmark أو certification أو تقرير implementation أو deployment. الأمثلة تركيبية. تطبيق مبادئ Heng Lu هو تحليل Daniel Kade.