- مقيّم الواقعية المعزز بالبحث (SAFE) هو أسلوب يستخدم نموذج لغة كبير (LLM) لتقسيم النص المولد إلى حقائق فردية.
- يمكن لنظام الذكاء الاصطناعي «فائق القدرة» هذا تحسين التحقق من الحقائق وكفاءة التكلفة والدقة.
- أشار Gary Marcus، الباحث البارز في الذكاء الاصطناعي، إلى أن «فائق القدرة» قد يعني ببساطة أفضل من عامل بأجر منخفض، بدلاً من مدقق حقائق خبير حقيقي.
كشفت Google DeepMind عن نظام ذكاء اصطناعي «فائق القدرة» قادر على التفوق على المدققين البشريين في تقييم دقة المعلومات المولدة بواسطة نماذج اللغة الكبيرة.
مقيّم الواقعية المعزز بالبحث (SAFE)
تقدم هذه الدراسة، بعنوان «Long-form factuality in large language models»، SAFE كطريقة لتقسيم النص المولد إلى حقائق فردية باستخدام نماذج اللغة الكبيرة. ثم تستخدم نتائج بحث Google لتحديد دقة كل ادعاء.
قارن الباحثون SAFE مع المعلقين البشريين على مجموعة بيانات تحتوي على حوالي 16000 حقيقة، ووجدوا أن تقييمات SAFE تطابق التقييمات البشرية في 72% من الحالات. والأكثر إثارة للإعجاب، أنه عندما اختلفت تقييمات SAFE والبشر، كان حكم SAFE صحيحًا في 76% من الحالات.
الأداء «فائق القدرة» يثير جدلاً
بينما يؤكد الباحثون أن وكلاء نماذج اللغة الكبيرة يمكنهم تحقيق أداء تقييم «فائق القدرة»، يتساءل بعض الخبراء عن المعنى الحقيقي لـ «فائق القدرة» في هذا السياق.
يقترح باحث الذكاء الاصطناعي Gary Marcus أن «فائق القدرة» قد يعني ببساطة أفضل من عامل بأجر منخفض، بدلاً من مدقق حقائق خبير حقيقي.
يجادل Marcus بأن مقارنة SAFE مع مدققي الحقائق الخبراء البشريين أمر بالغ الأهمية لإثبات أدائه فائق القدرة حقًا.
مزايا SAFE
إحدى المزايا الواضحة لـ SAFE هي التكلفة – فقد وجد الباحثون أن استخدام نظام الذكاء الاصطناعي أرخص بحوالي 20 مرة من استخدام المدققين البشريين. مع استمرار نمو حجم المعلومات، يصبح من المهم بشكل متزايد اعتماد نهج منخفض التكلفة وعالي الإنتاجية.
استخدم فريق DeepMind أيضًا SAFE لتقييم الدقة الواقعية لـ 4 عائلات (Gemini, GPT, Claude وPaLM-2) تضم 13 نموذجًا لغويًا رائدًا. ووجدوا أن النماذج الأكبر تنتج عمومًا أخطاء واقعية أقل.
ومع ذلك، حتى النماذج الأفضل أداءً لا تزال تنتج عددًا كبيرًا من الادعاءات الكاذبة.
وهذا يسلط الضوء على خطر الاعتماد المفرط على نماذج اللغة التي يمكنها التعبير بطلاقة عن معلومات غير دقيقة. يمكن لأدوات التحقق التلقائي من الحقائق مثل SAFE أن تلعب دورًا رئيسيًا في تخفيف هذه المخاطر.

