باحثو Google وStanford هم سجل عام يعتمد على أدلة المقالة وسياق الكيان وروابط الأحداث وسياق العلاقات.
يتم تتبع باحثي Google وStanford كموضوع مدعوم بمصادر مرتبط بتغطية السوق.
دليل درجة الثقة
تقارير منشورة
يقدم تطور حديث من Google DeepMind وجامعة Stanford أداة Search-Augmented Factuality Evaluator (SAFE)، وهي أداة مصممة للتحقق من الحقائق في الردود الطويلة لروبوتات المحادثة بالذكاء الاصطناعي. يستخدم SAFE عملية متعددة الخطوات، تتضمن التقسيم والتصحيح والمقارنة مع نتائج بحث Google، ويحقق دقة 76% في التحقق من الحقائق المثيرة للجدل. لا يؤدي هذا الابتكار إلى تحسين دقة الردود التي يولدها الذكاء الاصطناعي فحسب، بل يقدم أيضًا مزايا اقتصادية، حيث أنه أرخص بأكثر من 20 مرة من الشرح اليدوي. بغض النظر عن قوة روبوتات المحادثة الحالية بالذكاء الاصطناعي، فإنها تميل إلى سلوك منتقد بشدة يتمثل في تقديم إجابات مقنعة إلى حد ما ولكنها غير دقيقة واقعيًا.
باختصار، الذكاء الاصطناعي «يخرج عن مساره» أحيانًا في ردوده، وقد يصل الأمر إلى «نشر الشائعات». منع مثل هذا السلوك في نماذج الذكاء الاصطناعي الكبيرة ليس مهمة سهلة ويشكل تحديًا تقنيًا. ومع ذلك، وفقًا لوسيلة الإعلام الأجنبية Marktechpost، يبدو أن Google DeepMind وجامعة Stanford قد وجدتا حلًا بديلًا.
اقرأ أيضًا: متجر GPT من OpenAI لا يلبي التوقعات اقرأ أيضًا: الوكالات الفيدرالية الأمريكية يجب أن يكون لديها الآن مسؤول للذكاء الاصطناعي تعتمد الأداة على Search-Augmented Factuality Evaluator (SAFE) قدم الباحثون أداة تعتمد على نماذج اللغة الكبيرة، Search-Augmented Factuality Evaluator (SAFE)، القادرة على التحقق من الحقائق في الردود الطويلة التي تولدها روبوتات المحادثة. تم نشر نتائج أبحاثهم، بالإضافة إلى الكود التجريبي ومجموعات البيانات، علنًا، انقر هنا للمشاهدة.
يقوم النظام بتحليل ومعالجة وتقييم الردود التي تولدها روبوتات المحادثة في أربع خطوات للتحقق من الدقة والمصداقية: تقسيم الردود إلى عناصر فردية للتحقق، ثم تصحيح المحتوى أعلاه، ثم مقارنته بنتائج بحث Google. بعد ذلك، يتحقق النظام أيضًا من ملاءمة كل حقيقة للسؤال الأصلي. أنشأ الباحثون مجموعة بيانات تسمى LongFact لتقييم أدائه لتقييم أدائه، أنشأ الباحثون مجموعة بيانات تسمى LongFact تحتوي على حوالي 16,000 حقيقة واختبروا النظام على 13 نموذجًا كبيرًا للغة من Claude وGemini وGPT وPaLM-2. تظهر النتائج أنه في التحليل المستهدف لـ 100 حقيقة مثيرة للجدل، تصل دقة حكم SAFE إلى 76% بعد فحص أعمق.
في نفس الوقت، يقدم الإطار أيضًا مزايا اقتصادية: فهو أرخص بأكثر من 20 مرة من الشرح اليدوي.
موجز الإشارة
- إشارة: باحثون من Google وStanford يطلقون أداة للتحقق من الحقائق بالذكاء الاصطناعي
- نوع الإشارة: سوق
- المنطقة: عالمي
- فئة السوق: الاتجاهات المؤسسية العالمية
البصمة التشغيلية
- يجب أن تحدد المصادر المنشورة الأطراف المتأثرة، ونطاق التشغيل، والتعرض للسوق قبل اعتبار خريطة الاتجاه هذه مكتملة.
سياق السوق
- الأهمية التشغيلية: متوسط
- الأفق الزمني: الربع القادم
ما الذي تشاهده
- راقب البيانات الرسمية، التحديثات التنظيمية، تعرض العملاء أو الشركاء، والإفصاحات المتابعة.
إحاطة الأعضاء
السياق الأعمق للاتجاهات
سجّل الدخول بمستوى العضوية المناسب لفتح الإحاطة الكاملة وملاحظات المصادر.
للدائرة الاستراتيجية فقط
الدائرة الاستراتيجية
مفتوح لجميع القراء. افتح إحاطات الاتجاهات بعد الانضمام وتسجيل الدخول.
انضم إلى الدائرة الاستراتيجيةفقط لتحالف القيادة
تحالف القيادة
للمشغلين والمستثمرين وفرق السياسات الذين يحتاجون إلى أدلة العلاقات ومسارات الفشل وملاحظات المصادر. سجل الدخول لفتح.
انضم إلى تحالف القيادة
