- تنظم OpenAI حدثًا هذا الاثنين، حيث يُتوقع الإعلان عن مساعد رقمي جديد متعدد الوسائط،
- بفضل تعدد الوسائط، يمكن للمساعد استخدام الإشارات البصرية، مثل التعرف على لافتة في الهواء الطلق وتفسيرها كمدخل.
- يشكل هذا تهديدًا مباشرًا لـ Google Assistant و Gemini الذي تم إطلاقه مؤخرًا، المساعدين الرقميين للشركة.
OpenAIوفقًا لتقرير حديث من موقع الأخبار The Information، عرضت على بعض عملائهانموذج ذكاء اصطناعي متعدد الوسائط جديديمكنه التعرف على الأشياء والتحدث مع البشر. يدعي مصدر الأخبار أنه علم بذلك من مصادر مجهولة، ويتكهن بأنه قد يكون معاينة لما ستعلن عنه الشركة لاحقًا اليوم.
نموذج ذكاء اصطناعي متعدد الوسائط جديد
يشير مصطلح "متعدد الوسائط" إلى قدرة الذكاء الاصطناعي على معالجة أكثر من مجرد نص كمدخل. سيكون هذا المساعد الرقمي المزعوم قادرًا على الاتصال بكاميرا، ومعالجة البيانات من العالم الخارجي، ثم الرد عليك بتفاصيل إضافية حول ما تمت ملاحظته. يمكنك أن تطلب من ChatGPT، على سبيل المثال، التعرف على لافتة وترجمتها لك إذا وجهت كاميرا نحو لافتة مكتوبة بلغة غير لغتك. سيتحدث معك الذكاء الاصطناعي بعد ذلك.
إذا كان هذا يبدو مألوفًا لك، فذلك لأن Google Lens و Google Assistant ومؤخرًا Google Gemini قد فعلوا كل ذلك بالفعل. يمكن لـ ChatGPT أيضًا فعل ذلك بالفعل، وإن لم يكن من خلال واجهة موحدة.
وفقًا للتقارير، يمكن للنموذج الجديد تفسير الصور والصوت بشكل أسرع وأكثر دقة من نماذجه المنفصلة للنسخ والتوليف الصوتي. تدعي The Information أن النموذج يمكنه "نظريًا" مساعدة طلاب الرياضيات أو ترجمة اللافتات الواقعية، وسيكون قادرًا على مساعدة موظفي خدمة العملاء في "فهم نبرة أصوات المتصلين بشكل أفضل أو التعرف على ما إذا كانوا ساخرين".
بعبارة أخرى: منافس مباشر لـ Gemini (وبالتالي لـ Google Assistant و Siri من Apple).
يمكن للنموذج الإجابة على "أنواع معينة من الأسئلة" بشكل أفضل من GPT-4 Turbo، لكنه لا يزال يرتكب أخطاء في بعض الأحيان بثقة كاملة، وفقًا لمصادر مقربة من المنصة.
اقرأ أيضًا:كيف تعمل المركبات ذاتية القيادة؟
اقرأ أيضًا:OpenAI تحارب التضليل من خلال التعاون التكنولوجي
تكهنات حول OpenAI
شارك المطور Ananay Arora لقطة شاشة للرمز المرتبط بالمكالمات المذكورة، مما يشير إلى أن OpenAI قد تعد أيضًا ميزة ChatGPT متكاملة جديدة. اكتشف Arora أيضًا أدلة على أن OpenAI أنشأت خوادم للدردشة الصوتية والمرئية في الوقت الفعلي.
علاوة على ذلك، صرح Altman بأن الشركة لن تطلق محرك بحث جديدًا مدعومًا بالذكاء الاصطناعي. ومع ذلك، إذا كان تقرير The Information صحيحًا، فقد يخفف ذلك من التوقعات لمؤتمر Google I/O للمطورين.

