لقد انفجر الاهتمام بنماذج الذكاء الاصطناعي التوليدية، مدفوعًا بالتقدم في معالجة اللغة الطبيعية وتوليد الصور.

الاهتمام بنماذج الذكاء الاصطناعي التوليدية انفجر، مدفوعًا بالتقدم في معالجة اللغة الطبيعية وتوليد الصور.
الاهتمام بنماذج الذكاء الاصطناعي التوليدية انفجر، مدفوعًا بالتقدم في معالجة اللغة الطبيعية وتوليد الصور.META، لاعب رائد في مجال أبحاث الذكاء الاصطناعي،
قدمت CM3leon، نموذج متعدد الوسائط من الطراز الأول. ويعني متعدد الوسائط
أن الذكاء الاصطناعي قادر على كل من توليد النص إلى الصورة والصورة إلى النص.
يجمع نهج CM3leon الفريد بين وصفات من نماذج اللغة النصية.
سيستخدم نموذج Meta التدريب المسبق على نطاق واسع مع الاسترجاع المعزز وخطوات
الضبط الدقيق الخاضع للإشراف متعدد المهام.

أفضل أداء في توليد الصور
على الرغم من تدريبه باستخدام موارد حاسوبية أقل بخمس مرات من الأساليب
السابقة القائمة على المحولات، يحقق CM3leon أداءً متطورًا في توليد
النص إلى الصورة. بشكل ملحوظ، يُظهر تعدد استخدامات النماذج الذاتية الانحدار مع
الحفاظ على تكاليف تدريب منخفضة واستدلال فعال.

يتجاوز هذا النموذج القائم على الترميز الأساليب التقليدية لتوليد النص إلى الصورة. يمكنه
توليد تسلسلات معقدة من النص والصور مشروطة بمحتوى عشوائي.
على عكس النماذج الأخرى المتخصصة في توليد الصور، فإن الضبط الدقيق
على نطاق واسع من خلال تعليمات متعددة المهام لـ CM3leon يحسن بشكل كبير الأداء في مهام
الرؤية واللغة المختلفة، مثل توليد تسميات توضيحية للصور والإجابة البصرية على الأسئلة.

التزويد الأخلاقي ببيانات الصور
أعلنت Meta أنها تتبنى نهجًا أخلاقيًا لتزويد بيانات الصور، باستخدام
صور مرخصة من Shutterstock فقط لتجنب مشكلات الملكية والإسناد.
هذه المنهجية المسؤولة اجتماعيًا تميز CM3leon عن منافسيه.
عند المقارنة مع المعايير المستخدمة على نطاق واسع، يحقق CM3leon درجة FID
مذهلة تبلغ 4.88، متجاوزًا نموذج Parti من Google ويضع معيارًا جديدًا لتوليد
النص إلى الصورة. تشير درجةFrechet Inception Distance (FID)البالغة 0.0 إلى درجة
مثالية. يُظهر CM3leon القدرة على توليد كائنات تركيبية معقدة، كما يتضح من
أمثلة مثل صبار في وعاء يرتدي نظارة شمسية وقبعة.

لا تزال هناك تحديات يتعين التغلب عليها
على الرغم من أن وعد CM3leon لا يمكن إنكاره، إلا أن بعض التحديات يجب معالجتها. كما هو الحال مع أي نموذج ذكاء اصطناعي، فإن التحيزات المحتملة في البيانات هي مصدر قلق، حيث قد تعكس نتائج النموذج
التحيزات الموجودة في بيانات التدريب الخاصة به.

علاوة على ذلك، على الرغم من أن CM3leon يمكنه توليد صور عالية الجودة، إلا أن النتائج قد تختلف وفقًا لتعقيد التعليمات وجودة بيانات التدريب.
بالإضافة إلى ذلك، لا يزال CM3leon يتطلب موارد حاسوبية كبيرة، مما قد
يحد من إمكانية الوصول للمؤسسات الصغيرة والأفراد. على الرغم من أنه
يُظهر قدرات تعميم ملحوظة، إلا أنه قد يكون له حدود في
توليد محتوى جديد تمامًا خارج بيانات التدريب الخاصة به.

على الرغم من أن CM3leon يُظهر إمكانات كبيرة، إلا أن توفره الحالي يقتصر على الأغراض البحثية.
مع تقدمه، قد يصبح عنصرًا ثوريًا في مجال الذكاء الاصطناعي التوليدي،
محدثًا ثورة في كل من توليد الصور والنص. إذا كنت ترغب في معرفة المزيد عن بنية CM3leon، يمكنكالوصول إلى الورقة البحثية الرسمية لـ Meta هنا.