• جميع نماذج Gemini قادرة على معالجة واستخدام أكثر من مجرد كلمات. تم تدريبها مسبقًا وضبطها على مجموعة متنوعة من الملفات الصوتية والصور ومقاطع الفيديو وقاعدة واسعة من التعليمات البرمجية ونصوص بلغات مختلفة.
  • تطبيقات ونماذج Gemini مستقلة تمامًا عن Imagen 2 ويمكن استخدامها في بعض أدوات وبيئات التطوير الخاصة بالشركة.
  • نظرًا لأن نماذج Gemini متعددة الوسائط، يمكنها نظريًا أداء مجموعة من المهام متعددة الوسائط.

تحاول Google إثارة الضجة من خلال Gemini، مجموعة رائدة من نماذج وتطبيقات وخدمات الذكاء الاصطناعي التوليدي. ولكن على الرغم من أن Gemini يبدو واعدًا في بعض النواحي، كما يكشف مراجعتنا غير الرسمية، إلا أنه أظهر نتائج سيئة في مجالات أخرى. إذن، ما هو Gemini؟ كيف تستخدمه؟ كيف يقارن بمنافسيه؟


ما هو Gemini؟

Gemini هي العائلة المنتظرة لنماذج GenAI من الجيل التالي، التي طورها مختبر أبحاث الذكاء الاصطناعي في Google، DeepMind، وGoogle Research. وهي متوفرة في ثلاثة إصدارات:

  • Gemini Ultra، النموذج الرائد من Gemini
  • Gemini Pro، نموذج Gemini "مباشر"
  • Gemini Nano، نموذج أصغر "خفيف الوزن" يعمل على الأجهزة المحمولة مثل Pixel 8 Pro
    تم تدريب جميع نماذج Gemini لتكون "متعددة الوسائط بشكل طبيعي" – بمعنى آخر، قادرة على معالجة واستخدام أكثر من مجرد كلمات. تم تدريبها مسبقًا وضبطها على مجموعة متنوعة من الملفات الصوتية والصور ومقاطع الفيديو وقاعدة واسعة من التعليمات البرمجية ونصوص بلغات مختلفة. وهذا يميز Gemini عن نماذج مثل LaMDA، نموذج Google المدرب خصيصًا على البيانات النصية. لا تستطيع LaMDA فهم أو توليد أي شيء آخر غير النص (مثل المقالات ومسودات البريد الإلكتروني)، ولكن نماذج Gemini تستطيع ذلك.

ما الفرق بين تطبيق Gemini ونموذج Gemini؟

مرة أخرى، أظهرت Google افتقارها إلى الكفاءة في استراتيجية العلامات التجارية بعدم تحديدها بوضوح منذ البداية أن Gemini يختلف عن تطبيق Gemini (المعروف سابقًا باسم Bard) على المنصات الإلكترونية والجوالة. تطبيق Gemini هو مجرد واجهة للوصول إلى نموذج معين – يمكن تخيله كعميل Google GenAI.

بالمناسبة، تطبيقات ونماذج Gemini مستقلة تمامًا عن Imagen 2، نموذج توليد الصور من النص من Google الذي يمكن استخدامه في بعض أدوات وبيئات التطوير الخاصة بالشركة. لا تقلق، لستم وحدكم من يشعرون بالارتباك.

ماذا يمكن أن يفعل Gemini؟

نظرًا لأن نماذج Gemini متعددة الوسائط، يمكنها نظريًا أداء مجموعة من المهام متعددة الوسائط، من النسخ الصوتي إلى إضافة تعليقات على الصور ومقاطع الفيديو، وصولاً إلى إنشاء الأعمال الفنية. هذه الميزات ليست بعد في مرحلة الإنتاج (سنناقش ذلك لاحقًا)، لكن Google تعد بها جميعًا، وأكثر، في المستقبل القريب. خيبت Google الآمال بشكل كبير عند الإطلاق الأولي لـ Bard. مؤخرًا، نشرت الشركة أيضًا مقطع فيديو كان من المفترض أن يظهر قدرات Gemini، لكنه تبين أنه مزيف إلى حد كبير وأشبه بالطموح.

اقرأ أيضًا: يحصل chatbot Bard من Google على تحديث Gemini Pro على مستوى العالم