• Все модели Gemini способны обрабатывать и использовать не только слова. Они были предварительно обучены и доработаны на разнообразных аудиофайлах, изображениях и видео, обширной кодовой базе и текстах на разных языках.
  • Приложения и модели Gemini также полностью независимы от Imagen 2 и могут использоваться в некоторых корпоративных инструментах и средах разработки.
  • Поскольку модели Gemini мультимодальны, теоретически они могут выполнять широкий спектр мультимодальных задач.

Google пытается произвести фурор с помощью Gemini — флагманского набора генеративных ИИ-моделей, приложений и сервисов. Но хотя Gemini в некоторых отношениях выглядит многообещающим, как показывает наш неофициальный обзор, в других областях он показал плохие результаты. Итак, что такое Gemini? Как им пользоваться? Как он соотносится с конкурентами?


Что такое Gemini?

Gemini — это долгожданное семействомоделей GenAI нового поколения, разработанное исследовательской лабораторией Google DeepMind и Google Research. Оно представлено в трёх версиях:

  • Gemini Ultra — флагманская модель Gemini
  • Gemini Pro — «живая» модель Gemini
  • Gemini Nano — меньшая и «облегчённая» модель, работающая на мобильных устройствах, таких как Pixel 8 Pro
    Все модели Gemini обучаются как «естественно мультимодальные» — то есть способные обрабатывать и использовать не только слова. Они были предварительно обучены и доработаны на разнообразных аудиофайлах, изображениях и видео, обширной кодовой базе и текстах на разных языках. Это отличает Gemini от таких моделей, как LaMDA, модель Google, обученная специально на текстовых данных. LaMDA может понимать и генерировать только текст (например, статьи, черновики писем), а модели Gemini могут.

В чём разница между приложением Gemini и моделью Gemini?

В очередной раз Google продемонстрировал слабость своей брендовой стратегии, чётко не указав с самого начала, что Gemini отличается от приложения Gemini (ранее Bard) на веб- и мобильных платформах. Приложение Gemini — это лишь интерфейс доступа к определённой модели; его можно представить как клиент Google GenAI.

Кстати, приложения и модели Gemini также полностью отличаются от Imagen 2 — модели Google для генерации изображений по текстовому описанию, которая может использоваться в некоторых корпоративных инструментах и средах разработки. Не переживайте, вы не одиноки в своём замешательстве.

Что умеет Gemini?

Поскольку модели Gemini мультимодальны, теоретически они могут выполнять широкий спектр мультимодальных задач: от распознавания речи до добавления подписей к изображениям и видео и создания произведений искусства. Эти функции пока не доведены до стадии продакшена (подробнее об этом позже), но Google обещает их все и даже больше в ближайшем будущем. Google сильно разочаровал при первоначальном запуске Bard. Недавно компания также опубликовала видео, призванное продемонстрировать возможности Gemini, которое в итоге оказалось в значительной степени смонтированным и отражало скорее амбиции, чем реальность.

Читайте также: Чат-бот Google Bard получает обновление Gemini Pro по всему миру