- Google устраняет проблемы функции генерации изображений своей ИИ-модели Gemini: генерация людей приостановлена, а улучшенная версия уже готовится.
- В социальных сетях появились жалобы на неточности в генерации изображений Gemini, в том числе на некорректные изображения в историческом контексте.
- Несмотря на прогресс в борьбе с расовыми предубеждениями, ИИ-модель Gemini от Google критикуют за чрезмерную коррекцию: на это указывает нежелание показывать некоторые изображения, а также недавний переход на Gemini 1.5 на фоне конкуренции с Sora от OpenAI.
Googleв четверг объявил, что устраняет недавние проблемы функции генерации изображений ИИ-моделиGemini: генерация людей приостановлена, в ближайшее время будет опубликована улучшенная версия. Накануне Google принёс извинения, признав неточности в некоторых исторических изображениях, созданных большой моделью Gemini, и пообещал её доработать.
Неточные исторические изображения
Недавно в социальных сетях жаловались на функцию преобразования текста в изображение у Gemini: например, на картинках на тему «Джордж Вашингтон, отец-основатель США» появлялись женщины и люди с другим цветом кожи, что неверно. Кроме того, когда пользователи просили Gemini сгенерировать немецких солдат-нацистов, модель выдавала фотографии чернокожих, азиатских и белых женщин в нацистской военной форме.
Пользователи также жаловались, что Gemini не хотел показывать изображения белых людей. На просьбу показать фото белого человека Gemini отвечал, что не может выполнить этот запрос. При этом на просьбу показать изображения чернокожих Gemini предлагал картинки, «прославляющие разнообразие и достижения чернокожих людей». А когда его просили показать изображения, прославляющие разнообразие и достижения белых людей, Gemini говорил, что «колеблется» выполнить этот запрос.
Анализ показывает, что это может быть чрезмерной коррекцией давней проблемы расовых предубеждений в ИИ и отражает стремление Google к «мультикультурализму». По сравнению с предыдущими ИИ-моделями Gemini добился значительного прогресса в решении проблемы расовых предубеждений, но эта проблема «преувеличена».
Gemini — самая большая и мощная мультимодальная ИИ-модель Google. На прошлой неделе компания выпустила новейшую модель ИИ следующего поколения Gemini 1.5, которая стала значительным шагом вперёд по сравнению с Gemini 1.0, вышедшей в декабре.
Читайте также:OpenAI избавляет GPT-4 от «лени» с помощью новых обновлений
Gemini промахивается
Джек Кравчик, старший директор по продуктам Gemini в Google, заявил, что возможности компании по генерации изображений отражают «глобальную базу пользователей» технологического гиганта и что он серьёзно относится к вопросам репрезентации и предвзятости. «Генерация изображений Gemini действительно охватывает широкую аудиторию, что в целом хорошо, ведь ей пользуются люди по всему миру, но она не попадает в цель».
В начале этого месяца Google начал предлагать генерацию изображений через Gemini, но запуск нового инструмента Sora стал ударом для Google, который пытается догнатьOpenAI, поддерживаемуюMicrosoft. Sora умеет генерировать непрерывные 60-секундные видео только на основе текстовых запросов, поразив всю технологическую индустрию. Sora от OpenAI не только точно прорабатывает детали, но и понимает существование объектов в физическом мире: визуальные эффекты, глубина резкости, движения камеры и даже микровыражения людей и мимика животных — всё это уже невероятно реалистично.

