- Программа OpenAI «Data Partnerships» направлена на устранение западноцентричного уклона в ИИ за счёт создания разнообразных глобальных наборов данных.
- Инициатива предполагает включение разнообразных языков и культурных данных для исправления существующих уклонов в моделях ИИ.
- OpenAI сталкивается с критикой и юридическими претензиями из-за возможного использования личных и творческих произведений при обучении ИИ без разрешения.
OpenAI объявила об инициативе «Data Partnerships», цель которой — расширить разнообразие обучающих данных для ИИ за пределы западноцентричного стандарта. Эта новаторская программа предполагает сотрудничество с разными организациями для создания комплексных открытых и частных наборов данных для обучения моделей ИИ.

Борьба с предвзятостью данных в ИИ
Эта инициатива отвечает на широко распространённую проблему предвзятости данных в ИИ. Традиционные модели ИИ демонстрируют заметный перекос в сторону данных из западных стран, особенно в базах изображений. Причина — перепредставленность западных изображений в интернете, из-за чего модели ИИ непреднамеренно усиливают эти перекосы, что может иметь негативные последствия.
Data Partnerships от OpenAI призваны исправить это, собирая обширные наборы данных, которые точнее отражают мировое человеческое общество. Такие наборы будут фиксировать человеческие намерения в разных форматах — например, в длинных текстах или диалогах на разных языках и по разным темам. Более широкий набор данных поможет моделям ИИ глубже понимать разные темы, отрасли, культуры и языки.
Читайте также:OpenAI запускает GPT Store для персональных ИИ-чат-ботов без программирования
Сбор публичных и частных данных
Программа будет работать с разными типами данных — изображениями, аудио и видео, — отдавая приоритет данным, отражающим человеческие намерения, таким как длинные тексты или беседы. Для обеспечения целостности данных OpenAI планирует использовать такие инструменты, как оптическое распознавание символов и автоматическое распознавание речи, и удалять чувствительную или личную информацию. OpenAI планирует создавать наборы данных двух типов. Первый — открытые наборы данных, которые будут бесплатно доступны для обучения ИИ.
Второй — частные наборы, адаптированные для организаций, которые хотят сохранить конфиденциальность данных и при этом позволить моделям OpenAI лучше понимать их специфические области.
Читайте также:OpenAI тихо обновляет свои основные ценности, делая акцент на разработке AGI
Партнёрства и противоречия
Компания уже начала партнёрства для улучшения своих ИИ-возможностей. Сотрудничество с правительством Исландии и Miðeind ehf позволило GPT-4 лучше владеть исландским языком. Аналогично партнёрство с Free Law Project улучшило понимание моделью юридических документов. Несмотря на внешне альтруистичный характер инициативы, OpenAI сталкивается с критикой из-за возможных коммерческих мотивов. Подход, при котором модели OpenAI улучшаются, возможно, в ущерб другим и без справедливой компенсации, вызвал споры.
Недавние иски к OpenAI и Microsoft со стороны создателей и авторов вскрыли проблемы, связанные с несанкционированным использованием их произведений для обучения моделей ИИ, и подняли вопросы об этичном использовании данных и компенсации в индустрии ИИ.

