• Tumblr и WordPress.com в настоящее время ведут переговоры о предоставлении данных пользователей ИИ-компаниям, таким как OpenAI и Midjourney.
  • The New York Times подаёт иск против OpenAI за предполагаемое использование её обширных архивов без разрешения для обучения чат-ботов.

Использование данных, извлечённых из интернета, стало предметом споров: компании обрабатывают публичный контент для обучения своих мощных генеративных моделей. Эта практика спровоцировала юридические баталии — такие организации, как The New York Times иGetty Images, выразили обеспокоенность неавторизованным использованием своих материалов.

Судебные тяжбы из-за использования данных

Одно из самых громких дел касается OpenAI, которой The New York Times предъявила иск за предполагаемое использование архивов газеты без разрешения для обучения чат-ботов. В ответ OpenAI обвинила The New York Times в применении сомнительных тактик для подтверждения своих претензий. Аналогично Getty Images подала иск противStable Diffusionо нарушении авторских прав в связи с использованием её визуального контента.

Последствия применения ИИ-систем, использующих труд журналистов, музыкантов и фотографов, выходят далеко за рамки судебных разбирательств. Погоня за большими объёмами данных для обучения породила опасения по поводу потенциальной эксплуатации авторов онлайн-контента. Такие платформы, как Tumblr и WordPress.com, по сообщениям, вели переговоры о продаже пользовательских данных ИИ-компаниям, включая OpenAI и Midjourney, что поднимает вопросы о конфиденциальности данных и праве собственности.

Читайте также:Чат-бот Google Bard получает обновление Gemini Pro по всему миру

Партнёрства по обмену данными

Пока одни организации выбирают судебные разбирательства, другие предпочитают заключать партнёрства. The Associated Press предоставила OpenAI лицензию на часть своих архивов, а Shutterstock подписала с ИИ-компанией шестилетнее соглашение о доступе к её обширной библиотеке фотографий, видео и музыки.

Reddit, известный обилием пользовательского контента, недавно заключил сделку с Google, предоставив технологическому гиганту доступ к своему API для обучения моделей ИИ. Этот шаг подчёркивает ценность вклада пользователей платформ и этические соображения, связанные с использованием данных.

Читайте также:OpenAI запускает GPT Store для персональных ИИ-чат-ботов без программирования

Распространённые практики обучения на данных

Широко распространённая практика обучения моделей ИИ на открытых интернет-данных выходит далеко за рамки соглашений, упомянутых в статье. Недавнее расследование The Washington Post выявило целый массив данных, собранных из различных источников, включая онлайн-форумы, краудфандинговые платформы и сайты социальных сетей. Такие компании, как Meta (ранее Facebook), также использовали публичные записи со своих платформ для совершенствования возможностей ИИ.

Спор о праве собственности на данные и согласии на их использование остаётся нерешённым. Авторы контента — от нишевых блогов до популярных платформ социальных сетей — сталкиваются с перспективой превращения своей работы в товар для обучения ИИ. Баланс между инновациями и этичными практиками работы с данными крайне важен для будущего развития ИИ и его влияния на цифровые экосистемы.