- Automattic находится на пороге заключения соглашения о предоставлении данных для обучения моделей ИИ-компаний.
- Сделки по предоставлению данных для обучения ИИ стали выгодной возможностью для сайтов, которые с трудом удерживаются на плаву в неустойчивом ландшафте современного онлайн-издательства.
TumblrиWordPress.comготовятся заключить соглашения о продаже пользовательских данных компаниям в сфере искусственного интеллекта —OpenAIиMidjourney. По сообщениям 404 Media, Automattic, материнская компания обеих платформ, близка к завершению сделки о предоставлении данных для обучения моделей ИИ-компаний.
Неясный характер данных в соглашении
Точный состав данных, которые войдут в соглашение, остаётся неясным, однако, как предполагается, внутреннее письмо продакт-менеджера Tumblr Cyle Gage вызвало опасения по поводу объёма данных, готовящихся к передаче. В отчёте указывается, что данные могли включать частную информацию или сведения, связанные с партнёрами, которые не предназначались для включения в соглашение. В их число могли войти закрытые публикации в публичных записях блогов, удалённые или заблокированные блоги, вопросы без ответов, закрытые ответы, откровенный контент и материалы из премиальных партнёрских блогов.
Читайте также:OpenAI исправляет «ленивость» GPT-4 новыми обновлениями
Ответ и обязательства Automattic
Когда Automattic попросили прокомментировать ситуацию, компания ответила опубликованным заявлением, подчеркнув, что будут переданы только публичные материалы, размещённые на WordPress.com и Tumblr, — с сайтов, которые не отказались от участия. Компания также заявила о своей приверженности соблюдению всех настроек отказа от передачи данных и объявила о намерении запустить новый инструмент отказа, который позволит пользователям запрещать третьим лицам, включая ИИ-компании, обучаться на их данных.
Ходатайство об удалении пользовательских данных
Предполагаемый внутренний FAQ, подготовленный Automattic для нового инструмента отказа, указывает, что компания будет активно ходатайствовать об удалении данных по запросу пользователя. Хотя формулировки в документе — «запрашивать» и «ходатайствовать» — могут вызвать недоумение, руководитель направления ИИ в Automattic Andrew Spittle выразил уверенность, что ИИ-компании удовлетворят эти запросы, основываясь на предыдущих переговорах.
Читайте также:Гендиректор OpenAI Sam Altman и спикер Палаты представителей США разбираются с вызовами регулирования ИИ на Капитолии
Вызовы для Tumblr и WordPress.com
Контекст этих потенциальных соглашений — стремительно меняющийся ландшафт онлайн-издательства, где сайты ищут новые источники дохода, чтобы оставаться на плаву. Tumblr, в частности, столкнулся с немалыми трудностями: предположительно, в конце 2023 года компания сократила штат до абсолютного минимума. Этот контекст подчёркивает важность подобных соглашений о данных для таких платформ, как Tumblr и WordPress.com.
В более широком отраслевом контексте эта новость дополняет растущую тенденцию ИИ-компаний к использованию пользовательского контента для обучения своих моделей. Недавно Google заключила соглашение с Reddit, а OpenAI активно искала партнёрства для сбора наборов данных для обучения моделей ИИ.

