Поскольку генеративные ИИ-сервисы, такие какChatGPTот OpenAI, Bing Chat от Microsoft и Google Bard, всё чаще используются как альтернатива поисковым системам, они также сталкиваются с сопротивлением со стороны частных лиц и компаний, которые не хотят, чтобы данные их сайтов использовались для обучения моделей ИИ.

Большие языковые модели обучаются на разнообразных данных, значительная часть которых, судя по всему, была собрана без чьего-либо ведома или согласия. На этой неделе Google объявила о новом способе, с помощью которого разработчики сайтов могут разрешить сервисам Bard и Vertex AI доступ к своему контенту либо отказаться от обучения этих API-моделей.

Как запретить ИИ сканировать ваш сайт

В недавней записи в блоге вице-президент Google по доверию Даниэль Ромен признала, что веб-издатели хотят иметь больше возможностей выбора и контроля над тем, как их контент используется в новых сценариях применения генеративного ИИ. Чтобы решить эту проблему, Google разрешает веб-издателям запрещать «User-Agent: Google-Extended» в файле robots.txt своего сайта. Этот простой шаг не позволит автоматическим поисковым роботам Google получать доступ к контенту издателя и использовать его для обучения ИИ.

В настоящее время сайты могут указывать в robots.txt список тех, кому запрещено сканировать сайт, и Google считает, что все разработчики моделей ИИ также должны обеспечивать такой уровень прозрачности и контроля. Однако по мере расширения применения ИИ сайты столкнутся с растущей сложностью управления разными сценариями использования в больших масштабах. Google заявила, что поделится дополнительной информацией как можно скорее.

Намерения Google под вопросом

Хотя Google заявляет, что разрабатывает свои ИИ-модели этично и инклюзивно, между индексацией интернета и использованием данных для обучения ИИ существует принципиальная разница. Данные, собранные у веб-издателей, используются как сырьё для обучения моделей машинного обучения, что со временем делает их более точными и мощными.

Важно признавать роль согласия при сборе данных для обучения ИИ. Предоставление веб-издателям возможности участвовать в обучении ИИ-моделей — позитивный шаг. Однако Google уже собирает огромные объёмы данных для обучения своих моделей без явного согласия пользователей. Это вызывает вопросы о том, насколько искренним является новый акцент Google на согласии и этичном сборе данных.

Реальность такова, что Google имеет неограниченный доступ к веб-данным и использует их для обучения ИИ-моделей, прежде чем запросить разрешение у веб-издателей. Если бы этичный сбор данных и согласие действительно были для Google главным приоритетом, такая возможность появилась бы ещё годы назад.

До этичного получения данных, возможно, ещё далеко

Очевидно, технологической отрасли необходимо решать этические вопросы, связанные с обучением ИИ и сбором данных. Хотя решение Google дать веб-издателям контроль над своим контентом — шаг в правильном направлении, важно учитывать необходимость более широкого контекста и более комплексного решения.

В целом решение Google позволить веб-издателям контролировать, как их контент используется для обучения ИИ, — позитивное событие. Однако важно признать, что этот выбор появился после того, как Google уже собрала и использовала огромные объёмы данных без явного согласия.

Вся технологическая отрасль должна ставить этичный сбор данных и согласие во главу угла и работать над более комплексными решениями, учитывающими интересы как веб-издателей, так и пользователей.