OpenAI のChatGPT、Microsoft の Bing Chat、Google Bard などの生成 AI サービスが検索エンジンの代替としてますます利用される中、ウェブサイトのデータが AI モデルの訓練に使われることを望まない個人や企業からの抵抗にも直面している。
大規模言語モデルはさまざまなデータで訓練されており、その多くは誰の知らぬところで、または同意なく収集されたとみられる。今週、Google は、ウェブサイト開発者が自社の Bard および Vertex AI サービスにコンテンツへのアクセスを許可するか、それらの API モデルの訓練を拒否するかを選択できる新しい方法を発表した。
AI によるサイトのクロールを禁止する方法
最近のブログ記事で、Google の信頼担当副社長ダニエル・ロマン氏は、生成 AI の新たなユースケースに関してウェブパブリッシャーが自分のコンテンツの使われ方についてより多くの選択肢とコントロールを望んでいることを認めた。この懸念に応えるため、Google はウェブパブリッシャーがサイトの robots.txt ファイルで「User-Agent: Google-Extended」を禁止できるようにしている。この簡単な手順で、Google の自動クローラーが出版社のコンテンツに AI 訓練目的でアクセスして使用するのを防ぐことができる。
現在、ウェブサイトは robots.txt を通じてクロールを拒否する相手のリストを提供することが可能で、Google はすべての AI モデルプロバイダーも同様の透明性と管理手段を提供すべきだと考えている。しかし、AI アプリケーションが拡大するにつれて、ウェブサイトは大規模に様々な使用法を管理する複雑さの増大に直面することになる。Google は、可能な限り早く詳細を共有すると述べた。
疑問視される Google の意図
Google は AI モデルを倫理的かつ包括的に開発していると主張しているが、ウェブのインデックス作成と AI 訓練のためのデータ使用との間には根本的な違いがある。ウェブパブリッシャーから収集されたデータは、機械学習モデルを訓練するための原材料として使用され、時間の経過とともにモデルをより正確で強力なものにする。
AI の訓練データ収集における同意の役割を認識することが重要である。ウェブパブリッシャーに AI モデルへの貢献の選択肢を与えることは前向きな一歩だ。しかし、Google はすでにユーザーの明示的な同意なしにモデルを訓練するために膨大なデータを収集している。これにより、同意と倫理的なデータ収集に関する Google の新しい方針の真実性に疑問が生じる。
現実には、Google はウェブデータに無制限にアクセスし、ウェブパブリッシャーに許可を求める前に、それらを AI モデルの訓練に使用している。倫理的なデータ収集と同意が本当に Google の最優先事項であったなら、このオプションは何年も前に利用可能になっていたはずだ。
倫理的なデータ調達にはまだ長い道のりがある
テクノロジー業界が AI 訓練とデータ収集の倫理的影響に取り組まなければならないことは明らかだ。Google がウェブパブリッシャーにコンテンツの管理権を与えるという決定は正しい方向への一歩であるが、より広い文脈とより包括的な解決策の必要性を考慮することが重要である。
全体として、Google がウェブパブリッシャーに AI 訓練のためのコンテンツ使用を管理させる決定は前向きな進展である。しかし、この選択肢が提供されたのは、Google がすでに明示的な同意なしに膨大なデータを収集し使用した後であることを認識することが重要だ。
テクノロジー業界全体が倫理的なデータ収集と同意を優先し、ウェブパブリッシャーとユーザーの懸念に対応するより包括的な解決策に取り組む必要がある。

