• インターネット上で大量のデータを収集する AI コンテンツハーベスターの問題が認識されており、ウェブサイト所有者は robots.txt を更新することでこれらのハーベスターへのアクセスをブロックする必要がある。
  • これは、AI 技術の急速な進歩に伴い、サイト所有者が新たに出現するクローラーに対応するためにルールを常に更新しなければならないという課題に直面していることを浮き彫りにしている。

BTW の見解
本記事は、インターネット上で大量のデータを収集する AI コンテンツハーベスターの問題と、ウェブサイト所有者が robots.txt ファイルを更新することでこれらのハーベスターへのアクセスをブロックする方法に焦点を当てている。同時に、AI 技術の急速な進歩に伴い、サイト所有者は新たなクローラーに対応するためにルールを絶えず更新しなければならないという課題にも直面していることを強調している。

- Rae Li、BTW ジャーナリスト

何が起きたか

ClaudeBotは、Anthropic の AI モデル訓練に使用されるウェブコンテンツクローラーで、最近 24 時間以内に技術アドバイスサイト iFixit.com に約 100 万回アクセスした。iFixitの CEO、Kyle Wiens はソーシャルメディア上でこのクローラーの迷惑な訪問について不満を述べ、サイトのコンテンツを無料で利用しただけでなく、開発・運用リソースを消費し、iFixit の利用規約に違反していると指摘した。Wiens は、サイトの robots.txt ファイルに禁止ディレクティブを追加することでトラフィックの一部を遮断している。この手法は、クローラーをブロックするためにテクノロジー業界で広く認識されているメカニズムである。

AI 技術の急速な発展に伴い、多くの AI 企業がウェブサイトからデータを収集するためにクローラーを使用し始めており、サイト所有者は新しいロボットに対応するためにファイルを適時に更新することが難しくなっている。例えば、Anthropic は以前、トレーニングデータを収集するために Claude-Web や Anthropic-AI を使用しており、サイトがこれらのボットを禁止しても ClaudeBot が引き続き出現することがあった。このため、Dark Visitors などの多くのサービスは、robots.txt エントリを自動的に更新するプログラム的な方法を提供し、サイト所有者が絶えず変化するクローラーの状況に対応するのを支援している。

あわせて読みたい:中国の投資家がサウジアラビア ETF に殺到、両国の接近が背景

あわせて読みたい:Amazon が Nvidia の市場支配に挑む AI チップを開発

なぜ重要か

AI 技術の急速な発展に伴い、ますます多くの企業や研究機関が、AI モデルを訓練・改善するためにウェブデータを収集する自動ツールを使用している。この行為は技術開発や研究において一般的であるが、データのプライバシー、著作権、およびウェブサイトリソースの悪用に関する議論を引き起こしている。

AI コンテンツハーベスターによる大量のアクセスは、ウェブサイトの正常な運用を妨げ、サーバーリソースを消費し、ユーザーエクスペリエンスに影響を与える可能性がある。サイト所有者は、クローラーのアクセスを防ぐために robots.txt ファイルを最新の状態に保つ必要があり、これには一定の技術的知識とリソースが必要で、小規模サイトにとっては課題となり得る。AI 技術が進歩するにつれて、健全なオンライン環境を確保しつつ、不適切なデータ収集行為からサイトを保護するための新しい戦略とツールが必要とされている。これはサイト所有者の利益だけでなく、インターネットエコシステム全体のバランスと持続可能性のためでもある。