• Google は、OpenAIの YouTube での活動に関する未確認の報告を確認し、同社の robots.txt と利用規約がコンテンツの無断スクレイピングやダウンロードを禁止していると述べた。
  • Meta は、トレーニングデータの入手制限と、Cambridge Analytica スキャンダルによるプライバシー懸念に直面した。同社は OpenAI に追いつくために書籍のライセンス購入や出版社の買収を検討し、消費者データの使用制限にも直面した。

Wall Street Journal は今週初め、AI 企業が高品質なトレーニングデータの収集において壁に直面していると報じた。New York Times は、企業がこの問題に対処する方法の一部を詳述している。

OpenAI はトレーニングデータを必要としている

トレーニングデータを切望した OpenAI は、障害を克服するために音声文字起こしモデル Whisper を開発し、YouTube 動画の 100 万時間以上を文字起こしして、最先端の大規模言語モデル GPT-4 を訓練した。New York Times によると、同社はこれが法的に問題があると知っていたが、フェアユースにあたると見なした。OpenAI の広報担当者 Lindsay Held は The Verge に対し、同社は各モデルに「固有の」データセットを編成して「世界を理解する手助け」をし、世界規模の研究競争力を維持していると述べた。

Times の記事によると、同社は 2021 年に関連データが枯渇し、ポッドキャスト、オーディオブック、YouTube 動画の文字起こしを緊急計画として議論した。当時、Google はチェスゲームのデータベースである Quizlet や、Github のコンピュータコードから得た情報をモデルの訓練に使用していた。

関連記事:Meta、Netflix によるユーザーの個人情報へのアクセスを否定

Google の対応

Google の広報担当者 Matt Bryant は The Verge へのメールで、同社は「未確認の報告を確認した」と述べ、「当社の robots.txt と利用規約は、YouTube コンテンツの無断スクレイピングやダウンロードを禁止している」と付け加え、同社の利用規約を反映していることを示した。Bryant 氏は、Google が「明確な法的または技術的根拠がある場合に」そのような無断使用を防ぐための「技術的および法的措置」を取っていると述べた。

Times によると、Google の法務部門は、同社のプライバシーチームに対し、Google Docs などのオフィスツールを含む消費者データの処理範囲を拡大するために、ポリシーの文言を調整するよう求めた。Google は、独立記念日の週末の注意散漫を利用するため、7 月 1 日に新しいポリシーを公表する意向であるとされている。

関連記事:OpenAI の音声クローン作成ツールは、15 秒のサンプルであなたの声を模倣する

Meta の対応

Meta もまた、良質なトレーニングデータの入手制限に直面し、Times が聞いた録音によると、同社の AI チームは OpenAI に追いつこうとする中で、著作権で保護された作品を許可なく使用する問題を議論している。同社は書籍のライセンス料の支払いや、大手出版社の買収などの措置を検討した。Cambridge Analytica スキャンダル後のプライバシー改革によって、同社の消費者データの使用方法も明らかに制限された。

Google、OpenAI、そして AI トレーニング業界全体は、モデル用のトレーニングデータの急速な減少に悩まされており、これらのモデルはデータを吸収すればするほど性能が向上する。Journal は今週、2028 年までに企業が新しいコンテンツの生成量を上回る可能性があると報じた。

Journal は、合成データやカリキュラム学習など、モデルエラーの問題を解決する方法を提案している。しかし、これらの方法はどれも実証されていない。企業は許可の有無にかかわらず、見つけたものは何でも使用できるが、それには訴訟のリスクが伴う。