• Automattic は AI 企業のモデルトレーニング用データを提供する契約を最終調整中です。
  • AI データトレーニング契約は、今日の厳しいオンラインパブリッシング環境で生き残りに苦戦するウェブサイトにとって、有利な機会となっています。

TumblrWordPress.comは、人工知能企業OpenAIMidjourneyにユーザーデータを販売する契約を結ぼうとしています。404 Media の報道によると、両プラットフォームの親会社 Automattic は、AI 企業のモデルトレーニング用データを提供する契約を最終調整中です。

契約におけるデータの不透明な性質

契約に含まれるデータの正確な性質は依然として不透明ですが、Tumblr の製品責任者 Cyle Gage による内部コミュニケーションとされるものは、転送準備中のデータの範囲について懸念を引き起こしました。報告によると、データにはプライベート情報やパートナー関連情報が含まれており、本来契約の一部になるべきではなかった可能性があります。これには、公開ブログ記事へのプライベート投稿、削除または停止されたブログ、未回答の質問、プライベート返信、露骨なコンテンツ、プレミアムパートナーブログの素材が含まれていたとされています。

参照記事:OpenAI が GPT-4 の「怠慢」を新アップデートで修正

Automattic の対応とコミットメント

コメントを求められた際、Automattic は公開声明で応答し、WordPress.com および Tumblr 上でホストされ、オプトアウトしていないサイトの公開コンテンツのみが共有されると強調しました。同社はまた、すべてのオプトアウト設定を尊重する姿勢を強調し、ユーザーが自身のデータを AI 企業を含む第三者がトレーニングに使用するのをブロックできる新しいオプトアウトツールを導入する意向を発表しました。

ユーザーデータ削除の提唱

Automattic が新しいオプトアウトツールのために作成したとされる内部 FAQ は、同社がユーザーの要求に応じてデータ削除を積極的に働きかける意向を示唆しています。このプロセスを「要求する」「提唱する」と表現した文書の言葉遣いには懸念が生じるかもしれませんが、Automattic の AI 責任者 Andrew Spittle 氏は、以前の協議に基づき、AI 企業はこれらの要求に応じると確信していると述べました。

参照記事:OpenAI のサム・アルトマン CEO と米国下院議長、議会で AI 規制の課題に取り組む

Tumblr と WordPress.com が直面する課題

これらの潜在的契約の背景には、急速に変化するオンラインパブリッシングの状況があり、ウェブサイトは生き残りのために新たな収入源を模索しています。特に Tumblr は多くの課題に直面しており、2023 年末には人員を最小限にまで削減したと伝えられています。この状況が、Tumblr や WordPress.com のようなプラットフォームにとって、このようなデータ契約の重要性を浮き彫りにしています。

より広範な業界の文脈では、このニュースは AI 企業がユーザー生成コンテンツを活用してモデルをトレーニングしようとする増加傾向に加わるものです。最近では、Google が Reddit と契約を結び、OpenAI も AI モデルトレーニング用のデータセット収集のためのパートナーシップを積極的に模索しています。