- OpenAI の「Data Partnerships」プログラムは、多様でグローバルなデータセットを作成することで、AI における欧米中心のバイアスを低減することを目指しています。
- このイニシアチブは、AI モデルに存在するバイアスを是正するため、多様な言語や文化データの取り込みに注力しています。
- OpenAI は、許可なく個人の創作物やクリエイティブ作品を AI トレーニングに使用した可能性があり、批判や法的問題に直面しています。
OpenAI は、AI トレーニングデータの多様性を欧米中心の基準を超えて拡大することを目的とした「Data Partnerships」イニシアチブを発表しました。この革新的なプログラムは、さまざまな組織と協力して、AI モデルのトレーニングのための包括的な公開および非公開データセットを開発するよう設計されています。

AI におけるデータバイアスへの取り組み
このイニシアチブは、AI におけるデータバイアスの蔓延する問題に対処するものです。従来の AI モデルは、特に画像データベースにおいて、欧米諸国のデータに顕著な偏りを示してきました。このバイアスは、インターネット上での欧米の画像の過剰表現に起因し、意図せずにこれらのバイアスを増幅させる AI モデルを生み出し、悪影響を及ぼす可能性があります。
OpenAI の Data Partnerships は、世界の人間社会をより正確に反映する大規模なデータセットを収集することで、これを是正しようとしています。これらのデータセットは、多様な言語や主題における長文や対話など、さまざまな形式を通じて人間の意図を捉えることに焦点を当てます。このより広範なデータセットは、AI モデルが多様な主題、業界、文化、言語についてより深い理解を得るのに役立ちます。
あわせて読みたい:OpenAI、コーディング不要のパーソナル AI チャットボット向け GPT Store を開始
公開データと非公開データの収集
このプログラムは、画像、音声、動画を含む複数のモダリティで動作し、長文や会話など人間の意図を表すデータを優先します。データの整合性を確保するため、OpenAI は光学文字認識や自動音声認識などのツールを使用してデジタル化を行い、機密情報や個人情報を確実に削除する予定です。OpenAI は 2 種類のデータセットの開発を計画しています。1 つ目はオープンソースデータセットで、AI トレーニングのために無償で提供されます。2 つ目は非公開データセットで、データの機密性を保ちつつ、OpenAI のモデルが特定の領域をより深く理解できるようにしたい組織向けにカスタマイズされます。
あわせて読みたい:OpenAI、AGI 開発を重視するために基本価値を静かに更新
コラボレーションと論争
OpenAI はすでに AI 能力向上のためのパートナーシップを開始しています。アイスランド政府や Miðeind ehf との協力により、GPT-4 のアイスランド語能力が向上しました。同様に、Free Law Project とのパートナーシップは、モデルの法的文書の理解を改善しました。このイニシアチブの一見利他的な性質にもかかわらず、OpenAI は潜在的な商業的動機に対する批判に直面しています。公正な補償なしに他社を犠牲にして OpenAI のモデルを改善する可能性のあるアプローチは、論争を巻き起こしました。クリエイターや作家による OpenAI と Microsoft に対する最近の訴訟は、AI モデルのトレーニングに彼らの作品が許可なく使用された問題を浮き彫りにし、AI 業界におけるデータの倫理的使用と補償に関する疑問を提起しています。

