メインコンテンツにスキップ

シグナルブリーフィング / グローバルのクラウドサービストレンド

データ枯渇による AI 危機:迫るモデル崩壊を救う方法

OpenAI の ChatGPT 技術は 1 年足らずで急速に普及し、働き方や産業の未来に影響を与えています。すでに大企業の従業員の半数が日常的に利用しています。しかし、AI は学習データの枯渇による危機に直面しています。モデル崩壊を回避する方法を探ります。

データ枯渇による AI 危機:迫るモデル崩壊を救う方法
カテゴリー
グローバルのクラウドサービストレンド

「データ枯渇による AI 危機:迫るモデル崩壊を救う方法」は、インターネットインフラエコシステム内のインターネットインフラ機関として追跡されています。

地域
グローバル
シグナルの焦点
市場
コンテンツ種別
イベント
主要領域
市場
トピック
市場
影響
信頼度
信頼度スコアガイド
限定的な信頼度 (76%)

複数の公開情報源

「データ枯渇による AI 危機:迫るモデル崩壊を救う方法」は、公開証拠がインターネットインフラストラクチャ、ガバナンス、運用依存関係、または市場の可視性と結びついているため、BTW Media によってプロファイルされています。

OpenAI の ChatGPT 技術は 1 年足らずで急速に普及し、すでに働き方や産業の未来に影響を与えています。

OpenAI の ChatGPT 技術は 1 年足らずで急速に普及し、すでに働き方や産業の未来に影響を与えています。世界の大企業の一部では、従業員のほぼ半数がすでにこの種の技術を日常的に使用しています。数え切れないほどの企業が AI 分野に投資し、特にインターネット、教育、ゲームなどの成長分野で新製品を急いで投入しています。

ChatGPT、Stable Diffusion、Midjourney などの製品を支える大規模言語モデル(LLM)やその他のトランスフォーマーモデルのトレーニングに使用されるデータは、元々人間の情報源から得られたものであることはよく知られています。これらの情報源には、本、記事、写真、その他完全に人間によって作成されたオリジナルの著作物が含まれます。

大規模モデルのパラメータ数は増え続けており、数十億から数百億、さらに数千億へと増加しています。この爆発的な増加に伴い、AI のトレーニングに必要なデータ量も指数関数的に増加しています。OpenAI の GPT を例にとると、GPT-1 から GPT-3 にかけて、トレーニングデータセットのサイズは 4.5GB から 570GB に増加しました。

最近、Databricks が主催した Data+AI カンファレンスで、a16z の創設者であるマーク・アンドリーセンは、過去 20 年間にインターネットが蓄積した膨大なデータが新たな AI の波の台頭の重要な理由であると述べました。彼はデータを AI トレーニングの優れた学習素材と見なしています。

しかし、インターネットユーザーがウェブ上に残した膨大な有用・無用なデータにもかかわらず、これらのデータはすぐに AI トレーニングのために枯渇する可能性があります。

人工知能の研究・予測組織である Epoch が発表した論文では、高品質のテキストデータは 2023 年から 2027 年の間に枯渇すると予測されています。

研究チームは分析方法に重大な限界があり、モデルの不正確さが高いことを認めていますが、AI が驚くべき速度でデータセットを消費していることは否定しがたいです。

最近、ケンブリッジ大学、オックスフォード大学、トロント大学などの研究者が発表した論文は、AI が生成したコンテンツを AI のトレーニングに使用すると、新しいモデルの崩壊につながる可能性があると指摘しています。

研究者たちは次のように結論づけています:「他のモデルが生成したデータから学習すると、モデル崩壊が起こる。これは、モデルが時間の経過とともに真のデータ分布を忘れてしまう劣化プロセスである。このプロセスは、理想的な長期トレーニング状況でも避けられない。」

「生成データ」を使用して AI をトレーニングすると、なぜモデル崩壊が起こるのでしょうか?それを防ぐ方法はあるのでしょうか?

現段階では、AI はまだ人間の思考の原始的な模倣に過ぎず、その核心は統計プログラムのままです。研究者たちは、AI が生成したコンテンツで AI をトレーニングすると「統計的近似誤差」が生じると考えています。実際、統計的プロセスでは、確率の高いコンテンツがより強化され、確率の低いコンテンツが継続的に無視されるため、これがモデル崩壊の主な原因です。

これはモデルのパフォーマンス、信頼性、セキュリティに影響を与えます。研究者たちは、モデル崩壊は深刻な現象であり、LLM の開発者やユーザーの注意が必要だと警告しています。「この問題は、今後数年間で機械学習コミュニティにとって主要な課題の 1 つになると考えています」と彼らは述べています。

しかし、希望がすべて失われたわけではありません。

最初のアプローチはデータの隔離です。モデル崩壊に対処するために、研究チームは、AI 生成コンテンツ(AIGC)によるクリーンデータの汚染を避けるため、純粋に人間が生成したデータソースと AI 生成コンテンツを分離することを提案しています。

2 つ目は合成データの使用です。実際、AI のために特別に生成されたデータは、すでに AI トレーニングに広く使用されています。一部の実務家にとっては、AI 生成データがモデル崩壊につながるという現在の懸念は誇張されているかもしれません。したがって、鍵となるのは、AI 生成データの有効な部分を確認し、トレーニングされたモデルの有効性に基づいてフィードバックを提供する効果的なシステムを確立することです。OpenAI によるモデルトレーニングへの合成データの使用は、AI 業界でコンセンサスとなっています。

結論として、人間のデータ枯渇の問題にもかかわらず、AI トレーニングには解決策がないわけではありません。データの隔離と合成データの使用により、モデル崩壊の問題は効果的に克服でき、AI の継続的な発展を確保できます。

シグナル概要

  • シグナル: データ枯渇による AI 危機:迫るモデル崩壊を救う方法
  • 地域: グローバル
  • 市場分類: グローバルのクラウドサービストレンド

運用範囲

  • このトレンドマップを完全なものとして扱う前に、公開情報源が影響を受ける当事者、運用範囲、市場露出を特定する必要があります。

市場文脈

  • 運用上の関連性:
  • 時間軸: 次の四半期

注視点

  • 公式声明、規制更新、顧客やパートナーの露出、追加開示を注視してください。

会員向けブリーフィング

より深いトレンド文脈

適切な会員レベルでログインすると、完全なブリーフィングと情報源ノートを閲覧できます。

ストラテジック・サークル限定

ストラテジック・サークル

すべての読者に公開されています。参加してログインすると トレンドブリーフィング を閲覧できます。

ストラテジック・サークルに参加

リーダーシップ・アライアンス限定

リーダーシップ・アライアンス

関係証拠、障害経路、情報源ノートを必要とする事業者、投資家、政策チーム向けです。ログインすると閲覧できます。

リーダーシップ・アライアンスに参加
戻るさらに読む: グローバルのクラウドサービストレンド