- OpenAI は ChatGPT の新しいボイスモードを延期し、開始を 7 月頃に延期しました。
- この延期は、OpenAI の春のプレスイベントで別途発表された新しいビデオおよび画面共有機能の展開には影響しません。
私たちの見解
この決定は、同社が製品の品質とユーザー体験に強く集中していることを示すとともに、新技術の導入に伴う課題と複雑さを浮き彫りにしています。AI 技術が進化するにつれて、OpenAI の決定と戦略は、特に音声技術の進歩とデータセキュリティの確保に関して、業界とユーザーに深い影響を与えます。
– BTW 記者、Revel Cheng
OpenAI は ChatGPT の新しいボイスモードを延期し、開始を 7 月頃に延期しました。
何が起きたか
OpenAIの公式 Discord サーバーに投稿されたメッセージによると、同社は 6 月末までにChatGPT Plusの小規模なユーザーグループに高度な音声モードのアルファ版の展開を開始する予定でしたが、継続的な問題のために 7 月の未定の日に開始を延期せざるを得なくなりました。
5 月、OpenAI が AI ベースのチャットボットプラットフォームである ChatGPT 向けに、不気味なほどリアルでほぼ瞬時の「高度な音声モード」を初めて披露した際、同社はこの機能を数週間以内に ChatGPT の有料ユーザーに展開すると発表していました。
数か月後、OpenAI はさらなる時間が必要であると発表しました。
OpenAI は、高度な音声モードが、特定の内部セキュリティおよび信頼性チェックに合格するかどうかに応じて、秋までにはすべての ChatGPT Plus ユーザーに提供されるわけではない可能性があると述べています。ただし、この延期は、OpenAI の春のプレスイベントで別途発表された新しいビデオおよび画面共有機能の展開には影響しません。
これらの機能には、問題の写真から数学の問題を解決したり、デバイス上のさまざまな設定メニューを説明したりすることが含まれます。これらは、スマートフォンとデスクトップクライアントの両方で ChatGPT 上で動作するように設計されており、例えば macOS アプリは現在すべての ChatGPT ユーザーが利用可能です。
あわせて読みたい:Is Gemini AI open source? 知っておくべきこと
あわせて読みたい:Google、軽量オープン AI モデル「Gemma」を発表
これが重要な理由
発表イベントの舞台上で、OpenAI の従業員は、研究者のスマートフォンのカメラの前に置かれた紙に書かれた数学の問題を解くなど、ChatGPT がほぼ瞬時にリクエストに応答する様子を披露しました。
「ChatGPT の高度な音声モードは、感情や非言語的な合図を理解して応答することができ、AI との自然でリアルタイムな会話に近づけます」と OpenAI は書いています。「私たちの使命は、これらの新しい体験を思慮深い方法でお届けすることです。」
OpenAI の高度な音声モードは、デフォルトの声「Sky」が女優 Scarlett Johansson の声に似ていることから物議を醸しました。その後、Johansson 氏は声明を発表し、その声の調査と開発の詳細を明らかにするために法律顧問を雇い、OpenAI が ChatGPT 向けに彼女の声のライセンスを取得しようと繰り返し依頼したがそれを拒否したと述べました。
OpenAI は、許可なく Johansson の声や模倣を使用したことを否定しつつも、その後その声を削除しました。

