• OpenAI は今週月曜日にイベントを開催し、新しいマルチモーダルデジタルアシスタントを発表する可能性がある。
  • マルチモーダルであることで、アシスタントは外部の標識を認識・解釈するといった視覚的手がかりをプロンプトとして利用できるようになる。
  • これは、Google アシスタントや最近発表された Gemini といった同社のデジタルアシスタントに対する直接的な脅威となる。

OpenAIは、一部の顧客に新しいマルチモーダル AI モデルを披露し、物体を認識し対話できる能力を示したと、情報サイト The Information が最近報じた。同メディアは匿名情報源から情報を得たと主張し、本日後刻発表される内容の一端である可能性があると推測している。

新しいマルチモーダル AI モデル

マルチモーダルとは、AI がテキスト以外の入力も処理できる能力を指す。このデジタルアシスタントは、カメラに接続し、外界のデータを処理して、観察した内容について追加の詳細を応答することができる。例えば、自分が理解できない言語で書かれた標識にカメラを向けると、ChatGPT にその標識を認識・翻訳するよう頼むことができる。そして AI が会話を続ける。

これが聞き覚えがあるなら、それは Google レンズ、Google アシスタント、さらに最近の Google Gemini が既に実現しているからだ。ChatGPT もすでにそれが可能だが、単一のインターフェースを通してではない。

報道によると、この新モデルは画像と音声を、個別の文字起こし・音声合成モデルよりも速く正確に解釈できる。The Information は、このモデルが「理論上」数学の学生を支援したり、現実世界の標識を翻訳したりでき、顧客サービス担当者が「通話者の声の抑揚や皮肉をより良く理解する」のに役立つと報じている。

つまり、Gemini(ひいては Google アシスタントや Apple の Siri)の直接の競合となる。

このモデルは「特定の種類の質問」に GPT-4 Turbo よりも優れて答えることができるが、それでも確信犯的な誤りを犯す可能性がある、と関係者は述べている。

こちらもお読みください:自動運転車はどのように動くのか?

こちらもお読みください:OpenAI、技術協力で偽情報対策

OpenAI に関する憶測

開発者 Ananay Arora は、上述の通話関連コードのスクリーンショットを共有し、OpenAI が新しい統合 ChatGPT 機能も準備中である可能性を示唆した。Arora はまた、OpenAI がリアルタイムの音声・ビデオチャット用サーバーを設置した証拠も発見した。

さらに、Altman は同社が新しい AI 搭載検索エンジンをリリースしないと述べた。しかし The Information の報道が正しければ、それでも Google I/O 開発者会議の期待を裏切る可能性がある。