OpenAI は、音声対話機能と画像認識機能という 2 つの画期的な機能を含む、一連の革新的な改良を発表しました。
ChatGPT と文字通り会話する
最も重要な改良点の 1 つは、ChatGPT に音声対話機能が追加されたことです。これによりユーザーは AI と音声で会話できるようになります。自然な会話体験を提供するために設計された、5 つのリアルな合成音声から選択できます。これは、チャットボットとリアルタイムで電話会話するようなもので、ChatGPT はユーザーの口頭での質問に迅速に回答します。
これを支える技術は、2 つの異なるモデルに基づいています。既存の音声認識モデルである OpenAI の Whisper が音声をテキストに変換し、それが ChatGPT に送信されます。一方、新しい音声合成モデルが ChatGPT の応答を音声に変換します。
最近のデモンストレーションで、OpenAI のプロダクト責任者である Joanne Jang 氏は、合成音声のラインナップを披露しました。これらの音声は、契約した俳優の声で音声合成モデルをトレーニングすることで、綿密に設計されました。OpenAI は、将来的にユーザーが独自のカスタム音声を作成できるようになることも視野に入れています。これらの音声制作における主な基準は、心地よく聞きやすいものにすることでした。
この進歩は ChatGPT だけにとどまらず、OpenAI は音声合成モデルを Spotify を含む他社と共有しています。例えば Spotify は、この合成音声技術を活用して、ポッドキャスターの合成音声バージョンを使い、著名人のポッドキャストを多言語に翻訳しています。
画像認識がついに可能に
ChatGPT にもう 1 つ画期的に追加されたのが、画像認識機能です。GPT-4 の導入時に OpenAI が発表していたこの機能により、ユーザーはアプリに画像をアップロードし、その内容について質問できるようになりました。つまり、視覚的なコンテンツについて ChatGPT に質問できるということです。
実演では、GPT-4 の開発に携わる科学者 Raul Puri 氏が、数学の問題の写真をアップロードし、ChatGPT に解答を求めました。驚くべきことに、ChatGPT は正しい手順を示しました。ユーザーはまた、スクリーンショットをアップロードしてアドバイスを求めることで、技術的な問題の解決にもこの機能を活用しています。
さらに、ChatGPT の画像認識機能は、視覚障害者を支援するために設計されたアプリ「Be My Eyes」でも使用されています。ユーザーは画像をアップロードし、チャットボットにその説明を求めることができ、新たな自立のレベルを提供します。
しかしながら、OpenAI はこれらのアップデートに伴う潜在的なリスク、特に異なる AI モデルを組み合わせる場合のリスクを十分に認識しています。例えば、ユーザーは個人が写っている写真について質問することはできません。同社は悪用を防ぐための警戒の必要性を認めており、ユーザーと非ユーザーの両方を危害から守ることに尽力しています。
ChatGPT の今後の課題
これらのアップデートは、OpenAI の実験的モデルから実用的な製品への急速な進化を象徴しています。アプリのプレミアム版である ChatGPT Plus は、GPT-4 と DALL-E を組み合わせており、Siri、Google Assistant、Alexa などの音声アシスタントにとって強力な競合相手となっています。かつては一部のソフトウェア開発者だけがアクセスできたものが、今では月額 20 ドルのサブスクリプションで誰でも利用できるようになりました。
ChatGPT が「見て、聞いて、話す」能力を拡張するにつれて、考慮すべき課題もあります。音声認識は、通常とは異なるアクセントを持つ人々にとってアクセシビリティの問題を引き起こす可能性があります。さらに、合成音声には、より深い探究を必要とする社会的・文化的な意味合いがあります。
しかし OpenAI は、主要な懸念事項を解決したと述べており、これらのアップデートは安全にリリースできると考えています。AI の能力を洗練させ拡張する旅は続いており、ChatGPT がその先頭に立っています。確かに課題や疑問は残っていますが、今回のアップデートは、より強力でインタラクティブな AI アシスタントの実現に向けた重要な一歩です。

