メインコンテンツへスキップ

シグナル解説 / グローバルのクラウドサービストレンド

Google の Gemini 1.5 Pro が音声認識に対応

Google の Gemini 1.5 Pro は、アップロードされた音声ファイルを聞き取り、決算報告の通話やビデオの音声などのコンテンツから、テキストの書き起こしなしで情報を生成できるようになりました。

Google の Gemini 1.5 Pro が音声認識に対応

「Google’s Gemini 1.5 Pro can now hear」は、公開された証拠がインターネットインフラ、ガバナンス、運用依存関係、または市場での可視性に関連付けているため、BTW Media によってプロファイリングされています。

Google の Gemini 1.5 Pro 向けのアップデートにより、モデルが音声を聞き取れるようになりました。このモデルは、アップロードされた音声ファイルを聞き取り、決算報告の通話やビデオの音声などのコンテンツから、テキストの書き起こしを参照することなく情報を生成できるようになりました。Google はまた、Vertex AI にアクセスできるユーザー向けに、Gemini 1.5 Pro の公開プレビュー版を提供しています。テキスト、コード、ビデオ、そして今回追加されたアップロード音声(ビデオの音声を含む)を処理できる Gemini 1.5 Pro は、対応するテキスト記録を必要とせずに、音声を聞き取り、分析し、情報を抽出することができます。Gemini 1.5 Pro は Google のリブランドされたロボットで、以前は Bard と呼ばれていました。Gemini 1.5 Pro はそのモデルの最新版であり、今年 2 月に限定的な開発者向けに公開されました。Google はまた、AI アプリケーション開発プラットフォームである Vertex AI を通じて、Gemini 1.5 Pro を初めて一般公開すると発表しました。Gemini 1.5 Pro は 2 月に初めて発表されました。Google はラスベガスで開催された Cloud Next カンファレンスで、このアップデートの詳細を共有しました。以前は、高度なチャットボット Gemini を支える Gemini

Ultra LLM を Gemini ファミリーで最も強力なモデルと位置付けていましたが、今回 Google は Gemini 1.5 Pro を自社の最も強力な生成モデルとしています。同社は、このバージョンは学習能力が向上しており、モデルの追加調整が不要であると付け加えています。Gemini 1.5 Pro は、Vertex AI にアクセスできないユーザー向けにも公開ドキュメントが提供されています。関連記事:OpenAI の音声クローニングツール、15 秒のサンプルであなたの声を模倣テキスト画像生成モデル「Imagen 2」 Gemini 1.5 Pro だけが Google からのアップデートを受ける主要な AI モデルではありません。Imagen 2 はテキスト画像生成モデルで、Gemini の画像生成能力の向上に貢献し、画像内の要素を追加・削除できる修正・修復機能も追加されます。Imagen の多くの新機能、特にインペインティングとアウトペインティングは、Stability AI の Stable Cascade や Getty の iStock による Generative AI など、他のテキスト画像生成モデルにも搭載されており、新しい Samsung Galaxy スマートフォンでのより広範な一般提供も見逃せません。

会員向け解説

トレンドの深掘り

適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。

Strategic Circle 限定

Strategic Circle

すべての読者に公開されています。参加してログインすると トレンド解説 を閲覧できます。

Strategic Circle に参加

Leadership Alliance 会員限定

Leadership Alliance

関係性の裏付け、障害経路、情報源メモを必要とする通信事業者、投資家、政策チーム向けです。ログインするとご覧いただけます。

Leadership Alliance に参加
スナップショット
地域
グローバル
シグナルに注目
業界・市場
コンテンツ種別
イベント
主要領域
業界・市場
トピック
業界・市場
影響
信頼度
信頼度スコアガイド
限定的な確信度 (82%)

複数の公開情報源

戻る関連記事: グローバルのクラウドサービストレンド