「Google’s Gemini 1.5 Pro can now hear」は、公開された証拠がインターネットインフラ、ガバナンス、運用依存関係、または市場での可視性に関連付けているため、BTW Media によってプロファイリングされています。
Google の Gemini 1.5 Pro 向けのアップデートにより、モデルが音声を聞き取れるようになりました。このモデルは、アップロードされた音声ファイルを聞き取り、決算報告の通話やビデオの音声などのコンテンツから、テキストの書き起こしを参照することなく情報を生成できるようになりました。Google はまた、Vertex AI にアクセスできるユーザー向けに、Gemini 1.5 Pro の公開プレビュー版を提供しています。テキスト、コード、ビデオ、そして今回追加されたアップロード音声(ビデオの音声を含む)を処理できる Gemini 1.5 Pro は、対応するテキスト記録を必要とせずに、音声を聞き取り、分析し、情報を抽出することができます。Gemini 1.5 Pro は Google のリブランドされたロボットで、以前は Bard と呼ばれていました。Gemini 1.5 Pro はそのモデルの最新版であり、今年 2 月に限定的な開発者向けに公開されました。Google はまた、AI アプリケーション開発プラットフォームである Vertex AI を通じて、Gemini 1.5 Pro を初めて一般公開すると発表しました。Gemini 1.5 Pro は 2 月に初めて発表されました。Google はラスベガスで開催された Cloud Next カンファレンスで、このアップデートの詳細を共有しました。以前は、高度なチャットボット Gemini を支える Gemini
Ultra LLM を Gemini ファミリーで最も強力なモデルと位置付けていましたが、今回 Google は Gemini 1.5 Pro を自社の最も強力な生成モデルとしています。同社は、このバージョンは学習能力が向上しており、モデルの追加調整が不要であると付け加えています。Gemini 1.5 Pro は、Vertex AI にアクセスできないユーザー向けにも公開ドキュメントが提供されています。関連記事:OpenAI の音声クローニングツール、15 秒のサンプルであなたの声を模倣テキスト画像生成モデル「Imagen 2」 Gemini 1.5 Pro だけが Google からのアップデートを受ける主要な AI モデルではありません。Imagen 2 はテキスト画像生成モデルで、Gemini の画像生成能力の向上に貢献し、画像内の要素を追加・削除できる修正・修復機能も追加されます。Imagen の多くの新機能、特にインペインティングとアウトペインティングは、Stability AI の Stable Cascade や Getty の iStock による Generative AI など、他のテキスト画像生成モデルにも搭載されており、新しい Samsung Galaxy スマートフォンでのより広範な一般提供も見逃せません。
会員向け解説
トレンドの深掘り
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると トレンド解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
関係性の裏付け、障害経路、情報源メモを必要とする通信事業者、投資家、政策チーム向けです。ログインするとご覧いただけます。
Leadership Alliance に参加スナップショット
信頼度スコアガイド
複数の公開情報源

