• Google integriert Gemini Nano, das kleinste seiner KI-Modelle, direkt in den Chrome-Desktop-Client, ab Chrome 126.
  • Google ermöglicht es vielen erweiterten Chrome-APIs, Text im Browser mit seinem Gemini-Modell zu übersetzen, zu untertiteln und zu transkribieren.

Auf der Entwicklerkonferenz Google I/O 2024 am Dienstag gab Google bekannt, dass es sein kleinstes KI-Modell,Gemini Nano, ab Chrome 126 direkt in den Chrome-Desktop-Client integriert.

Das KI-Modell Gemini Nano in Chrome auf dem Desktop

Gemini, das in drei Versionen erhältlich ist – Gemini Ultra, Gemini Pro und Gemini Nano –, ist die lang erwartete nächste Generation der GenAI-Modellfamilie von Google, entwickelt von Googles KI-Forschungslaboren DeepMind und Google Research. Gemini Nano, ein kleineres „destilliertes“ Modell, läuft auf Mobilgeräten wie dem Pixel 8 Pro. Das Unternehmen gibt an, dass die jüngsten Arbeiten zur Unterstützung von WebGPU und WASM in Chrome es diesen Modellen ermöglichen, auf einer breiten Palette von Hardware mit angemessener Geschwindigkeit zu laufen.

In einem Briefing vor der Ankündigung am Dienstag erwähnte Jon Dahlke, Director of Product Management für Chrome bei Google, dass Gespräche mit anderen Browser-Anbietern im Gange seien, um diese Fähigkeit – oder eine vergleichbare – ebenfalls in ihren jeweiligen Browsern zu implementieren.

„Wir haben begonnen, mit anderen Browsern zusammenzuarbeiten und werden ein Early-Preview-Programm für Entwickler eröffnen“, schrieb Dahlke in der Ankündigung vom Dienstag. „Mit WebGPU, WASM und Gemini, die in Chrome integriert sind, glauben wir, dass das Web bereit für KI ist.“

À lire aussi:Googles Gemini soll nächstes Jahr auf Android-Handys landen

À lire aussi:Ein Blick auf Alphabets Gemini, das KI-Modell, das ChatGPT-4 herausfordern will

Schreibassistent

Google aktiviert viele erweiterte APIs in Chrome, um sein Gemini-Modell für Aufgaben wie Übersetzung, Untertitelung und Transkription von Text direkt im Browser zu nutzen. Laut dem Unternehmen wird dies Entwicklern ermöglichen, das Modell auf dem Gerät für ihre eigenen KI-Funktionen zu nutzen. Google beabsichtigt, diese verbesserte Fähigkeit zu nutzen, um Funktionen wie das aktuelle Tool „Hilf mir beim Schreiben“ von Workspace Lab in Gmail zu unterstützen.

Bisher treibt es einige Funktionen auf dem Pixel 8 Pro, Pixel 8 und Samsung Galaxy S24 an, darunter Summarize in Recorder und Smart Reply in Gboard. Die Recorder-App, die es Benutzern ermöglicht, einfach auf eine Schaltfläche zu tippen, um Audio aufzunehmen und zu transkribieren, bietet jetzt eine von Gemini unterstützte Zusammenfassung Ihrer aufgezeichneten Gespräche, Interviews, Präsentationen und anderer Segmente.

Dahlke erklärte auf der Entwickler-Keynote auf der I/O: „Wir möchten Ihnen jetzt Zugriff auf die Gemini-Modelle in Chrome geben. Unsere Vision ist es, Ihnen die leistungsstärksten KI-Modelle in Chrome anzubieten, um Milliarden von Nutzern zu erreichen, ohne sich um Prompt-Engineering, Feintuning, Kapazität und Kosten kümmern zu müssen. Alles, was Sie tun müssen, ist, ein paar High-Level-APIs aufzurufen – übersetzen, untertiteln, transkribieren. Das ist eine große Veränderung für das Web und wir wollen es richtig machen.“