- Konkurrenz zu Google Gemini: Der Parameterumfang von MM1 konkurriert mit den ersten Versionen der KI-Modelle von Google.
- Innovatives kontextuelles Lernen: Die Fähigkeit von MM1, neue Anfragen basierend auf dem aktuellen Gesprächskontext zu verstehen und zu beantworten.
Apple hat MM1 vorgestellt, eine neue Generation multimodaler Modelle, die in der Lage sind, nahtlos mit Bildern und Text zu interagieren, und ebnet damit den Weg für ein intuitiveres und reaktionsschnelleresSiri- und iMessage-Erlebnis.
MM1: die bahnbrechende multimodale KI
Apple präsentierte MM1, eine innovative Suite multimodaler KI-Modelle, die sowohl visuelle Bilder als auch Textdaten verarbeiten können. Diese Modelle weisen eine beeindruckende Anzahl von Parametern auf, bis zu 30 Milliarden, was sie zu einem ernsthaften Konkurrenten für die ersten Iterationen der Gemini-Modelle von Google macht.
Lesen Sie auch:Anthropic behauptet, dass sein neuestes KI-Modell GPT-4 übertrifft
Die MM1-Modelle sind in der Lage, Anweisungen zu interpretieren und auszuführen, die sowohl visuelle als auch textliche Elemente beinhalten. Beispielsweise kann die KI die kombinierten Kosten von zwei Getränken berechnen, indem sie die auf einer Speisekarte angezeigten Preisinformationen analysiert.
Eine der bemerkenswerten Eigenschaften von MM1 ist seine Fähigkeit zum kontextuellen Lernen. Dies ermöglicht es dem Modell, Anfragen basierend auf den kontextuellen Informationen im laufenden Diskurs zu verstehen und zu beantworten, ohne dass ein spezifisches Neutraining oder eine Feinabstimmung für jede neue Anfrage oder Aufgabe erforderlich ist.
Diese Fähigkeit zum kontextuellen Lernen könnte es dem Modell möglicherweise ermöglichen, detaillierte Bildbeschreibungen zu generieren oder Fragen zum Inhalt von bildbasierten Nachrichten zu beantworten, selbst wenn es zuvor keinen ähnlichen Inhalten ausgesetzt war.
Lesen Sie auch:Apple wird die „Fortschritte von visionOS“ auf der WWDC 2024 vorstellen
Verbesserung der Benutzererfahrung
In Bezug auf die Verbesserung der Benutzererfahrung könnten die multimodalen Verständnisfähigkeiten von MM1 von Apple genutzt werden, um die Leistung seines Sprachassistenten Siri zu verbessern. Dies würde es Siri ermöglichen, Antworten auf Fragen zu geben, die auf visuellen Daten basieren, wie beispielsweise bildbasierte Fragen. Darüber hinaus könnte MM1 helfen, den Kontext von Bildern und Textnachrichten, die über iMessage geteilt werden, zu interpretieren und den Benutzern so relevantere Antwortvorschläge zu bieten.

