- Search-Augmented Factuality Evaluator (SAFE) ist eine Methode, die ein großes Sprachmodell (LLM) verwendet, um generierten Text in einzelne Fakten zu zerlegen.
- Dieses „übermenschliche“ KI-System kann die Faktenprüfung, Kosteneffizienz und Genauigkeit verbessern.
- Gary Marcus, ein prominenter KI-Forscher, hat angedeutet, dass „übermenschlich“ einfach besser als ein schlecht bezahlter Arbeiter bedeuten könnte, anstatt ein echter erfahrener Faktenprüfer zu sein.
Google DeepMind hat ein „übermenschliches“ KI-System vorgestellt, das menschliche Faktenprüfer bei der Bewertung der Genauigkeit von Informationen, die von großen Sprachmodellen generiert werden, übertreffen kann.
Search-Augmented Factuality Evaluator (SAFE)
Diese Studie mit dem Titel „Long-form factuality in large language models“ präsentiert SAFE als eine Methode, um generierten Text mithilfe großer Sprachmodelle in einzelne Fakten zu zerlegen. Sie verwendet dann die Ergebnisse der Google-Suche, um die Genauigkeit jeder Behauptung zu bestimmen.
Die Forscher verglichen SAFE mit menschlichen Annotatoren anhand eines Datensatzes mit etwa 16.000 Fakten und stellten fest, dass die Bewertungen von SAFE in 72 % der Fälle mit den menschlichen Bewertungen übereinstimmten. Noch beeindruckender: Wenn die Bewertungen von SAFE und Menschen abwichen, war das Urteil von SAFE in 76 % der Fälle korrekt.
Lesen Sie auch:Microsoft stellt DeepMind-Mitbegründer Mustafa Suleyman als CEO seiner neuen KI-Einheit ein
Die „übermenschliche“ Leistung löst Kontroversen aus
Während die Forscher behaupten, dass Agenten großer Sprachmodelle „übermenschliche“ Bewertungsleistungen erreichen können, fragen sich einige Experten, was „übermenschlich“ in diesem Zusammenhang tatsächlich bedeutet.
Der KI-Forscher Gary Marcus vermutet, dass „übermenschlich“ einfach bedeuten könnte, besser als ein schlecht bezahlter Arbeiter zu sein, anstatt ein echter erfahrener Faktenprüfer.
Marcus argumentiert, dass der Vergleich von SAFE mit menschlichen Experten-Faktenprüfern entscheidend ist, um seine übermenschliche Leistung wirklich zu demonstrieren.
Vorteile von SAFE
Ein offensichtlicher Vorteil von SAFE sind die Kosten – die Forscher stellten fest, dass die Nutzung des KI-Systems etwa 20-mal günstiger war als die Beauftragung menschlicher Faktenprüfer. Da das Informationsvolumen weiter wächst, wird ein kostengünstiger und effizienter Ansatz immer wichtiger.
Das DeepMind-Team nutzte SAFE auch, um die faktische Genauigkeit von 4 Familien (Gemini, GPT, Claude und PaLM-2) von 13 führenden Sprachmodellen zu bewerten. Sie stellten fest, dass größere Modelle im Allgemeinen weniger faktische Fehler produzieren.
Allerdings erzeugten selbst die leistungsstärksten Modelle noch eine große Anzahl falscher Aussagen.
Dies unterstreicht das Risiko einer übermäßigen Abhängigkeit von Sprachmodellen, die fließend ungenaue Informationen ausdrücken können. Automatische Faktenprüfwerkzeuge wie SAFE können eine Schlüsselrolle bei der Minderung dieser Risiken spielen.

