- Forscher von Anthropic haben eine neue Sicherheitslücke in großen Sprachmodellen (LLMs) entdeckt, die als „Many-Shot Jailbreaking“ bezeichnet wird. Dabei kann das Modell durch die Vorbereitung mit mehreren harmlosen Fragen letztlich dazu gebracht werden, unangemessene Antworten zu geben, wie etwa Anleitungen zum Bau einer Bombe.
- Die Sicherheitslücke wird auf die Vergrößerung des„Kontextfensters“der neuesten LLMs zurückgeführt, das es ihnen ermöglicht, große Datenmengen im Kurzzeitgedächtnis zu speichern.
- Um dieses Problem zu lösen, arbeiten die Forscher daran, Anfragen zu klassifizieren und zu kontextualisieren, bevor sie an das Modell übergeben werden, um das Risiko zu verringern, ohne die Leistungsniveaus zu beeinträchtigen.
Eine neue Sicherheitslücke in großen Sprachmodellen: Das „Many-Shot Jailbreaking“ ermöglicht unangemessene Antworten, wenn das Modell mit harmlosen Fragen vorbereitet wird.
Anthropic-Forscher entdecken einen Bug in LLMs
Wie bringt man eine KI dazu, eine Frage zu beantworten, die sie nicht beantworten sollte? Es gibt zahlreiche „Jailbreak“-Techniken, und die Forscher von Anthropic haben eine neue gefunden, bei der große Sprachmodelle (LLMs) dazu überredet werden können, Ihnen zu sagen, wie man eine Bombe baut, wenn man sie zuerst mit einigen Dutzend weniger gefährlichen Fragen vorbereitet.
Diese Forschung wurde in einem Artikel dokumentiert und mit der KI-Community geteilt. Sie zeigt, dass LLMs mit größeren Kontextfenstern dazu neigen, bei verschiedenen Aufgaben besser abzuschneiden, wenn ihnen viele Beispiele im Prompt gegeben werden. Dies gilt auch für triviale Fragen, bei denen wiederholte Exposition die Genauigkeit der Antworten im Laufe der Zeit verbessert. Dieser Mechanismus erstreckt sich jedoch auch auf Antworten auf unangemessene Anfragen, was es wahrscheinlicher macht, dass das Modell nachgibt, nachdem es mit einer Reihe von harmlosen Fragen vorbereitet wurde.
Lesen Sie auch:KI-Missbrauch? Disney entgeht Kritik dank „Loki“-Poster
Wachsende Besorgnis über KI-Missbrauch
Dieser Bug könnte für Aufsehen in der Technologiebranche sorgen und die Besorgnis der Öffentlichkeit über KI-Missbrauch schüren. Obwohl der genaue Mechanismus hinter diesem Verhalten noch unklar ist, vermuten die Forscher, dass es die Fähigkeit des Modells betrifft, die Absicht des Benutzers anhand des bereitgestellten Kontexts zu erkennen.
Das Team hat bereits seine Kollegen und sogar seine Konkurrenten über diesen Angriff informiert, in der Hoffnung, dass dies „eine Kultur fördern wird, in der Exploits dieser Art offen zwischen LLM-Anbietern und Forschern geteilt werden“. Die Eindämmung dieser Sicherheitslücke stellt jedoch eine Herausforderung dar, da eine Einschränkung des Kontextfensters die Leistung des Modells negativ beeinflusst.

