„Anthropic researchers find the hidden usage of large language models“ wird von BTW Media profiliert, weil veröffentlichte Beweise es mit Internetinfrastruktur, Governance, operativen Abhängigkeiten oder Marktsichtbarkeit in Verbindung bringen.
„Anthropic researchers find the hidden usage of large language models“ wird als Institution der Internetinfrastruktur im Ökosystem der Internetinfrastruktur verfolgt.
Konfidenz-Score-Leitfaden
Mehrere öffentliche Quellen
- Forscher von Anthropic haben eine neue Sicherheitslücke in großen Sprachmodellen (LLMs) entdeckt, die als „Many-Shot Jailbreaking“ bezeichnet wird. Dabei kann das Modell durch die Vorbereitung mit mehreren harmlosen Fragen letztlich dazu gebracht werden, unangemessene Antworten zu geben, wie etwa Anleitungen zum Bau einer Bombe.
- Die Sicherheitslücke wird auf die Vergrößerung des„Kontextfensters“der neuesten LLMs zurückgeführt, das es ihnen ermöglicht, große Datenmengen im Kurzzeitgedächtnis zu speichern.
- Um dieses Problem zu lösen, arbeiten die Forscher daran, Anfragen zu klassifizieren und zu kontextualisieren, bevor sie an das Modell übergeben werden, um das Risiko zu verringern, ohne die Leistungsniveaus zu beeinträchtigen.
Eine neue Sicherheitslücke in großen Sprachmodellen: Das „Many-Shot Jailbreaking“ ermöglicht unangemessene Antworten, wenn das Modell mit harmlosen Fragen vorbereitet wird.
Anthropic-Forscher entdecken einen Bug in LLMs
Wie bringt man eine KI dazu, eine Frage zu beantworten, die sie nicht beantworten sollte? Es gibt zahlreiche „Jailbreak“-Techniken, und die Forscher von Anthropic haben eine neue gefunden, bei der große Sprachmodelle (LLMs) dazu überredet werden können, Ihnen zu sagen, wie man eine Bombe baut, wenn man sie zuerst mit einigen Dutzend weniger gefährlichen Fragen vorbereitet.
Diese Forschung wurde in einem Artikel dokumentiert und mit der KI-Community geteilt. Sie zeigt, dass LLMs mit größeren Kontextfenstern dazu neigen, bei verschiedenen Aufgaben besser abzuschneiden, wenn ihnen viele Beispiele im Prompt gegeben werden. Dies gilt auch für triviale Fragen, bei denen wiederholte Exposition die Genauigkeit der Antworten im Laufe der Zeit verbessert. Dieser Mechanismus erstreckt sich jedoch auch auf Antworten auf unangemessene Anfragen, was es wahrscheinlicher macht, dass das Modell nachgibt, nachdem es mit einer Reihe von harmlosen Fragen vorbereitet wurde.
Lesen Sie auch:KI-Missbrauch? Disney entgeht Kritik dank „Loki“-Poster
Wachsende Besorgnis über KI-Missbrauch
Dieser Bug könnte für Aufsehen in der Technologiebranche sorgen und die Besorgnis der Öffentlichkeit über KI-Missbrauch schüren. Obwohl der genaue Mechanismus hinter diesem Verhalten noch unklar ist, vermuten die Forscher, dass es die Fähigkeit des Modells betrifft, die Absicht des Benutzers anhand des bereitgestellten Kontexts zu erkennen.
Das Team hat bereits seine Kollegen und sogar seine Konkurrenten über diesen Angriff informiert, in der Hoffnung, dass dies „eine Kultur fördern wird, in der Exploits dieser Art offen zwischen LLM-Anbietern und Forschern geteilt werden“. Die Eindämmung dieser Sicherheitslücke stellt jedoch eine Herausforderung dar, da eine Einschränkung des Kontextfensters die Leistung des Modells negativ beeinflusst.
Signalbericht
- Signal: Anthropic-Forscher entdecken versteckte Nutzung großer Sprachmodelle
- Region: Global
- Marktklasse: Globale Cloud-Services-Trends
Betriebspräsenz
- Veröffentlichte Quellen sollten die betroffenen Parteien, den Betriebsfußabdruck und die Marktexposition identifizieren, bevor diese Trendkarte als vollständig betrachtet wird.
Marktkontext
- Operative Relevanz: Mittel
- Zeithorizont: Nächstes Quartal
Was ansehen?
- Achten Sie auf offizielle Stellungnahmen, regulatorische Aktualisierungen, Gefährdung von Kunden oder Partnern sowie ergänzende Offenlegungen.
Mitgliederbriefing
Vertiefter Trendkontext
Melden Sie sich mit der richtigen Mitgliedschaftsstufe an, um das vollständige Briefing und die Quellennotizen freizuschalten.
Nur für Strategic Circle
Strategic Circle
Offen für alle Leser. Schalten Sie Trend-Briefings nach Beitritt und Anmeldung frei.
Strategic Circle beitretenNur für Leadership Alliance
Leadership Alliance
Für Betreiber, Investoren und Politikteams, die Belege für Beziehungen, Fehlerpfade und Quellennotizen benötigen. Melden Sie sich an, um freizuschalten.
Leadership Alliance beitreten
