OpenAIs neuestes Modell, das den Trick „ignoriere alle vorherigen Anweisungen“ vereitelt, wird von BTW Media profiliert, da veröffentlichte Beweise es mit Internet-Infrastruktur, Governance, betrieblichen Abhängigkeiten oder Marktsichtbarkeit in Verbindung bringen.
OpenAIs neuestes Modell, das den Trick „ignoriere alle vorherigen Anweisungen“ vereitelt, wird als Internetinfrastruktur-Institution im Internetinfrastruktur-Ökosystem verfolgt.
Konfidenz-Score-Leitfaden
Mehrere öffentliche Quellen
- OpenAI hat GPT-4o Mini vorgestellt, das die Sicherheitstechnik der „Befehlshierarchie“ verwendet, um Chatbots vor irreführenden Befehlen zu schützen.
- Das Update von GPT-4o Mini durch OpenAI kommt genau richtig, angesichts der laufenden Debatten über KI-Sicherheit und -Transparenz, mit internen und externen Aufrufen zur Verbesserung der Praktiken.
UNSERE MEINUNG
Im Kontext der schnellen Entwicklung der KI steht die Frage der Sicherheit und Zuverlässigkeit im Mittelpunkt der Branche. Kürzlich hat OpenAI sein neuestes Modell, GPT-4o Mini, vorgestellt, das eine langjährige technische Herausforderung bewältigen soll: Chatbots daran zu hindern, durch bösartige Befehle manipuliert zu werden. Diese Innovation zeigt nicht nur die Fortschritte der KI beim Selbstschutz, sondern spiegelt auch die Bemühungen der Technologieunternehmen wider, die Benutzererfahrung zu verbessern und Daten zu sichern.
– Elodie Qian, BTW-Journalistin
Was ist passiert
OpenAI hat GPT-4o Mini vorgestellt, ein neues Modell, das sich mit dem Trick „ignoriere alle vorherigen Anweisungen“ befasst. Dieses Modell verwendet eine Sicherheitstechnik namens „Befehlshierarchie“, die die Abwehr eines Modells gegen Missbrauch und unbefugte Anweisungen stärkt. Modelle mit dieser Technik priorisieren die ursprünglichen Entwickleranweisungen gegenüber jedem Versuch des Benutzers, es zu täuschen.
Olivier Godement, der das API-Plattformprodukt bei OpenAI leitet, erklärte, dass die Befehlshierarchie die viral gewordenen Prompt-Injection-Angriffe (d. h. die KI mit hinterhältigen Befehlen zu täuschen) verhindern wird, die man überall im Internet sieht.
„Das bringt dem Modell im Wesentlichen bei, die Systemnachricht des Entwicklers zu befolgen und tatsächlich einzuhalten“, sagte Godement. Auf die Frage, ob dies bedeute, dass es den Angriff „ignoriere alle vorherigen Anweisungen“ stoppen sollte, antwortete Godement: „Genau das.“
„Im Konfliktfall müssen Sie zuerst der Systemnachricht folgen. Wir haben [Bewertungen] durchgeführt, und wir erwarten, dass diese neue Technik das Modell noch sicherer macht als zuvor“, fügte er hinzu.
Diese Innovation steht im Einklang mit OpenAIs Ziel, vollständig automatisierte digitale Agenten zu entwickeln. Das Unternehmen hat kürzlich angekündigt, dass es kurz davor steht, solche Agenten zu erstellen. Die Methode der Befehlshierarchie wird als wesentlich angesehen, um die Sicherheit vor dem großflächigen Einsatz dieser Agenten zu gewährleisten. Ohne solche Maßnahmen riskiert ein Agent, der für harmlose Aufgaben wie das Schreiben von E-Mails bestimmt ist, manipuliert zu werden, um schädliche Aktionen wie die Preisgabe sensibler Informationen durchzuführen.
Lesen Sie auch:OpenAI bringt GPT-4o Mini auf den Markt, eine günstigere Version seines KI-Modells
Lesen Sie auch:Ein Hacker dringt in OpenAI ein und stiehlt interne KI-Technologiedetails
Warum das wichtig ist
Bestehende große Sprachmodelle, wie das Forschungspapier erklärt, unterscheiden nicht zwischen Benutzeranweisungen und Systemanweisungen. Die Befehlshierarchie von GPT-4o Mini erhöht die Systemanweisungen, gibt ihnen die höchste Priorität, während falsch ausgerichtete Anweisungen herabgestuft werden. Das Modell wird trainiert, schädliche Anweisungen zu identifizieren und zu ignorieren, indem es mit einer Unfähigkeit zu helfen antwortet.
„Wir stellen uns vor, dass in Zukunft andere Arten komplexerer Schutzvorrichtungen existieren sollten, insbesondere für agentische Anwendungsfälle. Zum Beispiel ist das moderne Internet mit Sicherheitsvorrichtungen beladen, die von Webbrowsern, die gefährliche Websites erkennen, bis hin zu maschinenlernbasierten Spam-Klassifikatoren für Phishing-Versuche reichen“, heißt es in dem Forschungspapier.
Das Update von GPT-4o Mini durch OpenAI ist ein wichtiger Schritt zur Verbesserung der KI-Sicherheit. Diese Initiative kommt genau richtig, angesichts der laufenden Debatten über KI-Sicherheit und -Transparenz, mit internen und externen Aufrufen zur Verbesserung der Praktiken.
Es gab einen offenen Brief aktueller und ehemaliger OpenAI-Mitarbeiter, der bessere Sicherheits- und Transparenzpraktiken forderte, das Team, das dafür verantwortlich war, die Systeme an menschlichen Interessen (wie Sicherheit) auszurichten, wurde aufgelöst, undJan Leike, ein wichtiger OpenAI-Forscher, der zurückgetreten ist, schrieb in einem Beitrag, dass „die Sicherheitskultur und -prozesse hinter glänzenden Produkten zurückgetreten“ seien in dem Unternehmen.
Da das Vertrauen in die Zuverlässigkeit der KI von größter Bedeutung ist, ist OpenAIs Fokus auf Sicherheitsfunktionen entscheidend, um Vertrauen wiederherzustellen und der KI zu ermöglichen, kritischere Rollen bei der Verwaltung unseres digitalen Lebens zu übernehmen. Dieses Engagement für Sicherheit ist ein entscheidender Schritt hin zu einer KI, die sowohl zuverlässig als auch vertrauenswürdig ist.
Signalbericht
- Signal: OpenAIs neuestes Modell vereitelt den Trick „ignoriere alle vorherigen Anweisungen“
- Region: Global
- Marktklasse: Globale Cloud-Services-Trends
Betriebspräsenz
- Veröffentlichte Quellen sollten die betroffenen Parteien, den Betriebsfußabdruck und die Marktexposition identifizieren, bevor diese Trendkarte als vollständig betrachtet wird.
Marktkontext
- Operative Relevanz: Mittel
- Zeithorizont: Nächstes Quartal
Was ansehen?
- Achten Sie auf offizielle Stellungnahmen, regulatorische Aktualisierungen, Gefährdung von Kunden oder Partnern sowie ergänzende Offenlegungen.
Mitgliederbriefing
Vertiefter Trendkontext
Melden Sie sich mit der richtigen Mitgliedschaftsstufe an, um das vollständige Briefing und die Quellennotizen freizuschalten.
Nur für Strategic Circle
Strategic Circle
Offen für alle Leser. Schalten Sie Trend-Briefings nach Beitritt und Anmeldung frei.
Strategic Circle beitretenNur für Leadership Alliance
Leadership Alliance
Für Betreiber, Investoren und Politikteams, die Belege für Beziehungen, Fehlerpfade und Quellennotizen benötigen. Melden Sie sich an, um freizuschalten.
Leadership Alliance beitreten
