Zusammenfassung
- RFC 9839 definiert mit Unicode Scalars, XML Characters und Unicode Assignables drei zunehmend engere, präzise referenzierbare Teilmengen.
- Ein JSON-Parser kann eine gültige Struktur liefern, obwohl ein dekodiertes Feld Steuerzeichen, ein ungepaartes Surrogat oder ein Nichtzeichen enthält.
- Belastbar wird die Zulassung erst durch eine Regel je Feld, eine bewusste Ablehnungs- oder Ersetzungspolitik und identische Testresultate entlang der gesamten Verarbeitungskette.
Die gefährliche Meldung lautet nicht „Parsing fehlgeschlagen“, sondern „Parsing erfolgreich“. Sie verleitet dazu, eine syntaktische Aussage in eine inhaltliche Genehmigung umzudeuten. Später scheitert dieselbe Zeichenfolge beim UTF-8-Export, wird von einer zweiten Laufzeit verändert oder gelangt als unsichtbares Steuerzeichen in ein dauerhaftes Kennzeichen.
RFC 9839 schafft dafür eine eng umrissene Kontrollsprache. Der Standards-Track-RFC erschien im August 2025; Datensatz, Text und XML tragen denselben Vertrag. Daraus folgt keine Aussage über Verbreitung oder Produktkonformität.
Drei Repertoires sind drei Entscheidungen
Unicode Scalars schließt den Surrogatbereich U+D800 bis U+DFFF aus. XML Characters entfernt zusätzlich die meisten alten C0-Steuerzeichen sowie U+FFFE und U+FFFF. Unicode Assignables schließt Surrogate, alte Steuerzeichen und sämtliche Nichtzeichen aus, lässt aber bereits zugewiesene und künftig zuweisbare Codepunkte zu.
Der Unicode-Standard definiert den Codespace, UAX 44 beschreibt Eigenschaften. RFC 3629 regelt UTF-8 und RFC 2277 dessen Rolle in Internetprotokollen. Eine Kodierung entscheidet jedoch über Bytes zulässiger Werte, nicht über die Zulässigkeit eines Wertes für eine Kontonummer, Anzeige oder Signatur.
Die Formulierung in ABNF macht die Grenze zitierbar. Die Zeichenproduktion von XML 1.0 ist ein bekanntes Profil, aber weder maximal streng noch eine vollständige Identitätsregel.
JSON-Escaping ändert keine Berechtigung
RFC 8259 samt Statusdatensatz definiert JSON. RFC 9839 zeigt ein konformes Dokument, dessen dekodierter Wert NUL, ein C1-Steuerzeichen, ein ungepaartes Surrogat und ein Nichtzeichen enthält. Der Wert kann nicht als wohlgeformtes UTF-8 ausgegeben werden; Bibliotheken können dennoch unterschiedlich reagieren.
Ein Escape ist nur eine Schreibweise. Die Repertoireregel greift nach dem Dekodieren und vor der Übernahme in maßgeblichen Zustand. Der allgemeine Parser kennt den Zweck des Feldes nicht und kann daher nicht entscheiden, ob exakte Rundreise, menschenlesbare Darstellung oder Zugriffskontrolle Vorrang hat.
I-JSON, Net-Unicode und PRECIS belegen den Bedarf an weiteren Profilen. Unicode Assignables löst keine Normalisierung, Verwechslung ähnlicher Zeichen, Schreibrichtungs- oder Kontextfrage.
Ablehnung und Ersetzung bewahren Unterschiedliches
Ablehnung hält einen zweifelhaften Wert aus dem maßgeblichen Speicher heraus. Ersetzung durch U+FFFD kann eine Anzeige verfügbar halten und den Schaden sichtbar machen, verändert aber die Identität. Bei Signaturen, Hashes, Deduplizierung, Rechtsakten oder Berechtigungsvergleichen ist dieser Verlust nicht harmlos.
Stilles Löschen ist besonders riskant, weil zwei verschiedene Eingaben gleich werden können. RFC 9413 versteht Robustheit als bewusstes Verhalten gegenüber ungültiger Eingabe, nicht als pauschale Nachsicht.
Auch Ablehnung braucht Grenzen: teure Diagnosen können zur Verfügbarkeitsfläche werden. Begrenzte Fehlermeldungen, Ratensteuerung, Quarantäne und Beweissicherung liegen beim Betreiber.
Der Nachweis ist eine Laufzeitmatrix
Dieselben Testvektoren müssen Gateway, Parser, Validator, Queue, Datenbanktreiber, Speicher, Log, Export und Verbraucher durchlaufen. Syntaxfehler, Repertoireverletzung, beabsichtigte Ersetzung und spätes Serialisierungsversagen sind getrennte Ergebnisse. Verglichen werden Skalarfolge, Entscheidung, Fehlerklasse und persistierte Form.
Textstrings in CBOR verwenden standardmäßig Unicode-Skalarwerte. Damit verschwinden Surrogate, nicht aber alle problematischen Steuer- und Nichtzeichen. Ein Formatwechsel ersetzt folglich keine Feldpolitik.
TR36 behandelt weitergehende Unicode-Sicherheit, TR55 Quellcode und der W3C erklärt Zeichen, Codepunkte, Codeeinheiten und Bytes. Diese Themen markieren zugleich die bewusste Reichweitengrenze von RFC 9839.
Für diesen Bericht wurde keine Software und kein Produktionspfad getestet. Fest steht nur der Kontrollsatz: Der Parser koordiniert Syntax, nicht Autorität. Erst die beobachtete, übereinstimmende Entscheidung aller laufenden Komponenten ist ein Zulassungsbeleg.
Quellen
Mitgliederbriefing
Detaillierter Profilkontext
Melden Sie sich mit der richtigen Mitgliedschaftsstufe an, um das vollständige Briefing und die Quellennotizen freizuschalten.
Nur für Strategic Circle
Strategic Circle
Offen für alle Leser. Schalten Sie Profil-Briefings nach Beitritt und Anmeldung frei.
Strategic Circle beitretenNur für Leadership Alliance
Leadership Alliance
Für qualifizierte Inhaber von IP-Assets und Management; melden Sie sich an, um Leadership-Alliance-Briefings freizuschalten.
Leadership Alliance beitreten
