Zusammenfassung
draft-abak-ai-evaluation-claim-preservation-00formuliert Anforderungen dafür, wie Aussage, Zuordnung, Umfang und wesentliche Einschränkungen einer KI-Evaluation bei Formatwechseln erhalten bleiben.- Ein Verbraucher darf auf einen Quellwert eine neue Regel anwenden. Er muss sie als eigene Bewertung mit Akteur, Eingaben, Version, Geltungsbereich und Ergebnis kennzeichnen.
- Ohne belastbare Reihenfolge darf die neue Schwelle weder dem ursprünglichen Prüfer zugeschrieben noch als vor dem Lauf festgelegtes Kriterium dargestellt werden.
Aus Beobachtung wird rückwirkend ein Urteil
Der synthetische Ausgangsfall des Entwurfs ist knapp. Ein Inspect-artiger Ausschnitt meldet status: success und einen Accuracy-Wert von 0,734. Ein Kriterium ist nicht angegeben.
Der Prozessstatus kann belegen, dass der Lauf ohne Betriebsfehler endete. Der Zahlenwert kann eine Beobachtung einer bestimmten Metrik sein. Keines von beiden belegt, dass der ursprüngliche Evaluator eine Grenze angewandt oder ein Sicherheitsurteil gefällt hat.
Ein späterer Verbraucher darf 0,70 als eigene Schwelle festlegen und 0,734 damit vergleichen. Das Ergebnis kann für seine eigene Policy vollkommen legitim sein. Der Entwurf verlangt jedoch eine getrennte Bewertung: Wer hat entschieden? Welche Eingabe wurde verwendet? Welche Regel und Version galten? Welchen Geltungsbereich hatte das Ergebnis?
Geht diese Zuordnung bei der Konvertierung verloren, entsteht eine falsche Historie. Im Archiv sieht es aus, als habe der ursprüngliche Evaluator einen vorab definierten Test bestanden. Tatsächlich stammt die Grenze von einem späteren Verbraucher.
Ein bloßer Zeitstempel, ein gleichlautender Bezeichner oder ein Hash-Commitment genügt nicht, um die Reihenfolge zu beweisen. Wer behauptet, das Kriterium habe vor dem Lauf festgestanden, benötigt eine unterstützte Ordnungsbeziehung zwischen der identifizierten Kriterienfassung und genau diesem Lauf.
Abwesenheit ist nicht automatisch eine Verneinung
Zwei Zustände dürfen nicht zusammenfallen: „Die Quelle erklärt ausdrücklich, dass kein Kriterium angewandt wurde“ und „Das vorhandene Material stellt nicht fest, ob ein Kriterium existierte“.
Ein fehlendes Feld beweist weder das eine noch das andere, solange das native Format die Bedeutung der Auslassung nicht eindeutig festlegt. Ein Mapper, der jede Leerstelle zu criterion: none normalisiert, erfindet eine Quellaussage.
Dasselbe gilt für Nichtausführung, Fehler, Invalidation und inconclusive Ergebnisse. Sie werden nicht still zu „bestanden“. Sie werden aber auch nicht zu einem gemessenen Fehlschlag, wenn die Quellsemantik einen solchen Fehlschlag nicht belegt.
Eine Anwendung kann einen begrenzten Wert weiterverwenden und die stärkere Schlussfolgerung zurückhalten. Genau darin liegt die praktische Alternative zum groben Alles-oder-nichts-Status.
Ein Run enthält möglicherweise mehrere Metriken
Der LightEval-artige Gegenfall des Entwurfs enthält unter demselben fiktiven Run und derselben Aufgabe zwei Werte: 0,62 und 0,8. Die Aussage „run-17 bestand 0,75“ legt nicht fest, welche Metrik ausgewählt wurde.
Das Profil muss, soweit aussagerelevant, Aufgabe, Scorer, Metrik, Versuch, Aggregation, Dataset oder Split und Population erhalten. Eine mehrdeutige Auswahl darf nicht durch den ersten, letzten, größten oder günstigsten Wert aufgelöst werden.
JSON Pointer kann einen Wert in einem identifizierten Snapshot adressieren. Es trägt nicht automatisch die Metrikdefinition, die Population oder die Vollständigkeit des Laufs. Zeigt der Pointer auf eine veränderliche URL, kann dieselbe Adresse später andere Inhalte auswählen.
Auch ein Digest löst nur einen Teil des Problems. Er identifiziert Bytes unter einer bestimmten Auswahl- und Hashregel; er identifiziert nicht die Regeln, mit denen diese Bytes interpretiert werden. Original-JSON und kanonische Darstellung sind verschiedene Hashobjekte.
95 Prozent wovon?
Der Entwurf beschreibt eine synthetische Kampagne mit 100 geplanten Samples. 80 werden ausgeführt, 76 erfüllen ein lokales Kriterium, vier nicht, 20 laufen nicht. Unter den abgeschlossenen Samples beträgt die Quote 76/80 oder 0,95.
Sie belegt nicht, dass 95 der geplanten 100 Samples bestanden. Ein Export, der nur 0.95 erhält, entfernt die nicht ausgeführten Fälle und verändert den Umfang der Aussage.
Retries, Duplikate, Ausschlüsse, invalidierte Messungen und geänderte Sample-Sets beeinflussen den Nenner. Eine vollständige Kampagnenaussage benötigt eine identifizierte Population oder reproduzierbare Einschlussregel und eine Zählmethode. Unbekannte Summen bleiben unbekannt.
Selbst die vollständige Übernahme aller gelieferten Records belegt nicht, dass alle realen Versuche geliefert wurden. Claim Preservation kann eine Quellaussage bewahren; es kann eine unvollständige Quelle nicht vollständig machen.
Die Anzeige kann die Schwelle verschieben
Im Rundungsbeispiel wird 0.94996 als 0.950 dargestellt und mit >= 0.95 verglichen. Der Quellwert verfehlt die Grenze, der Anzeigewert erreicht sie.
Rundung ist zulässig, wird aber zur kenntlich gemachten Ableitung, sobald sie die Interpretation beeinflusst. Eingabe, Regel, Präzision und Akteur gehören dann zum neuen Urteil. Die abgeleitete Entscheidung darf den ursprünglichen Vergleich nicht ersetzen.
Einheit, Skala, Metrikdefinition, Vergleichsrichtung, Präzision und Unsicherheit sind ebenfalls aussagerelevant. Fehlende Unsicherheitsdaten bedeuten nicht null Unsicherheit. Informationsverlust durch Konvertierung ist nicht die Unsicherheit, die eine Quelle vielleicht geschätzt hat.
Ein Link ist noch kein geprüfter Beleg
Ein Publisher kann eine eingeschränkte Log-URL erhalten, ohne die Bytes abrufen zu dürfen. Er kann den Verweis und seine Grenze bewahren: nicht abgerufen, kein lokal berechneter Digest, Existenz nur von der Quelle behauptet.
Er darf keinen Platzhalter-Hash erfinden, keine Prüfung behaupten und keine dauerhafte Aufbewahrung zusichern. Ort, Berechtigung, erfolgreicher Abruf und künftige Verfügbarkeit sind getrennte Eigenschaften.
Ein von der Quelle gemeldeter Digest unterscheidet sich von einem Digest, den der Verbraucher aus verfügbaren Bytes selbst berechnet. Eine Referenz ist außerdem keine Erlaubnis, ihr Ziel abzurufen oder auszuführen. Logs, Prompts und Tool-Ausgaben bleiben unvertrauenswürdige Daten, auch in einem signierten Record.
Spätere Authentisierung repariert keinen früheren Verlust
RATS trennt Evidence Appraisal und Relying-Party-Policy. SCITT kann signierte Statements transparent machen und Quittungen liefern. in-toto kann digestgebundene Subjects und typisierte Predicates tragen. Diese Mechanismen schützen Mapping-Records.
Sie entscheiden nicht automatisch, ob eine KI-Metrik richtig interpretiert wurde. Wenn der erste Mapper den Nenner entfernt, stellt die spätere Signatur ihn nicht wieder her.
Ein späterer Akteur kann zur identifizierten Quelle zurückkehren und eine neue abgeleitete Sicht bauen. Er muss die erneute Prüfung ausweisen. Er darf den wiedergewonnenen Kontext nicht so darstellen, als habe er die verlustreiche Stufe überlebt.
Strukturvalidierung, Digest-Neuberechnung, Signaturprüfung, Attestation Appraisal, Mapping-Verifikation und inhaltliche Bewertung bleiben typisierte Ergebnisse. Ein Carrier kann gültig sein, während sein semantisches Profil nicht unterstützt wird. Dann kann er opak weitergegeben, aber nicht als etablierte Aussage akzeptiert werden.
Erhaltung ist keine Wahrheit und keine Autorität
Auch eine falsche, verzerrte oder selektiv veröffentlichte Aussage kann fehlerfrei erhalten werden. Claim Preservation zertifiziert weder Quellenvertrauen noch Evaluatorkompetenz, Benchmark-Validität, exakte Modellidentität oder Deployment-Sicherheit.
Eine neue Bewertung erzeugt auch keine Entscheidungsbefugnis. Sie kann Input einer benannten Policy sein. Ob der Entscheider zuständig war, ein Control ausgeliefert und ausgeführt wurde oder der externe Effekt eintrat, erfordert weitere Belege.
Revision 00 definiert Anforderungen und synthetische Szenarien, kein Wire-Format und keine Zertifizierung. Sie behauptet keine Implementierung oder Interoperabilität. Ein Schema-Check ist kein vollständiger Semantiktest; Tests desselben Autors sind keine unabhängige Interoperabilität.
Der Realitätsschicht-Test
Mit Heng Lus Realitätsschichten lassen sich Quellbytes, ausgewähltes Ergebnis, semantische Aussage, authentisierter Carrier, lokale Bewertung, autorisierte Entscheidung, Ausführung und beobachteter Effekt auseinanderhalten.
Minimum Initial Specification bedeutet hier: Für eine begrenzte Aussage den kleinsten vollständigen Belegsatz definieren und stärkere Aussagen ausdrücklich offenlassen. Es bedeutet nicht, alle Rollen in ein PASS zu pressen.
Running-Code Primacy verlangt beobachtbare, versionsgebundene Negativtests zwischen unabhängigen Implementierungen. Bleibt ein späteres Kriterium später? Bleibt unbekannte Chronologie unbekannt? Wird ein neues Profil nicht als altes ausgelegt? Ohne solche Ergebnisse ist „claim-preserving“ ein Dokumenttitel, kein Betriebsbeleg.
Quellen und Grenzen
- https://datatracker.ietf.org/doc/draft-abak-ai-evaluation-claim-preservation/
- https://datatracker.ietf.org/doc/draft-abak-ai-evaluation-claim-preservation/history/
- https://datatracker.ietf.org/doc/html/draft-abak-agent-control-delivery-evidence-01
- https://datatracker.ietf.org/doc/html/draft-nobuo-scitt-composite-evidence-verification-00
- https://datatracker.ietf.org/doc/html/draft-ozturk-scitt-prml-profile-00
- https://datatracker.ietf.org/doc/html/draft-watts-agent-evidence-boundary-00
- https://heng.lu/minimum-initial-specification-localized-future-decision-voluntary-adoption-internet-coordination-system/
- https://heng.lu/on-reality-layers-symbolic-power-and-why-clarity-feels-so-hostile/
- https://heng.lu/running-code-primary-the-patch-needed-to-preserve-the-internet-original-design/
- https://github.com/huggingface/lighteval/blob/main/docs/source/saving-and-reading-results.mdx
- https://inspect.aisi.org.uk/eval-logs.html
- https://github.com/in-toto/attestation/blob/main/spec/v1/statement.md
- https://slsa.dev/spec/v1.1/verification_summary
- https://www.ietf.org/archive/id/draft-abak-ai-evaluation-claim-preservation-00.txt
- https://www.rfc-editor.org/rfc/rfc2119.txt
- https://www.rfc-editor.org/rfc/rfc6901.txt
- https://www.rfc-editor.org/rfc/rfc8174.txt
- https://www.rfc-editor.org/rfc/rfc8259.txt
- https://www.rfc-editor.org/rfc/rfc9334.txt
- https://www.rfc-editor.org/rfc/rfc9943.txt
Die Quellen wurden am 30. September 2026 in Asia/Shanghai eingefroren. Revision 00 ist ein aktiver individueller Internet-Draft mit Zielstatus Informational. Sie ist kein RFC, IETF-Konsens, Working-Group-Produkt, Benchmark, Zertifikat, Implementierungs- oder Deployment-Bericht. Die Beispiele sind synthetisch. Die Anwendung von Heng Lus Doktrin ist Daniel Kades Analyse.
Mitgliederbriefing
Detaillierter Profilkontext
Melden Sie sich mit der richtigen Mitgliedschaftsstufe an, um das vollständige Briefing und die Quellennotizen freizuschalten.
Nur für Strategic Circle
Strategic Circle
Offen für alle Leser. Schalten Sie Profil-Briefings nach Beitritt und Anmeldung frei.
Strategic Circle beitretenNur für Leadership Alliance
Leadership Alliance
Für qualifizierte Inhaber von IP-Assets und Management; melden Sie sich an, um Leadership-Alliance-Briefings freizuschalten.
Leadership Alliance beitreten

