Zusammenfassung

  • Der W3C startete am 30. August die Agent Conformance and Benchmarking Community Group für offene und reproduzierbare Messverfahren zu Webressourcen und Agentensystemen.
  • Vorgesehen sind gewichtete Prüfkataloge mit beobachtbarer Evidenz, ausführbare Tests mit adversarialen Referenzfällen, versionierte Engines und Korpora, Ergebnisverteilungen, Zuordnungen zu veröffentlichten Rahmenwerken und ein gemeinsames Berichtsformat.
  • Drei Erfolge werden getrennt genannt: Zwei unabhängige Stellen reproduzieren denselben Wert; eine spezifikationserstellende Gruppe zitiert die Testsuite; eine Regulierungs-, Prüf- oder Beschaffungsordnung verweist auf das Format.
  • Diese Ereignisse prüfen Verschiedenes. Reproduktion betrifft das Verfahren, ein Zitat die technische Übernahme und eine institutionelle Referenz die Nutzung in einem anderen Entscheidungssystem. Keines validiert allein die Messgröße oder macht die Community Group zur Zertifizierungsstelle.
  • Die aktuelle Seite führt Julian Joseph als Vorsitzenden und fünf Teilnehmende. Am 2. September verlinkte sie noch keinen fertigen Bericht, Prüfkatalog, Test, Korpus oder Ergebnisstandard.
  • Bevor ein Wert Beschaffung, Audit oder Regulierung beeinflusst, sollte ein Beleg Anforderung, Versionen, Gewichte, Schwelle, Umgebung, Unabhängigkeit, Rohdaten, Ausnahmen, Korrekturen und die Befugnis des späteren Entscheiders verbinden.

Derselbe Wert ist ein Verfahrensbeleg

Mit der Mitteilung vom 30. August grenzt der W3C eine konkrete Lücke ab. Andere Initiativen beschreiben bereits Identität, Nachrichten, Gedächtnis und Handlungsnachweise autonomer Agenten. Die neue Community Group setzt eine Ebene später an: Wie lässt sich die Übereinstimmung mit solchen Anforderungen messen, testen und so berichten, dass eine unverbundene Stelle das Ergebnis erneut berechnen kann?

Der angekündigte Arbeitsumfang ist für einen Gruppenstart bemerkenswert fassbar. Jede Prüfung in einem gewichteten Katalog soll angeben, welche beobachtbare Evidenz sie ausliest. Ausführbare Suiten sollen adversariale Referenzfälle enthalten, damit eine Implementierung nicht nur für den sichtbaren Erfolgsweg optimiert wird. Ergebnisse sollen Engine-Version, Korpus-Version und Datum ausweisen. Öffentliche Korpora sollen versioniert und zusammen mit ihren Verteilungen publiziert werden, damit ein Perzentil messbar bleibt.

Diese Vorkehrungen schließen bekannte Beweislücken. Ohne Engine-Version lässt sich eine Abweichung nicht dem Produkt oder dem Auswerter zuordnen. Wenn sich der Korpus unbemerkt ändert, vergleichen gleich benannte Läufe unterschiedliche Gegenstände. Ein Perzentil ohne veröffentlichte Verteilung besitzt keinen nachprüfbaren Bezugsraum. Eine Testsuite ohne bewusst scheiternde Fälle kann vor allem erkennen, ob ein Produkt die Demonstration gelernt hat.

Das Ziel, denselben Wert durch zwei unabhängige Stellen zu reproduzieren, hat deshalb Substanz. Scheitert der zweite Lauf, können verborgene Abhängigkeiten, undokumentierter Zufall, Umgebungsunterschiede oder mehrdeutige Regeln sichtbar werden. Gelingt er, steht fest, dass das deklarierte Verfahren unter den beobachteten Bedingungen zum gleichen Ausgang führte. Der erste Betreiber verliert damit das Monopol über das Ergebnis.

Nicht fest steht, ob das Verfahren die benannte Eigenschaft trifft. Zwei Waagen können übereinstimmen, weil beide denselben Nullpunktfehler haben. Zwei Labore können fehlerfrei einen Katalog anwenden, der „Bereitschaft“ zu eng definiert, Gewichte ohne Begründung setzt oder einen häufigen Praxisfehler aus dem Korpus auslässt. Reproduzierbarkeit beschreibt die Stabilität von Eingang zu Ausgang. Konstruktvalidität beschreibt, ob der Ausgang tatsächlich für das behauptete Merkmal steht. Externe Validität fragt, ob kontrollierte Daten eine reale Nutzung vertreten.

Auch eine Bestehensgrenze ist kein rechnerischer Automatismus. Dass sich ein Wert von 80 wiederholen lässt, begründet nicht, warum 80 genügt und 79 nicht. Dazu gehören ein benannter Entscheider, ein Nutzungskontext, Schäden, Evidenz und ein Verfahren zur Änderung. Ein Wert kann für Forschung hilfreich, für einen Lieferantenausschluss ungeeignet und für eine Rechtsfrage ohne Bedeutung sein.

Drei Erfolge übertragen keine einheitliche Autorität

Neben der Wiederholung nennt die Gruppe zwei Formen der Nutzung. Eine Gruppe, die Spezifikationen erstellt, könnte die Suite als Konformitätstest zitieren. Ein Regulierer, Prüfer oder Beschaffungsrahmen könnte das Berichtsformat referenzieren.

Das sind keine drei Stufen eines einzigen Gütesiegels. Die unabhängige Wiederholung ist ein Ausführungsereignis. Das technische Zitat ist eine Wahl des Eigentümers einer Spezifikationsanforderung. Die institutionelle Referenz ist ein Akt einer anderen Organisation, die das Format in ihr eigenes Verfahren einbindet.

Ein solcher Akt kann praktische Folgen haben. Eine Vergabestelle kann den Bericht verlangen. Eine Prüfgesellschaft kann ihn als Nachweisformat behandeln. Eine Behörde kann ihn innerhalb ihres gesetzlichen Auftrags anerkennen. Die Bindungswirkung stammt jedoch aus Ausschreibung, Prüfmandat oder Gesetz. Sie fließt nicht zurück und verleiht der Community Group eine allgemeine Entscheidungsmacht.

Die Gruppe markiert diese Grenze selbst. Die Zertifizierung von Organisationen und die Empfehlung kommerzieller Produkte sind ausdrücklich nicht umfasst; dasselbe gilt für neue Identitäts-, Nachweis- oder Protokollspezifikationen. Die Gruppe versteht sich als nachgelagerte Nutzerin von Spezifikationen anderer Gruppen. Gute Tests ersetzen weder deren Anforderungsentscheidung noch die Zuständigkeit eines späteren Anwenders.

Auch der Dokumenttyp bleibt begrenzt. Die Gruppenbeschreibung kündigt „Specifications“ an. In der W3C-Klassifikation steht ein Community Group Report jedoch außerhalb des Standardisierungspfads, ohne formale Prüfung und ohne W3C-Billigung. Er kann später Eingang in ein Standardisierungsverfahren finden. Diese Möglichkeit ist noch keine W3C Recommendation.

Der öffentliche Stand kurz nach dem Start

Julian Joseph schlug die Gruppe am 25. August vor. Vier weitere Unterstützende erfüllten mit ihm die Startbedingung. Der W3C erklärt ausdrücklich, dass das Hosting keine Billigung der Tätigkeiten bedeutet. Das allgemeine Verfahren lässt Vorschläge durch Inhaber eines W3C-Kontos zu, verlangt vier weitere Unterstützungen und setzt für den Beitritt keine W3C-Mitgliedschaft voraus.

Die Startmitteilung forderte die Gruppe noch auf, einen Vorsitz zu wählen. Die aktuelle Seite zeigt einen neueren Zustand: Joseph ist Vorsitzender, fünf Personen nehmen teil, und alle werden als Unterzeichner des Community Contributor License Agreement ausgewiesen.

Am 2. September bot diese Seite Mailinglisten und die Startnachricht an, aber keinen verlinkten Bericht, Katalog, ausführbaren Test, Korpus, keine Verteilung und kein Berichtsformat. Diese Aussage ist auf die geprüfte öffentliche Seite beschränkt. Sie verneint keine externen oder privaten Vorarbeiten und bewertet keine künftige Lieferung. Sie hält lediglich fest, dass bislang ein Vorhaben und kein fertig prüfbarer Benchmark vorliegt.

Joseph legte in seiner Folgemail einen Ursprung offen. Seine Tätigkeit bei apexclawai habe ihn zum Vorschlag bewegt; das dort Erarbeitete wolle er als einen Beitrag unter mehreren einbringen. Die Gruppe solle nicht durch eine Firma, ein Werkzeug oder eine Methodik bestimmt werden. Das ist eine nützliche Offenlegung und ein formuliertes Ziel, aber noch kein Unabhängigkeitsnachweis.

Unabhängigkeit muss sich an Entscheidungsrechten zeigen. Wer formuliert Anforderungen, wählt Korpora und adversariale Fälle? Wer finanziert die Ausführung? Kann ein Sponsor Gewichtungen ändern oder Fehler aussondern? Sind zwei Konten am selben geschlossenen Dienst unabhängige Reproduzenten? Werden kommerzielle Interessen offengelegt? Kann ein bewerteter Anbieter einen falschen Befund korrigieren, ohne die alte Fassung verschwinden zu lassen?

Die Zahl von fünf Teilnehmenden liefert darauf keine Antwort. Sie ist auch kein Nenner für alle Entwickler, Käufer, Beschäftigten oder Nutzer, die später von der Verwendung betroffen sein könnten. Lu Heng trennt die Teilnahme als Evidenz, Fachwissen, Warnung und Einwand von der Befugnis, nicht anwesende Prinzipale zu binden. Der offene Raum ist nützlich, wenn er prüfbare Evidenz erzeugt; Offenheit allein ist kein Validitätsurteil.

Ein Beleg für Messung und spätere Entscheidung

Ein Ergebnis sollte vor seiner Weitergabe einen begrenzten, aber vollständigen Beleg erhalten. Er verbindet Quelle und Version der Anforderung; Versionen von Prüfkatalog, Gewicht, Schwelle und Ausnahmen; Engine, Korpus, Referenzfälle, Datum und Umgebung; bei Bedarf Stichprobenparameter, Zufallswerte und zulässige Abweichung.

Hinzu kommen Testbetreiber, organisatorische Unabhängigkeit des Reproduzenten und erklärte Interessen. Für jeden Prüfpunkt bleiben beobachtete Evidenz, Rohausgabe, fehlende Daten, Ausschlüsse und Fehlschläge erhalten. Der Vektor vor der Aggregation steht neben der Summe. Korrekturen, Beschwerden, Rücknahmen und Nachfolgeversionen ergänzen die Historie, statt sie umzuschreiben.

Ein Feld liegt außerhalb des Benchmarks: Welche konkrete Entscheidung nutzte das Ergebnis, und auf welcher Befugnis beruhte sie? Ein Zitat in einer Spezifikation ist kein Ausschluss aus einer Vergabe. Ein Prüfhinweis ist keine Behördenfeststellung. Eine Werbeaussage ist kein Zertifikat.

Dieser Beleg ist eine redaktionelle Empfehlung von Daniel Kade, keine bereits beschlossene Regel der neuen Gruppe. Eine andere Datenstruktur kann dasselbe Ziel besser erfüllen. Entscheidend ist, dass Dritte Verfahren, Aussage, Unsicherheit und anschließende Machtausübung getrennt rekonstruieren können.

Die gleiche Zahl zweimal zu erhalten diszipliniert das Verfahren. Die Messgültigkeit diszipliniert die Aussage. Die ausgewiesene Befugnis diszipliniert die Verwendung. Hält die Gruppe diese Ebenen auseinander, kann sie Agententests verlässlicher machen, ohne eine wiederholbare Zahl in ein übertragbares Mandat umzudeuten.

Quellen

  1. W3C — Aufruf zur Agent Conformance and Benchmarking Community Group
  2. W3C — Agent Conformance and Benchmarking Community Group
  3. Julian Joseph — Nachricht nach dem Start
  4. W3C — Community and Business Groups
  5. W3C — Häufige Fragen zu Community Groups
  6. W3C — Arten veröffentlichter Dokumente
  7. Lu Heng — The Multi-Stakeholder Mirage