Résumé

  • Le W3C a lancé le 30 août l’Agent Conformance and Benchmarking Community Group, consacré à des méthodes ouvertes et reproductibles d’évaluation des ressources web et des systèmes d’agents.
  • Son programme annoncé réunit des grilles pondérées fondées sur des preuves observables, des jeux d’essai adversariaux, des moteurs et corpus versionnés, des distributions de notes et un format commun de compte rendu.
  • La description distingue trois réussites : deux parties indépendantes reproduisent la même note ; un groupe qui produit une spécification cite la suite ; un régulateur, un auditeur ou un cadre d’achat fait référence au format.
  • Ces réussites ne prouvent pas la même chose. La première porte sur l’exécution, la deuxième sur l’usage technique et la troisième sur l’adoption institutionnelle. Aucune ne démontre seule que la grandeur mesurée est valable ou que le Community Group détient un pouvoir de certification.
  • La page actuelle désigne Julian Joseph comme président et compte cinq participants. Au 2 septembre, elle ne proposait aucun rapport, corpus, test, barème ou format publié à examiner.
  • Avant qu’une note ne circule dans un appel d’offres ou un dossier de conformité, un reçu doit relier exigence, méthode, données, conditions d’exécution, indépendance, résultats bruts, corrections et autorité de la décision finale.

Deux exécutions, une même valeur

Le 30 août, l’équipe Community Development du W3C a annoncé la création d’un groupe dont le sujet est plus étroit que la gouvernance générale de l’intelligence artificielle. D’autres travaux décrivent déjà l’identité des agents, leurs messages, leur mémoire ou leurs preuves d’action. Ce nouveau lieu veut s’occuper de l’étape suivante : comment tester et comparer la conformité de sorte qu’une personne extérieure puisse refaire le calcul.

La proposition ne se contente pas du mot « benchmark ». Elle prévoit que chaque vérification d’une grille pondérée indique la preuve observable qu’elle consulte. Les suites devraient inclure des cas de référence hostiles, et pas seulement des exemples faciles à réussir. Un résultat devrait nommer la version du moteur, celle du corpus et la date. Les corpus publics seraient versionnés avec leurs distributions de notes, afin qu’un percentile repose sur des observations publiées.

Cette discipline répond à des défauts réels. Une note détachée du moteur qui l’a produite ne peut pas être rejouée proprement. Un percentile sans distribution vérifiable emprunte l’apparence des statistiques. Un test sans cas d’échec connu peut récompenser un système préparé pour la démonstration. Publier ces paramètres réduit l’asymétrie entre l’auteur du benchmark et celui qui le subit.

Le critère le plus parlant est la reproduction exacte d’une note par deux parties indépendantes. Il faut le prendre au sérieux : si la deuxième équipe n’obtient pas la même valeur, elle peut révéler une dépendance cachée, un corpus modifié, un tirage aléatoire non déclaré ou une règle interprétée différemment. La reproduction protège donc la lisibilité de la procédure.

Elle ne valide toutefois pas automatiquement l’objet mesuré. Deux balances peuvent afficher le même poids tout en partageant le même mauvais étalonnage. Deux laboratoires peuvent appliquer parfaitement une grille dont le mot « sûreté » recouvre des critères trop étroits, dont le corpus ignore un usage courant ou dont la pondération a été choisie sans propriétaire de décision. La répétition répond à « obtenons-nous le même résultat ? ». La validité répond à « ce résultat représente-t-il bien ce que son intitulé promet ? ».

Une troisième question reste encore séparée : « qui peut agir sur cette base ? ». Même une mesure valide ne donne pas à son concepteur le droit d’exclure un fournisseur d’un marché, de prononcer une non-conformité juridique ou de parler au nom des utilisateurs affectés.

Trois critères, trois changements d’état

La page de lancement énumère deux autres signes de succès. Un groupe produisant une spécification pourrait citer la suite comme test de conformité. Un régulateur, un auditeur ou un cadre de commande publique pourrait référencer le format de rapport.

Il serait tentant de les ranger dans une progression unique allant de l’expérience à l’approbation. Ce serait une erreur de lecture. Une reproduction indépendante vérifie une exécution. Une citation par un groupe technique indique qu’un propriétaire de spécification juge la suite utile pour une exigence précise. Une référence institutionnelle signifie qu’un autre organisme a choisi d’intégrer le format à sa propre procédure.

Dans le dernier cas, les conséquences peuvent être fortes. Un acheteur peut imposer une pièce dans un dossier de candidature. Un auditeur peut demander une trace donnée. Un régulateur peut faire d’un format un moyen reconnu de déclaration. Mais le pouvoir qui rend cette demande opposable vient du contrat, de la mission d’audit ou de la loi applicable. Il ne remonte pas vers le Community Group et ne le transforme pas en autorité générale.

Le texte fondateur protège déjà cette frontière. La certification des organisations et l’approbation de produits commerciaux sont hors périmètre. Le groupe se présente comme consommateur aval de spécifications définies ailleurs. Il peut améliorer les tests sans devenir propriétaire des protocoles ni juge universel des produits.

Le statut documentaire doit rester aussi net. La page annonce des « Specifications », mais la classification officielle du W3C place les Community Group Reports hors de la filière des standards. Ils n’ont pas reçu l’examen formel qui caractérise cette filière et ne sont pas endossés par le W3C. Ils peuvent nourrir un travail futur. Cette possibilité n’autorise pas à les appeler aujourd’hui des Recommendations.

Un lieu d’incubation encore au départ

Julian Joseph a proposé le groupe le 25 août. Quatre autres personnes ont soutenu sa création, ce qui a déclenché le mécanisme de lancement. Le W3C précise que l’hébergement ne vaut pas approbation. Il rappelle également qu’un compte W3C suffit pour proposer ou rejoindre un Community Group et que l’adhésion au W3C n’est pas requise.

Un détail du communiqué a déjà vieilli : il demandait au groupe de choisir sa présidence. La page actuelle indique désormais Julian Joseph comme président et cinq participants ayant signé le Community Contributor License Agreement. C’est cet état présent qu’il faut retenir.

Au 2 septembre, la page publique renvoyait vers les listes de diffusion et le message d’annonce. Elle ne présentait pas encore de rapport, de grille, de suite exécutable, de corpus, de distribution ni de format de résultat. Ce constat est limité à cette surface publique. Il ne nie pas l’existence de travaux privés ou extérieurs et ne préjuge pas des documents à venir. Il interdit simplement de traiter un projet de livrable comme un livrable déjà éprouvé.

Dans son message de suivi, Joseph explique que son activité chez apexclawai a contribué à la proposition. Il offre ce travail comme un apport parmi d’autres et souhaite que le groupe ne soit défini ni par une entreprise, ni par un outil, ni par une méthodologie. Cette transparence est utile. L’indépendance, elle, devra se lire dans la gouvernance des corpus, des règles et des exécutions.

Il faudra savoir qui rédige les exigences, qui choisit les cas adversariaux, qui finance les bancs d’essai et qui peut modifier une pondération. Deux opérateurs utilisant le même service hébergé ne constituent pas nécessairement deux chaînes indépendantes. Un fournisseur qui fournit les données peut-il aussi décider quelles anomalies sont exclues ? Les conflits d’intérêts sont-ils déclarés ? Une équipe évaluée peut-elle faire corriger une erreur sans effacer l’ancien résultat ?

Le nombre actuel de participants ne résout aucune de ces questions. Il ne fournit pas non plus le dénominateur des développeurs, acheteurs, travailleurs ou usagers qui pourraient subir plus tard les effets d’un benchmark. Chez Lu Heng, la participation vaut comme preuve, expertise, alerte ou objection ; elle ne devient pas, par sa seule existence, un mandat sur les absents. L’ouverture du groupe doit donc produire davantage de preuves, pas tenir lieu de preuve finale.

Le reçu qui empêche la note de changer de rôle

Avant toute utilisation institutionnelle, chaque résultat devrait voyager avec un reçu limité mais complet. Il identifierait la source et la version de l’exigence ; les versions de la grille, des poids, du seuil et des exceptions ; le moteur, le corpus, les fixtures, la date et l’environnement d’exécution ; les paramètres d’échantillonnage, les graines aléatoires et la tolérance admise lorsqu’ils comptent.

Il nommerait aussi l’opérateur du test, la nature de l’indépendance du reproducteur et les intérêts déclarés. Chaque contrôle conserverait la preuve lue, le résultat brut, les exclusions, les données manquantes et les cas d’échec. Le vecteur avant agrégation resterait accessible à côté du total. Les corrections, appels, retraits et remplacements seraient appendus plutôt qu’effacés.

Une dernière ligne ne relève pas du benchmark : quelle décision précise a consommé le résultat, et de quelle autorité disposait son auteur ? Le refus d’un marché, l’ouverture d’une observation d’audit, la citation d’une suite dans une spécification et une allégation commerciale sont des actes différents. Un reçu de décision empêche la même note de se présenter successivement comme test, label, certification et ordre.

Ce schéma est une recommandation éditoriale de Daniel Kade, pas une règle déjà adoptée. Le groupe peut concevoir une autre structure. Le résultat sera satisfaisant si un tiers peut distinguer l’exécution, la signification du score, l’incertitude et le pouvoir employé ensuite.

La reproduction du même chiffre est donc un excellent premier verrou. Elle contraint la machine de mesure. La validité contraint la prétention attachée au chiffre. L’autorité contraint l’usage institutionnel qui en est fait. Le nouveau groupe sera d’autant plus utile qu’il empêchera ces trois plans de se donner mutuellement des pouvoirs qu’ils n’ont pas.

Sources

  1. W3C — Appel à participation au Agent Conformance and Benchmarking Community Group
  2. W3C — Page du Agent Conformance and Benchmarking Community Group
  3. Julian Joseph — Message après le lancement
  4. W3C — Community and Business Groups
  5. W3C — FAQ des Community and Business Groups
  6. W3C — Types de documents publiés
  7. Lu Heng — The Multi-Stakeholder Mirage