要約
draft-abak-ai-evaluation-claim-preservation-00は、AI評価記録を変換するときに、元の主張の帰属、意味、範囲、重要な限定を失わないための要件を示す。- URLがあること、取得する権限があること、実際に取得したこと、そのバイト列からダイジェストを再計算したこと、将来も保持されることは、それぞれ別の状態である。
- 後段の署名や透明性レシートは、失われたログ、母集団、基準、指標の意味を復元しない。認証された搬送体と、支持された評価主張は同義ではない。
参照は証拠への入口にすぎない
改訂00の合成例では、発行者が合成された制限付きログ参照先を受け取る。発行者はその場でログを取得していない。手元のバイト列からダイジェストを計算してもいない。オブジェクトが存在するという根拠も、情報源の申告だけである。
この状態でも、参照と限定を正確に伝えることはできる。「この変換では未取得」「ダイジェスト知識なし」「存在は情報源の主張のみ」と書けばよい。
できないことは、必須欄を埋めるためにゼロ値のダイジェストを作ること、内容を検査したと主張すること、完全なログが保管されていると推定することだ。別の主体が後で取得できるかどうかも、別の観測である。
公開URL、アクセス許可、取得成功、将来の保持は四つの異なる性質を持つ。ひとつを確認しても、残りは自動的に成立しない。参照を署名付きのレコードに格納しても、この境界は変わらない。
同じダイジェストでも知っていることは違う
情報源がダイジェストを報告し、変換者がその文字列をコピーする場合がある。別の場合には、変換者が実際のバイト列を取得し、自分で再計算する。最終的な16進文字列が同じでも、証拠能力は同じではない。
前者は「この主体がこう報告した」という主張を保存する。後者は「この主体が、特定のアルゴリズムとバイト選択規則の下で、手元の内容から同じ値を得た」という観測を加える。
さらに、ダイジェストはバイト列を識別するだけで、そのバイト列を解釈する規則までは識別しない。元のJSONをハッシュすることと、正規化した表現をハッシュすることは異なる処理である。アルゴリズム、対象バイト、正規化規則を示さずに値だけを運ぶと、同じ「ハッシュ済み」という表示の下に別の対象が隠れる。
モデル名やコンテナのダイジェストにも限界がある。宣言された識別子は、そのバイト列が実際に実行されたことを証明しない。そこには別の検証手続きが必要だ。
URLは取得命令でも実行許可でもない
評価ログには、個人情報、資格情報、非公開のテスト項目、プロンプト、ツール出力が含まれることがある。署名済みの記録に埋め込まれていても、それらは検証器への命令ではない。
参照先を取得するには、宛先、リダイレクト、スキーム、アクセス制御、圧縮展開量、入れ子の深さ、処理時間に関する独立した方針が要る。内容の中に「このコマンドを実行せよ」と書かれていても、証拠として読み取るべきであり、検証手順として実行してはならない。
プライバシー面でも、ダイジェストは匿名化ではない。低エントロピーの値は推測でき、安定した識別子は複数のrunや運用者を関連付ける。必要な主張に対して最小限の内容だけを運び、制限や編集が重要なら、その事実を見える形で残す必要がある。
実行成功と評価合格を分ける
草案はInspectがrun状態とスコア結果を別に扱うことを手掛かりに、合成例を示す。status: success と精度0.734があるが、基準は示されていない。
これはプロセスが完了したことと、指標が一定の条件を満たしたことを分離する例だ。0.734という観測値があっても、元の評価者が合格と判断したとは限らない。
「情報源が基準を適用しなかったと明示した」と「利用可能な資料では基準の有無を確定できない」も別である。ネイティブ形式が欠落の意味を明確に定義していない限り、空欄だけから前者を作ってはならない。
利用者は独自のしきい値を適用できる。その場合は、主体、入力、規則、版、範囲、結果を持つ新しい評価として記録する。元の評価者の判定に書き換えたり、基準がrunより前に決まっていたと証拠なしに主張したりはできない。
run IDだけでは指標を選べない
LightEvalの文書は、タスクごとに複数の数値結果を持つ構造を説明する。草案の合成例では、同じ架空runとタスクの下に0.62と0.8という別の指標がある。
「run-17は0.75を超えた」という文だけでは、どちらを使ったか分からない。最初、最後、最大、最も都合のよい結果を自動選択することは、パーサーの便宜ではなく証拠選択である。
必要に応じて、タスク、スコアラー、指標、試行、集約、データセットまたはsplit、母集団を結果単位に含める。JSON Pointerは一つの値を指せるが、指標定義や母集団の完全性まで運ばない。可変URL上のポインターは、明日には別の内容を指すかもしれない。
95%には母集団が必要だ
合成キャンペーンには計画100件、完了80件、基準達成76件、未達4件、未実行20件がある。完了分の達成率は76/80で0.95だが、100件中95件が達成した証拠ではない。
再試行、重複、除外、無効化、サンプル集合の変更は分母を変える。完全なキャンペーンについて主張するなら、母集団または再現可能な包含規則と、数え方が必要である。総数が不明なら不明のまま残す。
提供された全レコードを保存したとしても、現実の全試行が提供されたとは限らない。主張保存は、選ばれた情報源を正直に運ぶ仕組みであって、情報源の完全性を発明する仕組みではない。
表示用の丸めが判定を変える
元の十進値0.94996を0.950と表示し、>= 0.95と比較する例では、元値なら未達、表示値なら達成になる。
丸めは許されるが、意味に影響するなら派生として示す。入力、規則、精度、主体を残す。利用者が表示値を使う新しい方針を採用するなら、それは新しい判断であり、元の判定ではない。
単位、尺度、指標定義、比較方向、精度、不確実性も同じである。不確実性の欠落をゼロと扱ってはならない。変換による情報損失を、情報源が提示した統計的確信に置き換えることもできない。
後から署名しても、先に失った文脈は戻らない
RATSは証拠の評価と依拠者の方針を分ける。SCITTは署名付き声明の透明性とレシートを提供する。in-totoはダイジェストで結ばれたsubjectと型付きpredicateを持つ。これらは変換記録を保護する有力な部品である。
しかし、最初の変換が母集団を捨てて0.95だけを残した後で署名しても、未実行20件は復元されない。後段が原資料を直接再確認すれば新しい派生ビューを作れるが、その再確認を記録し、「前の変換を文脈が通過した」とは書けない。
構造検証、ダイジェスト再計算、署名検証、attestation評価、mapping検証、実質的な評価判断は別の検証型である。搬送体が有効でも意味profileを解釈できないなら、不透明なまま保管・転送できる。主張を成立済みと表示してはならない。
保存は真実・権限・結果ではない
誤った、偏った、選択的に公開された主張も忠実に保存できる。主張保存は、情報源の誠実さ、評価者の能力、benchmarkの科学的妥当性、実行モデルの同一性、配備の安全を保証しない。
利用者の新しい評価が意思決定に使われても、決定権限、統制の到達、実行、外部効果は別の証拠である。改訂00はwire formatや認証、制御配送を定義しない。実装や相互運用も主張していない。例は合成であり、同一作者の試験は独立相互運用ではない。
現実レイヤーで読む
Heng Luの現実レイヤー論に従えば、情報源のバイト列、選択された結果、意味上の主張、認証された搬送体、利用者の判断、権限ある決定、実行、観測された結果は別々の層である。
最小初期仕様とは、特定の主張を支える最小限で完全な証拠集合を定め、扱えない強い主張を明示することだ。URL一つに縮めることではない。
running codeの優先は、版を固定した独立実装の負例で確認される。取得できない参照を未検証として残せるか。複数指標を勝手に選ばないか。未知のprofileを旧版として受け入れないか。観測可能な挙動がなければ、「claim-preserving」はまだ文書上の名称にすぎない。
出典と限界
- https://datatracker.ietf.org/doc/draft-abak-ai-evaluation-claim-preservation/
- https://datatracker.ietf.org/doc/draft-abak-ai-evaluation-claim-preservation/history/
- https://datatracker.ietf.org/doc/html/draft-abak-agent-control-delivery-evidence-01
- https://datatracker.ietf.org/doc/html/draft-nobuo-scitt-composite-evidence-verification-00
- https://datatracker.ietf.org/doc/html/draft-ozturk-scitt-prml-profile-00
- https://datatracker.ietf.org/doc/html/draft-watts-agent-evidence-boundary-00
- https://heng.lu/minimum-initial-specification-localized-future-decision-voluntary-adoption-internet-coordination-system/
- https://heng.lu/on-reality-layers-symbolic-power-and-why-clarity-feels-so-hostile/
- https://heng.lu/running-code-primary-the-patch-needed-to-preserve-the-internet-original-design/
- https://github.com/huggingface/lighteval/blob/main/docs/source/saving-and-reading-results.mdx
- https://inspect.aisi.org.uk/eval-logs.html
- https://github.com/in-toto/attestation/blob/main/spec/v1/statement.md
- https://slsa.dev/spec/v1.1/verification_summary
- https://www.ietf.org/archive/id/draft-abak-ai-evaluation-claim-preservation-00.txt
- https://www.rfc-editor.org/rfc/rfc2119.txt
- https://www.rfc-editor.org/rfc/rfc6901.txt
- https://www.rfc-editor.org/rfc/rfc8174.txt
- https://www.rfc-editor.org/rfc/rfc8259.txt
- https://www.rfc-editor.org/rfc/rfc9334.txt
- https://www.rfc-editor.org/rfc/rfc9943.txt
資料は2026年9月30日(Asia/Shanghai)に固定した。改訂00はInformationalを目標とする有効な個人Internet-Draftであり、RFC、IETF合意、Working Group成果、benchmark測定、安全認証、実装・配備報告ではない。例は合成である。Heng Luの原則を当てはめた部分はDaniel Kadeの分析である。
会員向け解説
プロフィールの詳細
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると プロフィール解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
対象となる IP 資産の所有者・管理者向けです。ログインすると Leadership Alliance の解説を閲覧できます。
Leadership Alliance に参加

