要約

  • draft-abak-ai-evaluation-claim-preservation-00 は、AI評価記録を変換するときに、元の主張の帰属、意味、範囲、重要な限定を失わないための要件を示す。
  • URLがあること、取得する権限があること、実際に取得したこと、そのバイト列からダイジェストを再計算したこと、将来も保持されることは、それぞれ別の状態である。
  • 後段の署名や透明性レシートは、失われたログ、母集団、基準、指標の意味を復元しない。認証された搬送体と、支持された評価主張は同義ではない。

参照は証拠への入口にすぎない

改訂00の合成例では、発行者が合成された制限付きログ参照先を受け取る。発行者はその場でログを取得していない。手元のバイト列からダイジェストを計算してもいない。オブジェクトが存在するという根拠も、情報源の申告だけである。

この状態でも、参照と限定を正確に伝えることはできる。「この変換では未取得」「ダイジェスト知識なし」「存在は情報源の主張のみ」と書けばよい。

できないことは、必須欄を埋めるためにゼロ値のダイジェストを作ること、内容を検査したと主張すること、完全なログが保管されていると推定することだ。別の主体が後で取得できるかどうかも、別の観測である。

公開URL、アクセス許可、取得成功、将来の保持は四つの異なる性質を持つ。ひとつを確認しても、残りは自動的に成立しない。参照を署名付きのレコードに格納しても、この境界は変わらない。

同じダイジェストでも知っていることは違う

情報源がダイジェストを報告し、変換者がその文字列をコピーする場合がある。別の場合には、変換者が実際のバイト列を取得し、自分で再計算する。最終的な16進文字列が同じでも、証拠能力は同じではない。

前者は「この主体がこう報告した」という主張を保存する。後者は「この主体が、特定のアルゴリズムとバイト選択規則の下で、手元の内容から同じ値を得た」という観測を加える。

さらに、ダイジェストはバイト列を識別するだけで、そのバイト列を解釈する規則までは識別しない。元のJSONをハッシュすることと、正規化した表現をハッシュすることは異なる処理である。アルゴリズム、対象バイト、正規化規則を示さずに値だけを運ぶと、同じ「ハッシュ済み」という表示の下に別の対象が隠れる。

モデル名やコンテナのダイジェストにも限界がある。宣言された識別子は、そのバイト列が実際に実行されたことを証明しない。そこには別の検証手続きが必要だ。

URLは取得命令でも実行許可でもない

評価ログには、個人情報、資格情報、非公開のテスト項目、プロンプト、ツール出力が含まれることがある。署名済みの記録に埋め込まれていても、それらは検証器への命令ではない。

参照先を取得するには、宛先、リダイレクト、スキーム、アクセス制御、圧縮展開量、入れ子の深さ、処理時間に関する独立した方針が要る。内容の中に「このコマンドを実行せよ」と書かれていても、証拠として読み取るべきであり、検証手順として実行してはならない。

プライバシー面でも、ダイジェストは匿名化ではない。低エントロピーの値は推測でき、安定した識別子は複数のrunや運用者を関連付ける。必要な主張に対して最小限の内容だけを運び、制限や編集が重要なら、その事実を見える形で残す必要がある。

実行成功と評価合格を分ける

草案はInspectがrun状態とスコア結果を別に扱うことを手掛かりに、合成例を示す。status: success と精度0.734があるが、基準は示されていない。

これはプロセスが完了したことと、指標が一定の条件を満たしたことを分離する例だ。0.734という観測値があっても、元の評価者が合格と判断したとは限らない。

「情報源が基準を適用しなかったと明示した」と「利用可能な資料では基準の有無を確定できない」も別である。ネイティブ形式が欠落の意味を明確に定義していない限り、空欄だけから前者を作ってはならない。

利用者は独自のしきい値を適用できる。その場合は、主体、入力、規則、版、範囲、結果を持つ新しい評価として記録する。元の評価者の判定に書き換えたり、基準がrunより前に決まっていたと証拠なしに主張したりはできない。

run IDだけでは指標を選べない

LightEvalの文書は、タスクごとに複数の数値結果を持つ構造を説明する。草案の合成例では、同じ架空runとタスクの下に0.62と0.8という別の指標がある。

「run-17は0.75を超えた」という文だけでは、どちらを使ったか分からない。最初、最後、最大、最も都合のよい結果を自動選択することは、パーサーの便宜ではなく証拠選択である。

必要に応じて、タスク、スコアラー、指標、試行、集約、データセットまたはsplit、母集団を結果単位に含める。JSON Pointerは一つの値を指せるが、指標定義や母集団の完全性まで運ばない。可変URL上のポインターは、明日には別の内容を指すかもしれない。

95%には母集団が必要だ

合成キャンペーンには計画100件、完了80件、基準達成76件、未達4件、未実行20件がある。完了分の達成率は76/80で0.95だが、100件中95件が達成した証拠ではない。

再試行、重複、除外、無効化、サンプル集合の変更は分母を変える。完全なキャンペーンについて主張するなら、母集団または再現可能な包含規則と、数え方が必要である。総数が不明なら不明のまま残す。

提供された全レコードを保存したとしても、現実の全試行が提供されたとは限らない。主張保存は、選ばれた情報源を正直に運ぶ仕組みであって、情報源の完全性を発明する仕組みではない。

表示用の丸めが判定を変える

元の十進値0.94996を0.950と表示し、>= 0.95と比較する例では、元値なら未達、表示値なら達成になる。

丸めは許されるが、意味に影響するなら派生として示す。入力、規則、精度、主体を残す。利用者が表示値を使う新しい方針を採用するなら、それは新しい判断であり、元の判定ではない。

単位、尺度、指標定義、比較方向、精度、不確実性も同じである。不確実性の欠落をゼロと扱ってはならない。変換による情報損失を、情報源が提示した統計的確信に置き換えることもできない。

後から署名しても、先に失った文脈は戻らない

RATSは証拠の評価と依拠者の方針を分ける。SCITTは署名付き声明の透明性とレシートを提供する。in-totoはダイジェストで結ばれたsubjectと型付きpredicateを持つ。これらは変換記録を保護する有力な部品である。

しかし、最初の変換が母集団を捨てて0.95だけを残した後で署名しても、未実行20件は復元されない。後段が原資料を直接再確認すれば新しい派生ビューを作れるが、その再確認を記録し、「前の変換を文脈が通過した」とは書けない。

構造検証、ダイジェスト再計算、署名検証、attestation評価、mapping検証、実質的な評価判断は別の検証型である。搬送体が有効でも意味profileを解釈できないなら、不透明なまま保管・転送できる。主張を成立済みと表示してはならない。

保存は真実・権限・結果ではない

誤った、偏った、選択的に公開された主張も忠実に保存できる。主張保存は、情報源の誠実さ、評価者の能力、benchmarkの科学的妥当性、実行モデルの同一性、配備の安全を保証しない。

利用者の新しい評価が意思決定に使われても、決定権限、統制の到達、実行、外部効果は別の証拠である。改訂00はwire formatや認証、制御配送を定義しない。実装や相互運用も主張していない。例は合成であり、同一作者の試験は独立相互運用ではない。

現実レイヤーで読む

Heng Luの現実レイヤー論に従えば、情報源のバイト列、選択された結果、意味上の主張、認証された搬送体、利用者の判断、権限ある決定、実行、観測された結果は別々の層である。

最小初期仕様とは、特定の主張を支える最小限で完全な証拠集合を定め、扱えない強い主張を明示することだ。URL一つに縮めることではない。

running codeの優先は、版を固定した独立実装の負例で確認される。取得できない参照を未検証として残せるか。複数指標を勝手に選ばないか。未知のprofileを旧版として受け入れないか。観測可能な挙動がなければ、「claim-preserving」はまだ文書上の名称にすぎない。

出典と限界

資料は2026年9月30日(Asia/Shanghai)に固定した。改訂00はInformationalを目標とする有効な個人Internet-Draftであり、RFC、IETF合意、Working Group成果、benchmark測定、安全認証、実装・配備報告ではない。例は合成である。Heng Luの原則を当てはめた部分はDaniel Kadeの分析である。