Кратко
draft-abak-ai-evaluation-claim-preservation-00предлагает требования к переносу утверждений об оценке ИИ между форматами без скрытой потери авторства, смысла, области действия и существенных оговорок.- Структурная проверка, пересчёт дайджеста, проверка подписи, appraisal аттестации, проверка mapping и содержательное суждение — разные типы результата.
- Если потребитель не поддерживает semantic profile или не располагает существенным входом, он может сохранить объект непрозрачным, но не должен объявлять его утверждение установленным.
Зелёная подпись отвечает на узкий вопрос
Проверка подписи способна показать, что определённый субъект подписал определённые байты и что байты не изменились после подписания. Это важное свойство. Оно не объясняет само по себе, что означает каждое поле.
Редакция 00 требует типизировать проверки. Структурный валидатор отвечает, соответствует ли объект ожидаемой форме. Пересчёт дайджеста связывает доступные байты со значением. Проверка подписи проверяет криптографическую связь. Attestation appraisal применяет собственную основу доверия. Mapping verification проверяет сохранение выбранного смысла. Содержательная оценка решает, что наблюдение значит для политики.
Одна зелёная метка не должна представлять все эти ответы. Контейнер может быть подлинным, а профиль интерпретации — неизвестным. Источник может быть недоступен. Подписанное утверждение может не охватывать поле, на которое опирается решение.
В таком случае потребитель вправе сохранить или переслать запись как opaque. Ошибка начинается, когда технически верная проверка контейнера превращается в «оценка подтверждена».
Профиль ограничивает класс утверждений
Claim preservation оценивается не вообще, а относительно конкретного mapping, версии и ограниченного множества утверждений. Проект не предлагает универсального алгоритма семантической эквивалентности или проверки естественно-языкового вывода.
Профиль должен назвать исходную и целевую основы интерпретации, версии, правила выбора, допустимые преобразования, существенные оговорки и поведение потребителя. Голая фраза claim-preserving недостаточна.
Если новая или несовместимая основа появляется позже, реализация не может молча считать её старой. Неизвестное расширение, способное изменить выбранное утверждение, остаётся неинтерпретированным или блокирует сильный вывод.
Сократить metadata можно только вместе с силой утверждения. Нельзя сохранить название сильного вывода, отбросив условия, на которых он держался.
Успех процесса не является оценочным вердиктом
В синтетическом Inspect-подобном фрагменте есть status: success и accuracy 0,734. Критерий не указан. Проект использует документированное разделение состояния run и scoring result; он не заявляет дефект Inspect.
success может означать нормальное завершение процесса. 0,734 — наблюдение конкретной метрики. Они не доказывают, что исходный evaluator применил threshold и вынес PASS.
Нужно также различать «источник прямо сказал, что критерия не было» и «доступный источник не устанавливает наличие критерия». Пропущенное поле не доказывает ни одно значение, если нативный формат не определяет omission однозначно.
Потребитель может применить собственный порог. Тогда возникает новая оценка с отдельным actor, входами, правилом, версией, областью и результатом. Она не становится историческим вердиктом источника и не доказывает, что критерий существовал до run.
Run ID не выбирает метрику
LightEval документирует task-indexed числовые результаты. В синтетическом примере проекта под одним фиктивным run находятся метрики 0,62 и 0,8. Фраза «run-17 прошёл 0,75» не выбирает одну из них.
Когда это влияет на утверждение, result unit включает task, scorer, metric, attempt, aggregation, dataset или split и population. Неоднозначность нельзя разрешать первым, последним, наибольшим или наиболее удобным значением.
JSON Pointer способен указать значение в идентифицированном snapshot. Он не переносит определение метрики и не доказывает полноту population. Указатель на изменяемый URL может завтра ссылаться уже на другие данные.
Content digest идентифицирует байты под известным алгоритмом и правилом выбора. Он не идентифицирует правила их интерпретации. Хэш исходного JSON и хэш canonical representation — разные операции.
У процента должен сохраниться знаменатель
Синтетическая кампания планирует 100 samples. Выполнено 80, из них 76 удовлетворяют локальному критерию, четыре не удовлетворяют, 20 не запущены. Доля среди завершённых равна 76/80, то есть 0,95.
Это не свидетельство того, что 95 из 100 запланированных samples прошли. Экспорт одного 0.95 удаляет неисполненную часть population.
Retries, повторные измерения, duplicates, исключения, invalidations и смена sample set меняют denominator. Утверждение о полной кампании нуждается в идентифицированной population или воспроизводимом правиле включения и методе учёта. Неизвестные суммы остаются неизвестными.
Даже сохранение всех предоставленных записей не доказывает, что предоставлены все реальные попытки. Preservation не превращает неполный источник в полный.
Представление способно изменить решение
В примере округления исходная десятичная строка 0.94996 показывается как 0.950, а критерий равен >= 0.95. Сравнение исходного значения даёт FAIL, отображаемого — PASS.
Округление допустимо, но при влиянии на смысл становится явно указанной derivation. Нужно назвать вход, правило, точность и actor. Новая политика, сравнивающая округлённые значения, создаёт новое суждение; она не заменяет исходное.
Единицы, scale, определение метрики, направление comparator, precision и uncertainty также относятся к утверждению. Отсутствующая uncertainty не равна нулевой uncertainty.
Ссылка не является проверенными байтами
Издатель может получить закрытый URL журнала без доступа к содержимому. Он вправе сохранить ссылку и указать: объект не получен, digest локально не пересчитан, существование основано на утверждении источника.
Он не вправе выдумать hash, заявить проверку, придумать custodian или обещать retention. Публичное расположение, permission, успешное получение и будущая доступность — разные свойства.
Digest, скопированный из отчёта источника, отличается от digest, вычисленного потребителем по доступным байтам. Ссылка также не даёт разрешения скачивать или исполнять цель. Logs, prompts и tool output остаются недоверенными данными внутри действительной подписи.
Поздняя аутентификация не восстанавливает раннюю потерю
RATS разделяет evidence appraisal и relying-party policy. SCITT защищает прозрачные statements и receipts. in-toto предлагает digest-bound subjects и typed predicates. Эти механизмы могут защищать mapping record.
Они не определяют автоматически, правильно ли интерпретирована AI metric. Если первый mapper удалил population и оставил 0,95, подпись второго mapper аутентифицирует сокращённый вид, а не возвращает 20 пропусков.
Поздний субъект может повторно обратиться к идентифицированному оригиналу и построить новый derived view. Он должен записать повторную проверку, а не утверждать, будто контекст пережил потерявший его этап.
Даже подписанный loss manifest остаётся утверждением и не доказывает полноту перечня потерь. Исправления и противоречащие записи сохраняют provenance, а не переписывают прошлую основу решения.
Правильный перенос не делает источник истинным
Ложное, предвзятое или выборочно опубликованное утверждение можно перенести идеально. Claim preservation не доказывает честность источника, компетентность evaluator, научную валидность benchmark, точную модель исполнения или безопасность deployment.
Оно также не создаёт authority и outcome. Новая оценка может стать входом policy. Запись не доказывает полномочия решающего лица, доставку control, execution или внешний эффект.
Редакция 00 определяет требования и синтетические сценарии, а не wire format, certification или implementation. Она не заявляет interoperability. Schema check не является полным семантическим тестом; тесты одного автора не являются независимой совместимостью.
Проверка слоями реальности
По доктрине Heng Lu исходные байты, выбранный результат, смысловое утверждение, аутентифицированный carrier, локальная оценка, полномочное решение, исполнение и наблюдаемый эффект — связанные, но незаменяемые слои.
Minimum initial specification означает ограничить класс утверждений и сохранить минимальный полный набор evidence для него, явно отказавшись от более сильного вывода. Она не означает свести неизвестный профиль к зелёному значку.
Running-code primacy требует наблюдаемых тестов независимых реализаций с фиксированными версиями. Передаёт ли consumer неподдерживаемый carrier как opaque? Сохраняет ли неизвестное значение? Отклоняет ли новую basis под старым profile? Пока этого нет, успешная signature verification остаётся лишь одной строкой в более длинной таблице доказательств.
Источники и ограничения
- https://datatracker.ietf.org/doc/draft-abak-ai-evaluation-claim-preservation/
- https://datatracker.ietf.org/doc/draft-abak-ai-evaluation-claim-preservation/history/
- https://datatracker.ietf.org/doc/html/draft-abak-agent-control-delivery-evidence-01
- https://datatracker.ietf.org/doc/html/draft-nobuo-scitt-composite-evidence-verification-00
- https://datatracker.ietf.org/doc/html/draft-ozturk-scitt-prml-profile-00
- https://datatracker.ietf.org/doc/html/draft-watts-agent-evidence-boundary-00
- https://heng.lu/minimum-initial-specification-localized-future-decision-voluntary-adoption-internet-coordination-system/
- https://heng.lu/on-reality-layers-symbolic-power-and-why-clarity-feels-so-hostile/
- https://heng.lu/running-code-primary-the-patch-needed-to-preserve-the-internet-original-design/
- https://github.com/huggingface/lighteval/blob/main/docs/source/saving-and-reading-results.mdx
- https://inspect.aisi.org.uk/eval-logs.html
- https://github.com/in-toto/attestation/blob/main/spec/v1/statement.md
- https://slsa.dev/spec/v1.1/verification_summary
- https://www.ietf.org/archive/id/draft-abak-ai-evaluation-claim-preservation-00.txt
- https://www.rfc-editor.org/rfc/rfc2119.txt
- https://www.rfc-editor.org/rfc/rfc6901.txt
- https://www.rfc-editor.org/rfc/rfc8174.txt
- https://www.rfc-editor.org/rfc/rfc8259.txt
- https://www.rfc-editor.org/rfc/rfc9334.txt
- https://www.rfc-editor.org/rfc/rfc9943.txt
Источники зафиксированы 30 сентября 2026 года, Asia/Shanghai. Редакция 00 — активный индивидуальный Internet-Draft с целевым статусом Informational. Это не RFC, не консенсус IETF, не продукт Working Group, benchmark, certification, implementation или deployment report. Примеры синтетические. Применение доктрины Heng Lu — анализ Daniel Kade.
Обзор для участников
Подробный контекст профиля
Войдите с подходящим уровнем подписки, чтобы открыть полный обзор и примечания к источникам.
Только для Стратегического сообщества
Стратегическое сообщество
Открыто всем читателям. Вступите и войдите, чтобы открыть обзоры профилей.
Вступить в Стратегическое сообществоТолько для Альянса лидеров
Альянс лидеров
Для проверенных владельцев IP-активов и руководителей. Войдите, чтобы открыть обзоры Альянса.
Вступить в Альянс лидеров

