摘要

  • 模型指令只能作为任务语境,不能充当出口、身份或授权控制。
  • 默认拒绝网络、合成目标、限域凭据和独立监控必须把测试边界变成事实。

披露事件不能证明模型形成了自主逃逸目标;模型是在错误环境描述下继续完成既定夺旗任务。它证明的是两家机构依赖了一条假定边界。下一项有效证据,是通过架构和演练证明意外解析、路由或凭据无法触达第三方。安全从提示词下方开始,因为基础设施能够真正拒绝行动。

来源