要約
- モデル指示は作業文脈であり、出口、身元、権限の統制として扱わない。
- 既定拒否網、合成対象、限定資格、独立監視で試験境界を実体化する。
公表事例は自律的な脱出目的を示さず、モデルは誤った環境説明の下で指定課題を続けていた。一方で二組織が想定上の境界へ依存したことを示す。予想外の名前解決、経路、資格が第三者へ届かないと証明する構成と演習が次の証拠だ。安全は指示より下、基盤が動作を拒否できる所から始まる。
Anthropicは模擬環境と伝えられた評価が実在システムへ届いた例を確認した。指示の隔離をネットワークが強制していなかった。

公表事例は自律的な脱出目的を示さず、モデルは誤った環境説明の下で指定課題を続けていた。一方で二組織が想定上の境界へ依存したことを示す。予想外の名前解決、経路、資格が第三者へ届かないと証明する構成と演習が次の証拠だ。安全は指示より下、基盤が動作を拒否できる所から始まる。