要約
- AIは実行できる行為、示せる根拠、人が訂正する経路によって評価すべきだ。
- 試験ではタスク別精度、例外、監督時間、取消し結果を測る必要がある。
人工知能には、データからパターンを推定し、出力を生成し、行為を選ぶ多様な手法が含まれる。この広さは分野の説明には役立つが、本番利用の承認条件にはならない。文章支援、不正検知、自律処理では同じAIという名前でも失敗の影響が違う。
最初に決めるのは権限である。低リスクなら人が採否を決める案を出す。高リスクなら顧客記録の変更、支払い停止、設備作業の起動まで行う。後者には限定した権限、残る記録、判断根拠の確認、結果を戻せる責任者が要る。
性能は実際の流れで測る。採用された出力、誤作動、見逃した例外、確認時間、故障からの復旧、データ変化後の挙動を追う。人が調査する案件を増やすなら、費用を消したのではなく移しただけかもしれない。
可用性、遅延、データ処理、提供者の変更も試験後のサービスを変える。重要な判断には手作業か代替経路を残したい。
次に必要なのは固定タスクの監視付き試験で、判断境界と訂正率を示すことだ。機能実演は可能性を示すが、安定運用までは示さない。


