要約

  • VodafoneとEricssonは、専用アプリや端末改修なしに、通常の携帯通話で5言語間のリアルタイム翻訳と雑音除去を試験網上で実演したとしている。
  • コア網に機能を置けば一般端末へ広く配れる。一方、網は音声を運ぶだけでなく、受話者が聞く内容を変換する主体になる。
  • 商用サービスには、聴感品質と意味の忠実性を分けた測定、双方への表示、無加工音声への復帰、会話内容を保存しない介入記録が必要だ。

アプリの操作を一つ減らすことは、責任を一つ減らすことではない。

両社が9月22日に公表した試験では、英語、スペイン語、イタリア語、フランス語、ドイツ語の間で会話を即時翻訳し、騒がしい場所の背景音をリアルタイムで抑えた。構成はVodafoneのアプリケーションサーバーと自社AI基盤、EricssonのAIゲートウェイ、コア網技術、IP Multimedia Subsystem(IMS)を組み合わせ、APIで通信とAIの領域をつないだものだ。

専用アプリも新しいスマートフォンも要らない。ここに市場上の意味がある。端末ごとの導入や更新を待たず、通常の電話番号と通話経路を使って機能を提供できる。Vodafoneは、どの端末にも標準的に届けられ、複数国への展開経路になり得ると説明する。試験は共同計画「Core Network of the Future」の一部である。

ただし、発表は商用開始ではない。開始日、対象国、料金、正確性、遅延、初期設定、データ保持、問い合わせ先は示されていない。Vodafoneは専門的な通訳サービスの代替ではないとも明記した。確認できたのは技術統合であり、利用条件の完成ではない。

網内配置が変えるのは配布先だけではない

端末アプリなら、利用者は翻訳機能を開いたという自覚を持ちやすい。網内機能は、その手間をなくせる。普通に発信した後、媒体経路で処理できるからだ。企業は端末ごとのソフトウェア管理を減らし、通信事業者は品質管理や顧客契約と機能を一体化できる。

その代わり、介入の境界が見えにくくなる。雑音除去は、何を背景音とみなして捨てるかを決める。翻訳は、発話の意味を判断して別の言葉を作る。前者は必要な小さな音を落とす可能性があり、後者は人名、金額、否定、指示を変える可能性がある。本試験で実際に誤りが起きたという意味ではない。商用の証明には、滑らかな実演とは別の試験が要るという意味である。

発話は話者のものだが、相手が判断に使う音声は網が生成したものかもしれない。誰が機能を有効にしたか、どちら向きの翻訳か、双方に何が表示されたか、確信度が下がった時にどうなるか、訂正を誰が扱うか。この五点は付加機能ではなく、サービス境界そのものになる。

音の品質と意味の品質を混ぜない

通信品質には既存の技術基盤がある。3GPP TS 26.114はIMSマルチメディア電話の媒体処理と相互作用を扱う。ITU-T P.863は知覚上の聴取品質を客観的に予測する手法である。音の劣化を調べるには有用だが、住所や薬品名、口座番号が正しく訳されたかは判定できない。

そこで二つの帳簿が要る。通信の帳簿には、端から端までの遅延、揺らぎ、音切れ、歪み、聴感品質、障害時の復帰を書く。意味の帳簿には、言語の方向、アクセント、雑音環境ごとの成績、人名、数字、専門語、否定、言語切り替えへの対応、そして処理を断念すべき時に断念した割合を書く。

二つは同時に読む必要がある。正しくても遅すぎる翻訳は会話を壊す。速く自然でも、低い確信度を隠した出力は危うい。全体平均だけでは、データの少ない言語方向やアクセントに残る穴も見えない。

NISTのAIリスク管理枠組みのMeasure手引きは、VodafoneやEricssonを直接拘束する規則ではなく、自主的な参考枠組みである。それでも、利用状況に近い試験、許容限界、運用後の監視、エラー情報、担当者、利用者の申立て手段を求める考え方は、このサービスに適している。電話では、それを小さく具体的な仕組みにしなければならない。

会話ではなく介入を記録する

本稿が提案するのは、処理した通話ごとの「介入記録」だ。両社が公表した機能ではない。録音や文字起こし、会話内容を保存する必要はない。選択されたモード、双方への表示、言語方向または雑音処理の種類、処理バージョン、実測遅延と音質、確信度の閾値超過、無加工音声への切り替え、保持の有無、障害を受け持つ窓口だけを残せばよい。

これにより、利用者の選択通りに動いたか、問い合わせ時の技術状態は何だったか、更新前後で何が変わったかを確かめられる。会話の中身を支援データにせず、網の行為だけを監査可能にする設計である。

無加工の経路も常に残すべきだ。利用者は切断せずに戻せ、AIが遅い、不確か、利用不能という時には網が決められた手順で戻す。雑音除去では未処理音声、翻訳では原言語の声が復帰先になる。操作は簡素でよいが、状態は参加者と運用者の双方に分からなければならない。

今回の試験は、コア網がAIの強い配布点になれることを示した。次に問われるのは、介入を消す能力ではない。介入した事実を明らかにし、訂正でき、いつでも元へ戻せる能力である。

情報源