摘要

  • Vodafone与爱立信称,双方在测试移动网络内为普通语音通话提供实时降噪,并在英语、西班牙语、意大利语、法语和德语之间进行即时翻译,不要求安装专用应用或更换手机。
  • 把能力放在核心网,优势是普通终端也能使用,并有机会跨市场统一部署;代价是网络不再只传送声音,而开始决定另一方实际听到什么。
  • 商用前应同时给出语音质量与语义保真两套证据,明确双方提示和失败回退,并为每次AI介入生成不含通话内容的技术凭据。

这项试验最容易被理解成“翻译应用搬进了运营商网络”。更准确的说法是:通话链路的权力边界变了。

Vodafone与爱立信9月22日公布,双方在测试移动网络内演示了两项AI语音功能。第一项在嘈杂环境中实时识别并消除背景声;第二项让说不同语言的人在普通电话里即时交流。已演示的语言包括英语、西班牙语、意大利语、法语和德语。技术组合包括Vodafone的应用服务器和自有AI平台、爱立信的AI网关与核心网技术,爱立信还明确提到IP多媒体子系统(IMS);两边通过API连接。

用户不需要专用应用,也不需要改造手机。这正是网络侧方案的商业吸引力:它省去安装、权限、终端适配和版本碎片,可以通过运营商已有的业务系统覆盖普通手机,并有机会在多个国家形成一致产品。该试验属于双方“未来核心网”联合计划。

但公告没有给出商用日期、首发市场、价格、翻译准确率、端到端时延、启用方式、保存政策或客服归属。Vodafone也强调,实时翻译不是专业翻译服务的替代品。因而目前能确认的是一次技术演示,而不是已完成的市场承诺。

网络获得分发能力,也承担改写责任

应用里的翻译通常有一个清楚入口。用户打开工具,知道屏幕或耳机里的内容经过处理。若AI位于通话媒体路径,体验可以自然得多:拨出普通电话,功能已经在那里。自然正是价值,也正是风险所在。

降噪与翻译都在修改输入,但错误形态不同。降噪模型要判断什么属于背景,可能误删低声提示或现场声响;翻译模型要判断一句话是什么意思,可能在语音很清晰的同时改动姓名、数字、否定词或专有名词。这里并不是说本次试验已经出现这些问题,而是说明为什么“听起来清楚”不能等于“表达得正确”。

运营商掌握接入、计费、业务启停和网络运维,因而能把能力送到更多终端。可是原话属于说话者,另一方采取行动时依赖的却可能是网络生成的版本。产品必须说明:功能何时开启、翻译方向是什么、双方是否都收到提示、低置信度时发生什么,以及谁负责纠错。

两套证据缺一不可

语音网络并非没有测量体系。3GPP TS 26.114规定了IMS多媒体电话的媒体处理与交互技术范围;ITU-T P.863提供客观预测听感质量的方法。这些标准有助于测量时延、断续、失真和可听质量,却不能证明一串地址、药名或付款金额被正确翻译。

因此,商业验收至少需要两本账。第一本是通信质量账:端到端时延、抖动、剪切、断续、听感质量,以及AI不可用时如何回退。第二本是语义账:按语言方向、口音与噪声环境分组的表现,姓名、数字、术语、语码转换和否定句的保真度,以及系统在不确定时选择不处理的比例。

两本账还要放在同一条时间线上。翻译更准确但停顿太久,无法支撑自然对话;速度很快却把低置信度结果说得毫不迟疑,风险反而更高。一个总平均值也可能掩盖小语种方向、少见口音或专业场景中的薄弱区。

NIST的AI风险管理框架“测量”手册不是Vodafone必须遵守的行业法规,但提供了合适的自愿参考:在真实使用情境中测试,设置可接受边界,上线后持续监测,保存错误信息,确定负责人,并让受影响的人可以反馈和申诉。对电话业务而言,这些原则需要变成一个具体、轻量的运行对象。

每次介入都应留下技术凭据

本文建议为每通经过AI处理的电话生成“介入凭据”。这不是Vodafone或爱立信已经公布的功能。凭据不必保存录音、转写或谈话内容,只需记录:用户选择的模式、双方提示状态、语言方向或降噪模式、处理版本、实测时延与语音质量、是否触发低置信度阈值、是否回退到未修改音频、是否保留任何数据,以及事故由哪个支持队列负责。

这份凭据解决三类问题。用户可以确认网络执行了什么;客服可以把投诉连接到当时的处理状态,而不是要求用户复述技术细节;运营团队可以比较模型或配置更新前后的变化。

同时必须保留原始通路。用户应能在不中断电话的情况下关闭处理;当AI变慢、不确定或不可用时,网络也应按确定规则回退。对降噪而言,原始通路是未过滤音频;对翻译而言,它是源语言声音,而不是继续播放合成的目标语言结果。按钮可以简单,状态变化不能隐形。

Vodafone与爱立信已经证明,核心网可以成为一处强大的AI分发点。下一步不是让这处介入看不见,而是让它可靠、可说明,也能随时撤回。只有这样,网络替通话增加的能力才不会同时削弱通话本身的证据。

来源