2026年9月29日,Inception宣布面向企业客户正式商用Mercury Voice。这是一款为语音智能体优化的扩散语言模型,支持推理、工具调用和长系统提示。官方公布的首个回答词元延迟中位数为320毫秒,P95为750毫秒,但这些指标仅覆盖模型处理环节,并不等同于用户实际感受到的端到端通话延迟。独立报道也提醒,语音识别、网络传输、语音合成和电话线路仍会影响完整体验。官方发布资料 独立报道
对于客服行业,速度提升只是上线条件之一。真正决定系统能否长期运行的,是身份告知、关键操作二次确认、内容安全和全程追溯。若以互联网信息服务领域常说的“九不准”和“七条底线”为基础框架,企业应把守法合规、公共秩序、真实信息、用户权益和社会责任转化为可执行的产品规则,而不是只写在服务协议中。
低延迟不能省略身份告知
Mercury Voice强调自然、快速的对话体验,但客服智能体越接近真人,越需要在通话开始阶段明确说明身份。建议首句采用固定模板,例如:“您好,我是某某平台的智能客服,本次通话可能被记录,用于办理业务和服务质检。如需人工客服,请随时告诉我。”告知内容应避免模糊表达,不能只说“智能助手”,更不能让用户误以为正在与真人沟通。
身份告知应作为独立流程节点,由业务系统控制,不能完全交给模型自由生成。系统需记录告知文案版本、播放时间、播放结果及用户是否打断。即使用户抢话,也应在进入业务处理前补充完成核心告知。对于外呼场景,还应说明企业名称和来电目的,避免使用制造紧迫感、隐瞒营销性质或诱导用户继续通话的表达。
把二次确认放在不可逆操作之前
低延迟模型能够快速调用工具,但“更快调用”不等于“可以自动执行”。凡是涉及扣费、退款、订单取消、套餐变更、地址修改、账户解绑、身份资料提交或向第三方发送信息的操作,都应进入二次确认流程。
- 先复述:用自然语言说明对象、金额、范围、时间及可能后果。
- 再确认:要求用户给出明确肯定答复,沉默、含糊回应和背景人声不得视为同意。
- 后执行:只有确认状态写入业务系统后,工具接口才能获得短时有效的执行令牌。
- 给回执:执行完成后播报结果,并通过站内信、短信或订单页面提供可核验凭证。
二次确认不应由模型自行判断是否跳过。企业可建立高风险操作清单,并在接口层实施强制拦截。用户说“你看着办”“应该可以”或“随便”时,智能体必须继续澄清,而不能为了降低通话时长直接操作。涉及身份认证、争议退款或异常账户时,应及时转人工处理。
用完整事件链实现全程追溯
客服录音只是追溯的一部分。可审计系统至少应形成一条结构化事件链,包括会话编号、模型及提示词版本、身份告知记录、用户授权状态、语音转写、模型输出、知识库命中、工具调用参数、二次确认内容、接口返回结果、人工接管情况和异常告警。
日志还应区分“模型建议”和“系统实际执行”。如果智能体口头表示退款成功,但后台接口失败,审计记录必须能够快速还原差异。企业可为每次关键操作生成唯一事件编号,并将确认记录、调用请求和业务回执关联起来。这样遇到投诉时,能够回答“谁在什么时间基于什么信息执行了什么操作”。
追溯并不意味着无限期保存全部数据。录音、转写文本和身份信息应按照业务必要性分类设置保存期限,限制访问权限,并对手机号、证件号码和账户信息进行遮蔽。研发调试环境不应直接复制真实客服数据,导出日志也应留下审批和下载记录。
将“九不准”和“七条底线”落实到模型防线
- 违法与有害内容:在模型前后分别设置输入识别和输出审核,阻断违法、有害、欺诈及破坏公共秩序的信息。
- 真实性底线:产品价格、政策、订单状态和服务承诺只能来自经过授权的知识库或实时业务接口。无法核实时应明确表示“不确定”,不得补写答案。
- 用户权益:不得通过虚构优惠期限、冒充真人或反复施压诱导用户付款,也不能因为用户拒绝授权而阻断无关的基础服务。
- 隐私边界:模型不得主动索取完成当前任务并不需要的敏感信息,也不得在语音中完整复述证件号、银行卡号等内容。
- 社会责任:遇到高风险、复杂争议、未成年人或明显情绪异常场景,应切换至更保守的应答策略并提供人工渠道。
上线时重点测量四类指标
企业不应只采用供应商公布的延迟或综合基准。Mercury Voice官方数据来自其自身测试集,独立分析指出,320毫秒属于模型首个回答词元时间,不能代表从用户停止说话到听见合成语音的完整耗时。第三方分析
正式部署前,应使用脱敏后的真实业务样本进行对照测试,分别统计端到端延迟P50与P95、身份告知完成率、关键操作二次确认覆盖率、工具调用准确率和人工转接成功率。同时加入噪声、方言、用户打断、多人说话、重复确认和接口超时等压力场景。任何一次高风险误执行,都不应被平均响应速度掩盖。
总结
Mercury Voice为客服智能体提供了新的低延迟模型选择,但商用价值不能只用“回答更快”衡量。较稳妥的实施路径是:把身份告知固化为首要节点,把二次确认设置在不可逆操作之前,把模型输出、工具调用和业务结果串成可审计事件链,并用内容安全、隐私保护和人工接管机制守住“九不准”与“七条底线”。低延迟负责改善体验,确定性流程负责约束风险,两者缺一不可。
事件及资料日期:Mercury Voice于2026年9月29日由Inception宣布面向企业客户正式可用。产品能力、延迟指标、上下文长度和企业接入信息见Inception官方发布资料;关于模型延迟与端到端通话延迟的区别,参考2026年9月29日发布的RuntimeWire交叉核验报道及第三方评测分析。