导语:2026年9月10日,OpenAI正式将GPT-Live-1引入API。与传统“语音转文字、模型推理、文字转语音”的串联方案不同,新模型可在输出语音时持续接收输入,处理插话、停顿和背景噪声,并可将复杂推理与工具调用交给后端智能体。官方产品公告与开发文档均确认了其全双工、任务委派和电话接入能力。OpenAI产品公告 OpenAI开发文档
更自然的交流也带来了更隐蔽的风险。当语音智能体能够连续对话、接听电话并使用高度拟真的自定义声音时,声音仿冒、身份误导、虚假信息扩散和越权操作都可能被放大。对面向中文互联网提供服务的开发者而言,安全措施不能只停留在提示词层面,而应覆盖身份、内容、操作和传播全链路。
全双工能力为何改变风险边界
传统语音机器人通常存在明显停顿,用户较容易意识到自己正在与机器交流。全双工模型可以边听边说,允许用户随时打断,并通过语气、语速和对话风格设置形成更自然的交互。GPT-Live-1还支持电话集成,可用于预约和客户服务等业务。官方发布说明 IT之家报道
这种自然感可能弱化用户的警惕。如果系统使用与真人相近的声线,却没有及时说明AI身份,用户可能误以为对方是客服人员、亲友或机构代表。一旦再叠加号码伪装、泄露的个人信息或自动外呼,风险就不只是“生成了一段假音频”,而是形成可持续互动的社会工程攻击。
以“九不准”和“七条底线”划定内容红线
以合法合规、公共利益和社会责任为基本要求,语音智能体首先应建立内容红线规则。系统不得生成或传播危害国家安全、扰乱社会秩序、宣扬违法犯罪、散布谣言、侵害他人合法权益以及违背社会公德的信息,也不能借“角色扮演”“语音转述”规避审核。面对涉及公共事件、灾害、金融交易、医疗建议或机构通知的内容,应提高核验等级,不确定时明确告知用户,而不是用肯定语气补全事实。
“七条底线”所强调的法律法规、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性等要求,应转化为可执行的产品策略。例如,对冒充公职人员、媒体记者、企业负责人或用户亲友的请求直接拒绝;对批量外呼、诱导转账、制造恐慌和传播未经证实消息的任务限制使用;对明显可能造成公众误认的声音内容启用人工复核。
防范声音仿冒的五道技术防线
- 明确告知AI身份。在电话接通、会话开始和重新连接时,以清晰语音说明“本次服务由人工智能提供”。对于较长通话,可在关键业务节点再次提示,避免用户中途加入后产生误认。
- 限制声音定制。上传或创建自定义声线时,应取得可验证的授权,并保存授权范围、期限和用途。对公众人物、企业高管、亲友以及其他可识别自然人的声音,不应仅凭一段录音开放克隆。
- 实行双重标识。《人工智能生成合成内容标识办法》明确将音频纳入生成合成内容,并要求符合条件的服务添加显式标识,在文件元数据中加入隐式标识。导出和下载的音频不应因转码而主动移除标识。中国政府网政策原文
- 设置高风险操作确认。语音模型可以负责自然交流,但支付、退款、改密、开通权限、提交合同和读取敏感数据等动作,应由后端系统进行独立鉴权,并要求用户通过可信渠道二次确认。OpenAI文档也明确指出,应用方负责权限、确认、私有函数执行和持久任务状态。GPT-Live开发文档
- 保留可审计证据。记录会话编号、模型版本、授权状态、工具调用、风险命中和人工接管情况,同时遵循最小必要原则保护个人信息。发生投诉时,应能够还原“谁发起、使用何种声音、调用了什么工具、内容传播到哪里”。
阻断违规传播不能只依赖内容审核
实时语音的风险具有连续性。单句看似正常的内容,组合后可能形成诈骗话术或虚假叙事。因此,平台需要同时进行流式检测和会话级复核:前者关注敏感指令、身份冒充和诱导行为,后者识别多轮对话中的真实目的。达到风险阈值后,系统应停止自动执行、向用户说明限制原因,并转交人工处理。
传播端还应核验音频元数据和用户声明。对于已经标明为AI生成的内容,应在播放界面设置显著提示;对没有标识但检测出合成痕迹的音频,可按疑似生成内容进行提醒。用户不得恶意删除、篡改、伪造或隐匿生成合成标识,这是《人工智能生成合成内容标识办法》提出的明确要求。标识办法第六条和第十条
上线前应完成哪些安全测试
- 测试系统能否拒绝冒充亲友、客服、执法人员或机构负责人的请求。
- 验证显式提示在通话、录音、下载和转发环节是否持续存在。
- 检查用户打断语音输出后,后台工具任务是否仍在运行,避免出现“声音停止但操作继续”的情况。
- 模拟方言、噪声、多人交谈和恶意提示,观察审核机制是否出现漏判。
- 确认支付、账户变更和敏感信息查询均不能仅凭声音完成身份认证。
- 建立紧急停用、人工接管、投诉处理和来源追溯机制。
总结
GPT-Live-1把实时语音智能体从轮流应答推向持续对话,但“更像真人”不应等同于“可以冒充真人”。面向中文互联网落地时,开发者应以“九不准”和“七条底线”约束内容边界,以AI身份披露、声音授权、双重标识、独立鉴权、全程审计和人工兜底控制应用风险。只有让用户始终知道自己在与谁交流,并确保模型不能绕过权限直接行动,全双工语音才能成为可信的服务入口,而不是违规传播的加速器。
事件或资料日期:
GPT-Live-1 API产品公告发布日期:2026年9月10日,见OpenAI官方公告。
中文媒体交叉报道日期:2026年9月11日,见IT之家报道。
《人工智能生成合成内容标识办法》成文日期:2025年3月7日,施行日期:2025年9月1日,见中国政府网文件。