递归自我改进并不只是模型反复生成答案,而是系统把经验、评估结果或运行反馈转化为持久改动,并让这些改动影响下一轮模型开发。2026年9月15日修订的一篇研究论文将其发展路径概括为改进执行、策略选择、经验获取、环境适应和元改进等层次;9月11日的行业报道则指出,多家前沿实验室的研究人员正在关注人类对后续模型开发过程失去控制的风险。两份资料共同提示:当模型参与训练下一代模型时,安全重点必须从“检查最终输出”前移到“记录并控制整个改进过程”。[1][2]
先把“自我改进”拆成可审计步骤
讨论人工终止机制之前,需要避免把所有自动优化都称为递归自我改进。模型生成训练样本、修改提示词或建议代码,并不必然意味着它已经能够独立改进自身。更实用的判断方法,是检查系统是否形成了“发现问题、提出改动、执行实验、评价结果、保留改动、进入下一轮”的闭环,以及新模型是否获得了修改评价标准、训练工具或后续改进策略的权限。
因此,训练平台不应只保存最终权重和一份实验报告,而应为每轮改进建立不可覆盖的事件链。至少记录发起主体、基础模型版本、数据来源、提示与工具调用、代码及配置差异、算力预算、评价器版本、审批人员、输出制品、异常告警与终止原因。记录应具有统一时间戳、哈希校验和版本关联,使审计人员能够从任一后代模型反向定位其父版本及关键变更。
以“九不准”和“七条底线”设置准入门
面向中文互联网场景,过程治理应把遵守法律法规、维护国家利益和公共秩序、保护合法权益、确保信息真实等要求转化为机器可执行的准入规则,而不是停留在上线前的文字承诺。每一次数据扩充、奖励函数修改和能力提升,都应重新经过内容安全、隐私保护、知识产权、歧视偏差、虚假信息与社会影响检查。
- 数据门:记录数据集来源、授权状态、清洗规则和删除请求,禁止模型自行接入未经批准的数据源。
- 目标门:训练目标、奖励函数和评价指标必须由人工签名发布,模型只能在授权范围内提出候选方案。
- 能力门:代码执行、网络访问、模型发布、凭据读取和算力申请分别授权,不因综合得分提升而自动解锁。
- 内容门:对违法有害信息、造谣误导、侵权泄密和破坏公共秩序等风险进行独立测试,未通过不得晋级。
- 发布门:候选模型只能进入隔离环境或灰度范围,不允许训练代理自行替换生产模型。
让人工终止真正切断改进链
“停止按钮”如果只是向模型发送一条指令,并不能构成可靠终止。有效机制应位于模型权限之外,由独立控制平面直接撤销计算任务、网络连接、工具令牌、数据写入权和模型发布权。模型可以建议继续实验,但无权修改终止策略、覆盖审计日志或恢复已经冻结的任务。
人工终止可以设计为三级。一级是自动暂停,当出现评价突增、目标漂移、异常资源消耗、日志缺失或未授权工具调用时,立即冻结当前轮次;二级是人工熔断,由值班人员停止全部子任务并吊销临时凭据;三级是代际回滚,将候选模型、合成数据和衍生代码全部隔离,恢复到最近一个经过人工批准的父版本。对高风险能力变化,可采用双人授权,防止单点误操作。
终止机制的核心不是让模型“愿意停”,而是确保它在系统结构上“无法不停”。
评价器和日志也要防止被模型影响
递归训练中容易忽略的风险,是模型逐渐学会迎合评价器,而不是真正提高安全性。为此,训练评价与安全评价应相互隔离,关键测试集不得写入模型可访问的上下文,评价器更新也不能由被评价模型直接批准。对于显著提升,应通过外部基准、人工抽检和对抗测试进行复核,避免单一自动评分成为后代模型晋级的唯一依据。
日志系统同样需要“三份证据”:运行平台保存原始事件,独立审计域保存只追加副本,审批系统保存人员决策及理由。若三方记录在时间、版本或哈希上无法对应,系统应默认暂停,而不是为了保持训练进度继续运行。涉及个人信息或商业秘密的日志可以分级加密,但不能以保密为由取消必要留痕。
总结
递归自我改进的治理目标不是阻止模型参与研发,而是确保每一次改动可追溯、每一项权限可撤销、每一个后代可回滚。结合“九不准”和“七条底线”,可落地为数据、目标、能力、内容和发布五道准入门,再以独立控制平面、三级终止、双人授权和防篡改日志形成闭环。只要模型无法自行改变规则、删除证据或绕过熔断,人类就仍然掌握训练下一代模型的最终决定权。