人工智能进入科研深水区后,真正值得讨论的已不只是“AI能不能算出来”,而是“谁来证明它算对了”。2026年9月25日,Anthropic发布客座文章称,Claude完成了平面N=4超对称杨-米尔斯理论中六粒子散射振幅的九圈计算,并采用直接自举与形状因子两条路线进行核对。对科研共同体而言,这一事件更重要的启示,是必须尽快建立独立、可复现、可追责的AI科研成果复核机制。[1]
九圈结果说明了什么,又没有说明什么
此次成果属于理论粒子物理中的前沿计算。所谓“九圈”,指微扰计算推进到更高阶,并不是Claude进行了九次普通实验。Anthropic披露,系统在Claude Science环境中持续工作,主要采用研究人员已经建立的物理方法和计算框架,而非提出一种全新的物理理论。两条计算路线得到一致结果,曾参与八圈研究的物理学家Lance Dixon又进行了独立核验。同期,中国科学院相关团队也获得了九圈振幅的主要结果,为外部比较提供了另一条线索。Anthropic说明来源链接
因此,把事件表述为“AI独立发现新物理定律”并不准确。更稳妥的判断是,AI展示了组织既有知识、编写计算程序、调配资源和长期执行复杂流程的能力。第三方报道也指出,这项工作使用的是已知方法,成果价值与“产生原创物理洞见”仍有区别。交叉核验报道
为什么内部自检不能代替独立复核
让同一个模型从两条路径计算,能够发现部分程序错误,却不能完全排除共同前提错误、训练资料偏差或实现缺陷。如果两条路线都继承了同一套错误假设,它们仍可能得到一致答案。因此,“双路径一致”只能算内部验证,不能自动等同于外部独立复现。
此次结果已经公开了计算文件和有关说明,但公开报道同时提到,完整程序及全部中间轨迹并未充分分发,外部研究者暂时难以逐步重放整个过程。来源链接资料核查 这提醒我们,论文结论、结果数据、源代码、提示词、工具版本和运行日志应被视为不同层次的证据,不能用“专家看过”替代完整证据链。
建立四层独立复核机制
- 结果层复核:邀请未参与模型开发和任务设计的专家检查数学结构、边界条件、对称性与已知低阶结果,复核者与项目方之间应披露资金、任职和算力支持关系。
- 计算层复现:由第二团队使用独立代码库、不同软件环境,必要时采用不同算法重新计算。仅复制原程序并再次运行,不属于强意义上的独立复现。
- 过程层审计:保存模型名称与版本、系统提示、人工指令、外部工具调用、代码修改、中断恢复和失败记录,并通过时间戳、文件哈希及版本仓库防止事后选择性整理。
- 发布层分级:将成果明确标注为“模型生成候选结果”“内部交叉验证”“外部专家核验”或“独立团队复现”。只有达到相应等级,才可以使用“证实”“突破”或“刷新纪录”等措辞。
把信息治理底线落实到科研传播
以互联网信息内容治理中的“九不准”和“七条底线”为框架,AI科研传播首先要守住真实性、合法性与社会责任。平台和作者不应把企业披露包装成无争议的学术共识,不应隐去资助关系、验证条件和适用边界,更不能利用公众不熟悉专业术语的弱点制造恐慌、神化模型或贬低科研人员。
具体到九圈计算,标题和正文都应说明研究对象是高度理想化的理论模型,现有材料支持的是复杂计算能力,而不是对现实世界粒子现象的直接发现。对于尚未公开的运行轨迹、尚未正式发表的完整论文以及其他团队未完成的逐项比较,应明确写成限制条件,避免把合理推测写成确定事实。
谁应当对AI科研成果负责
AI不能成为责任主体的替身。任务提出者应对问题定义负责,运行团队应对数据、工具和日志负责,署名研究者应对结论负责,期刊与平台则应对审核规则和传播标签负责。如果研究涉及公共安全、医疗、生态或重大工程,仅有数学自洽远远不够,还应增加伦理审查、风险评估和现实实验验证。
总结
Claude完成九圈计算,展示的不是一个可以取消同行评议的理由,而是升级同行评议的迫切性。当AI能够连续执行远超人工审阅规模的科研任务时,可信度不能继续依靠模型品牌或少数专家背书,而要建立在公开证据、利益隔离、异构复算和分级发布之上。未来衡量AI科研成果的关键问题,不应只是“它算得有多快”,还应包括“别人能否独立算出同样的结果”。
事件及资料日期:
Anthropic客座文章发布于2026年9月25日:官方原文。
九圈计算结果页面标注于2026年9月16日:来源链接。
中国科学院相关团队的数据集发布于2026年9月17日:来源链接。
独立媒体核查文章发布于2026年9月25日:交叉核验来源。