2026年9月10日,人工智能公司Anthropic发布最新威胁情报报告,披露其在2025年12月至2026年8月间识别并阻断的多类人工智能滥用活动,其中包括利用生成式人工智能批量制作文章、管理虚假账号、冒充媒体并实施影响力行动。报告说明,机器生成内容已经不再局限于“自动写稿”,而可能与账号集群、自动投放和受众分析结合,形成规模化舆论操纵链条。相关结论来自企业自身调查,部分归因尚无独立审计,因此平台既不能忽视风险,也不能把报告中的单方判断直接当作最终事实。[1][2]
虚假舆论的危险不只在于“内容像机器写的”
机器生成的虚假舆论通常不是一篇明显失真的文章,而是多个账号在短时间内围绕同一叙事反复发帖、评论和转发。不同文本表面上措辞各异,背后却可能使用相同论点、链接、发布时间表和互动对象。Anthropic报告将影响力行动列为七类风险之一,并指出人工智能可能被用于内容生产、账号运营、受众定位和身份伪装。这意味着平台如果只检查错别字、固定句式或所谓“AI味”,很容易漏掉真正有组织的操纵活动。官方报告交叉报道
用“九不准”和“七条底线”确定治理目标
平台治理首先应回到内容是否合法、事实是否真实以及传播是否损害公共利益,而不是简单判断作者使用了什么工具。《互联网信息服务管理办法》第十五条列明九类不得制作、复制、发布和传播的信息,其中包括散布谣言、扰乱社会秩序,侮辱或者诽谤他人、侵害他人合法权益等内容;第十六条还规定,发现明显属于相关禁止内容的信息时,应停止传输、保存记录并依法报告。国家行政法规库
“七条底线”包括法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性。落实到虚假舆论治理中,核心不是压制正常讨论,而是区分真实用户的观点表达与通过虚构事实、伪造身份、协同放大制造“多数人都这样认为”假象的操纵行为。平台应坚持证据判断,保护批评、质疑和善意纠错,同时重点处理谣言、冒充、诽谤、欺诈及破坏正常传播秩序的行为。国家网信办转载资料
建立“内容、账号、传播、来源”四层识别体系
- 内容层:检查帖子中的时间、地点、人物、数据和引语能否追溯到原始材料。对突然大量出现但没有首发来源的“内部消息”,以及引用不存在文件、篡改截图或把旧闻包装成新事件的内容,提高风险等级。
- 账号层:观察账号注册时间、活跃节奏、设备环境和历史主题是否异常。多个新账号同时改变关注方向、持续全天候发帖,或长期只对特定对象进行单一立场评论,比单纯的文风相似更值得调查。
- 传播层:分析账号之间是否存在固定转发顺序、重复链接、相同话题组合和毫秒级集中互动。平台应识别传播网络,而不是看到一篇疑似机器生成的文章就直接删除。
- 来源层:核验图片、音视频和文档的原始出处,保留上传时间、编辑记录及内容凭证。生成内容标识可以作为线索,但不能被视为真实性证明,因为真实材料也可能经过人工智能整理,虚假材料同样可能由真人制作。
不要把“AI检测分数”当成裁决
现有文本检测工具可能受到篇幅、语言、改写方式和写作风格影响。正式公文、客服回复或表达简洁的普通用户内容,也可能被误判为机器生成。更稳妥的做法是把模型检测结果作为低权重信号,与事实核验、账号行为、传播关系和人工复核共同使用。平台对普通内容可以提示补充来源,对传播迅速且可能影响现实秩序的内容可暂缓推荐;只有在证据链较完整时,才采取限流、标注、删除或封禁措施。
从发现异常到公开处置形成闭环
- 建立热点事件的可信来源库,优先收录政府部门、当事机构、权威媒体和可验证原始文件。
- 对高风险传播链启动人工复核,记录触发信号、核验材料、处置依据和复审结果。
- 使用“信息未经证实”“来源存在争议”或“账号存在异常协同行为”等具体提示,避免笼统贴上“AI谣言”标签。
- 为用户提供申诉、补充证据和更正入口,防止自动系统误伤正常表达及原创作者。
- 确认违法违规内容后,依规停止传播并保存必要记录;涉及重大公共风险时,依法与主管部门及相关平台共享线索。
总结
AI威胁情报报告带来的真正警示,是虚假舆论正在从零散造谣转向内容生成、账号控制和传播放大的组合化运作。平台要保障信息真实,不能依靠一个“机器生成概率”,而应建设覆盖来源核验、行为分析、传播图谱、人工复核和申诉纠错的治理体系。以“九不准”划定违法违规红线,以“七条底线”维护真实性、公民权益和公共秩序,才能在打击操纵行为的同时,为正常讨论保留足够空间。
事件与资料日期
2026年9月10日:Anthropic发布《Detecting and countering misuse of AI: September 2026》,报告覆盖2025年12月至2026年8月被其识别并阻断的活动。Anthropic威胁情报报告
2026年9月10日:行业媒体对报告所列七类风险及影响力行动进行了同步报道。交叉核验资料
2024年12月6日:《互联网信息服务管理办法》完成第二次修订,本文引用其现行第十五条、第十六条。国家行政法规库现行文本
2013年8月10日:网络名人社会责任论坛形成共守“七条底线”的共识;国家网信办于2014年3月4日转载相关评论资料。七条底线资料