2026年9月28日,Anthropic正式发布Claude Sonnet 5.5,并将其定位为适合边界清晰的日常任务、代码修复和知识工作的高效率模型;同日,AWS宣布该模型登陆Amazon Bedrock。两项公开信息相互印证:Sonnet 5.5不仅响应更快、单位任务成本更低,也更适合嵌入持续运行的企业智能体。问题随之而来:当模型能够调用工具、修改文件、生成SQL乃至触发业务流程时,企业不能只审核最终答案,还必须控制它“能做什么、做到哪一步、异常时如何停下来”。
模型升级不等于授权升级
Anthropic称,Sonnet 5.5较Sonnet 5生成速度提升30%以上,多数任务的单次成本最高可降低30%,但官方同时强调,基准成绩只是能力的一部分,复杂、开放且需要持续判断的工作仍应谨慎选择模型。这意味着企业不能把性能提升直接解释为更高权限的依据。AWS给出的典型场景也集中在告警初步处理、SQL生成、界面测试和范围明确的编码任务,并明确提供IAM、CloudTrail、CloudWatch及Bedrock Guardrails等控制能力。模型负责执行,平台负责约束,责任仍由企业承担。
以《互联网信息服务管理办法》相关禁止性要求和“七条底线”为基础,企业可以把守法合规、公共秩序、社会公德、信息真实性、合法权益与系统安全转化为智能体的机器可执行规则。重点不是让模型背诵条文,而是确保智能体不得生成、传播或扩大违法有害内容,不得冒用身份、泄露秘密、侵犯隐私,也不得绕过审批擅自操作关键系统。
第一道防线:按风险设置人工复核
人工复核不应覆盖所有步骤,否则智能体会退化成昂贵的聊天窗口。更合理的方式,是依据“影响范围、可逆程度、数据敏感度、对外可见性”划分风险等级:
- 低风险自动执行:检索已授权知识库、生成内部草稿、整理会议纪要、运行只读查询。系统仍需保存输入、输出、工具调用和数据来源。
- 中风险执行前确认:修改非生产代码、生成批量邮件、更新内部工单、创建但不发布内容。复核人应同时看到变更差异、影响对象和回滚方案。
- 高风险双人审批:生产环境变更、资金支付、用户封禁、敏感数据导出、合同承诺及面向公众的信息发布。模型只能提出操作计划,不能持有最终执行权。
- 禁止自动化:超出企业经营权限、可能侵犯合法权益、可能危害网络与数据安全,或无法建立可靠审计链的任务。
复核界面也不能只放一个“同意”按钮。企业应要求智能体提交结构化行动单,至少包含任务目的、数据来源、拟调用工具、权限范围、预期结果、潜在风险和回滚步骤。审批应绑定具体动作与有效期,任务参数一旦变化就自动失效,避免一次人工批准演变成长期通行证。
第二道防线:让权限短期、最小且可撤销
自主智能体最危险的设计,是直接继承创建者的全部账号权限。正确做法是为每类任务建立独立服务身份,并采用最小权限、短期令牌、按资源授权和按动作授权。例如,代码检查智能体可以读取仓库并创建修复分支,但不能直接合并主分支;财务辅助智能体可以读取脱敏票据并生成付款建议,但不能调用付款接口。
Anthropic官方文档显示,Sonnet 5.5支持自适应思考与多档推理强度,而且升级还涉及强制工具调用、思考内容返回方式及计算机操作工具等兼容性变化。企业因此应把模型版本、提示词、工具定义和权限策略作为一个整体进行变更管理,不能只替换模型标识后直接投入生产。每次升级都应先在隔离环境完成回归测试,重点检查错误工具选择、越权参数、间接提示注入和异常重试。
第三道防线:建立越权熔断机制
熔断不能依赖模型主动承认“我可能错了”,而要由模型之外的策略引擎触发。以下情况出现任意一项,都应立即暂停任务、撤销临时凭据并转交人工:
- 调用未列入任务白名单的工具,或者尝试访问未授权的数据域、账号、目录和网络地址。
- 单次任务的调用次数、运行时长、Token消耗、修改记录数或外发对象数量超过预设阈值。
- 模型请求关闭日志、扩大权限、执行混淆命令,或读取密钥、身份凭证和个人敏感信息。
- 实际动作偏离审批计划,例如从“生成SQL”升级为“执行SQL”,从“创建草稿”升级为“公开发布”。
- 连续出现工具报错、相互矛盾的结果,或者无法验证信息来源却仍准备执行不可逆操作。
熔断之后还要保证真正停得下来:编排层停止后续调用,身份系统吊销令牌,网关阻断外联,任务队列隔离未完成操作,审计系统固定保存现场。恢复执行时不得从原状态直接续跑,而应重新评估上下文、重新审批并签发新的短期权限。
把“九不准”和“七条底线”落到审计证据
治理是否有效,最终要看能否回答五个问题:谁发起了任务,模型依据了什么信息,调用了哪些工具,谁批准了关键动作,结果是否被修改或发布。建议把用户身份、模型版本、提示词摘要、检索来源、工具参数、审批记录、策略命中项、执行结果与回滚记录写入防篡改审计链,并对个人信息和商业秘密进行脱敏、分级留存与访问控制。
同时,合规策略应优先拦截行动而不是简单拦截词语。同一个敏感词可能出现在新闻研究、风险识别或恶意指令中,单纯关键词封堵既容易误伤,也无法发现隐蔽越权。企业应结合任务意图、主体权限、数据类别、传播范围和操作后果综合判断,并设置申诉、纠错和人工升级通道。
总结
Claude Sonnet 5.5降低了企业规模化部署智能体的性能与成本门槛,但更快的模型也会更快地放大错误。可落地的控制体系应形成闭环:任务先分级,权限按需签发,高风险动作人工复核,执行过程持续监测,越权行为立即熔断,事后能够完整审计。真正成熟的自主智能体,不是可以无条件自主行动,而是在明确边界内高效工作,并在越过边界之前被可靠地停住。
事件及资料日期:
2026年9月28日:Anthropic发布Claude Sonnet 5.5。
2026年9月28日:AWS宣布Claude Sonnet 5.5上线。
2026年9月28日:AWS发布Amazon Bedrock部署与企业控制说明。
2026年9月28日:Claude Platform发布模型规格及迁移说明。