一百万 Token 的上下文窗口,意味着模型可以一次接收更大的代码仓库、合同集合、会议记录或研究资料。但对企业来说,“装得下”不等于“做得完”。长流程任务真正考验的,是模型能否持续规划、准确调用工具、保留关键状态,并在多轮执行后交付可验证的结果。腾讯于 2026 年 8 月 28 日发布并开源 Hy4 preview,使这个问题再次成为企业落地 AI 的焦点。[1][2]
百万级上下文解决了什么问题
腾讯公开信息显示,Hy4 preview 总参数为 770B,推理时激活参数为 49B,上下文长度达到 1M,重点面向软件工程、办公分析、游戏开发和科学研究等生产力场景。模型已经开源,并可通过腾讯云、OpenRouter以及 WorkBuddy、CodeBuddy、元宝和 ima 等产品使用。腾讯混元发布说明21世纪经济报道
对企业而言,长上下文最直接的价值是减少信息切片。过去分析数百页招标文件、跨部门制度或大型代码库时,团队通常需要先拆分资料,再通过检索或摘要逐段送入模型。上下文扩展到百万级后,模型可以在一次任务中看到更多原始材料,跨文件查找依赖关系、比较条款差异、追踪需求变更时,理论上更不容易因为分段而遗漏关联信息。
不过,上下文窗口只是模型能够接收的最大信息范围,并不代表其中每一条信息都会得到同等准确的关注。材料越长,重复内容、过期版本和无关噪声越多。如果企业把全部文件不加整理地塞进提示词,模型仍可能引用错误版本,或在长链路中偏离最初目标。因此,百万上下文更适合作为检索、版本管理和任务编排的容量基础,而不是替代这些系统。
长流程任务的门槛高于长文阅读
真正的企业长流程任务通常不是“读完资料后回答一个问题”,而是连续完成多个动作。例如,模型需要读取客户需求、检查历史合同、查询库存、生成报价表、提交审批,并根据审批意见重新修改文档。任何一步出现权限错误、工具调用失败或状态丢失,都可能使最终结果不可用。
腾讯称 Hy4 preview 加强了长程开发任务中的理解、规划、调试和验证能力,并优化了数据分析、跨文件协作以及文档、表格和演示文稿的完整交付流程。腾讯还组织 163 名内部专家,对 203 个工程任务进行了盲测,Hy4 preview 获得 2.99 分,略高于报道中参与比较的 GLM 5.3 和 Kimi K3。需要注意,这些结果主要来自腾讯披露的内部评测,能够说明模型的设计方向,但仍不能等同于不同企业环境中的独立验证。[1][2]
更值得关注的是,腾讯明确将其称为早期预览版本,并承认模型在复杂任务中存在长思考和过度自我验证倾向。对于长流程业务,这类问题可能表现为反复检查同一环节、调用次数增加、响应时间拉长,甚至因中途改写计划而产生不一致结果。因此,现阶段更合理的定位是“可进入企业验证阶段”,而不是直接替代成熟业务系统。官方已知问题说明新浪科技相关报道
企业应重点验证四项能力
- 关键信息召回率:不要只测试模型能否接收百万 Token,而要在不同位置放置版本号、金额、审批条件和异常条款,观察它能否稳定找到并正确引用。
- 多步骤完成率:将真实流程拆成计划、执行、检查和交付四个阶段,记录每一步成功率。最终文件看似完整,不代表中间的数据来源和计算过程正确。
- 工具调用可靠性:重点测试数据库、搜索、代码执行和办公软件接口发生超时、返回空值或权限不足时,模型能否停止操作、说明原因并安全重试。
- 成本与时延:腾讯公布的 API 价格为每百万 Token 输入 6 元、输出 18 元,缓存命中输入为 0.3 元。企业仍需按照实际上下文长度、重复调用次数及并发量测算整体成本,尤其要防止智能体在循环验证中持续消耗 Token。价格说明媒体核验
适合从哪些场景开始
Hy4 preview 更适合从资料充分、结果可复核、风险可控制的任务切入,例如跨文件制度问答、代码仓库梳理、项目周报汇总、历史合同差异检查,以及研究资料的初步分类。此类任务能够发挥长上下文优势,同时允许员工在提交结果前进行复核。
涉及付款、授信、生产控制、客户承诺或合规审批的流程,则不宜一开始就完全自动化。企业应保留人工审批节点,并通过权限隔离、操作日志、引用追踪和输出校验限制模型的执行范围。开源权重有利于企业进行私有化评估和定制,但部署模型本身并不会自动解决数据治理与责任归属问题。
总结
Hy4 preview 把百万级上下文、开源模型和生产力场景结合起来,为企业处理大型资料集合和跨文件任务提供了新的技术选项。但判断它能否胜任企业长流程任务,不能只看参数规模或上下文长度。更关键的指标是端到端完成率、工具调用稳定性、关键事实准确率、失败后的可恢复性,以及全过程是否可审计。
现阶段可以得出一个相对谨慎的结论:Hy4 preview 已具备进入企业概念验证和受控试点的条件,尤其值得在代码、办公分析及知识密集型任务中测试;但在高风险、强合规、长时间自主运行的流程里,仍应采用“模型执行、系统约束、人工把关”的组合方式。百万上下文打开了长流程任务的入口,距离稳定接管完整业务流程,还需要真实环境中的持续验证。