过去一周,大模型市场的更新节奏再次加快。根据 BenchLM 截至 2026 年 8 月 28 日整理的月度发布记录,8 月已有 24 个模型更新,涉及 18 家提供方;其中,8 月 24 日至 28 日新增或确认的项目包括 Qwen3.8-Flash-Next、GLM-5.3-Flash、腾讯 Hy4 preview、Ling-3.0-flash-Fin 和 Apodex 1.1 等。需要说明的是,BenchLM 在这里承担的是发布信息汇总与评测索引角色,并不是这些模型的开发方。[1]
8 月末更新呈现三条清晰路线
从最近 7 天的公开信息看,新模型已经不再单纯追求参数规模或通用榜单名次,而是沿着三条路线推进:第一是通过稀疏注意力和低激活参数降低推理成本;第二是增强长上下文、代码和办公任务能力;第三是针对金融等垂直领域进行专门训练。BenchLM 的月度记录提供了统一时间线,但模型规格、开放方式和性能声明仍应回到开发方资料核验。
Qwen3.8-Flash-Next:以新架构预演下一代模型
2026 年 8 月 26 日,Qwen 团队发布并开放 Qwen3.8-Flash-Next 权重。该模型是一款多模态 MoE 模型,也被官方定位为 Qwen4 架构的提前预览。其主体模型包含 125B 参数,另有 51B N-gram Embedding,每个 Token 激活约 6B 参数,原生上下文长度为 262,144 Token,并可通过 YaRN 扩展至 100 万 Token。[2][3]
这次更新的重点并非简单扩容,而是同时调整注意力、残差连接、嵌入和优化器。官方资料提到,模型采用 Gated DeltaNet 与 Qwen Sparse Attention 组合的混合架构,通过轻量级索引器筛选长上下文中的重要内容;Gated Residual 则把残差流扩展为四个分支。对开发者而言,这类设计的实际价值在于降低长文本处理成本,并为代码智能体、跨文档分析和多模态应用提供更大的上下文空间。不过,官方关于训练成本和能力提升的比较仍属于开发方测试结果,部署前应使用自己的任务集复测。
腾讯 Hy4 preview:从模型能力转向生产力交付
2026 年 8 月 28 日,腾讯发布并开源 Hy4 preview。腾讯公开资料显示,该模型拥有 770B 总参数、49B 激活参数和 100 万 Token 上下文窗口,重点覆盖长周期软件工程、跨文件办公、数据分析、游戏开发和科学研究。模型已经接入 WorkBuddy、CodeBuddy、元宝和 ima,并可通过腾讯云 TokenHub 等渠道调用。[4][5]
Hy4 preview 的发布方式值得关注:模型、API 与办公和编程产品同步上线,说明厂商正在把竞争焦点从“回答得更好”转向“能否完成较长的真实工作流”。腾讯披露的内部盲测覆盖 163 名专家和 203 个工程任务,Hy4 preview 平均得分为 2.99/4。由于这一结果来自腾讯内部评估,不能直接等同于独立第三方结论,但其任务设计思路具有参考价值,也就是用规划、调试、验证和最终交付评估模型,而不是只观察单轮问答准确率。
Ling-3.0-flash-Fin:垂直模型开始强调证据追溯
同在 2026 年 8 月 28 日,蚂蚁百灵推出金融增强模型 Ling-3.0-flash-Fin。公开报道显示,该模型延续 Ling-3.0-flash 的架构,保留 124B 总参数与 5.1B 激活参数,并通过金融语料持续预训练、领域后训练和工具调用优化,面向年报、财务工作簿、多份研究材料、估值建模及银行业务等场景。其 API 提供一个月限时免费体验,模型权重计划在随后一周开放。[6][7]
金融模型的关键不只是生成流畅报告,而是能否定位原始资料、保留计算过程并让结论可复核。Ling-3.0-flash-Fin 被用于 FinFIRST、FinSearchComp Verified、Finance Agent、SpreadsheetBench 等金融与智能体基准,但目前主要成绩仍来自发布方资料。对于金融机构,合理的验证方式应包括事实引用准确率、数字计算一致性、跨文件口径冲突处理、工具调用失败恢复以及敏感数据隔离,不能直接根据官方榜单进入生产环境。
开发者如何使用 BenchLM 的 8 月记录
- 先核对发布日期:BenchLM 可用于定位近期模型,但正式上线时间、权重状态和许可证应以开发方页面为准。
- 区分“发布”与“即将开源”:API 可调用不代表权重已经开放,尤其是 Ling-3.0-flash-Fin,目前公开报道表述为计划随后开源。
- 避免只看综合分:代码、办公、金融检索和长上下文任务的评价指标不同,应建立贴近自身业务的数据集。
- 记录成本与运行条件:总参数、激活参数、上下文长度和硬件占用共同决定部署成本,不能只根据模型规模判断效率。
总结
BenchLM 的 2026 年 8 月更新记录显示,大模型竞争正在从通用能力比拼转向架构效率、超长上下文、生产力工作流和垂直领域落地。Qwen3.8-Flash-Next强调下一代稀疏架构与低激活推理,Hy4 preview 聚焦代码、办公和科研任务的完整交付,Ling-3.0-flash-Fin 则把金融资料处理与证据追溯放到核心位置。对开发团队来说,8 月末真正值得关注的不是发布数量,而是模型是否开放、评测能否复现,以及在真实任务中的准确性、成本和稳定性。
事件与资料日期
- 资料更新至 2026 年 8 月 28 日:BenchLM 2026 年 8 月模型发布记录
- 事件日期 2026 年 8 月 26 日:Qwen3.8-Flash-Next 官方仓库、阿里云技术说明
- 事件日期 2026 年 8 月 28 日:腾讯 Hy4 preview 发布公告、腾讯混元技术页面
- 事件日期 2026 年 8 月 28 日:Ling-3.0-flash-Fin 发布报道、TechNode 交叉报道