2026 年 8 月 26 日,GLM-5.3-Flash 正式公开。它最值得关注的并不是“Flash”这个名称,而是智谱为其重新训练了原生多模态基础模型,并将最新的 30T Token 多模态预训练语料、混合注意力架构和较低激活参数规模放进同一套技术方案。官方模型卡与发布资料均显示,该模型拥有 320B 总参数、18B 激活参数,是 GLM-5 系列首个原生多模态模型。[1][2]
30T Token 的意义不只是数据规模
“30T Token 多模态预训练语料”是官方披露的训练规模,但目前公开资料没有进一步给出文本、图像、视频、代码及合成数据各自所占比例,也没有公布完整的数据清洗与训练算力明细。因此,不能仅依据 30T 这个数字推导训练质量,更不能把 Token 数直接等同于图片或视频数量。现阶段能够确认的是,这批语料参与了新基础模型的预训练,而非在旧模型上简单增加视觉适配模块。官方发布资料模型卡
这种路线与常见的“语言模型加视觉编码器”思路存在重要区别。GLM-5.3-Flash 的目标是让文本、代码和视觉信息从预训练阶段开始形成更紧密的关联,使视觉不再只是一次性的图片识别入口,而是能够进入 Agent 的持续执行过程。对于前端开发、游戏制作、3D 场景构建和桌面操作,模型可以观察界面或渲染结果,再根据反馈修改代码。智谱开放文档技术介绍
原生视觉能力改变了 Coding 闭环
传统 Coding Agent 主要依赖源代码、终端日志和测试结果判断任务是否完成,但界面布局错位、按钮不可点击、图形渲染异常等问题,未必能被文本测试发现。GLM-5.3-Flash 将视觉反馈纳入编码循环,使 Agent 能够在代码、浏览器和图形界面之间切换,并通过观察实际结果继续修正。这种能力更接近“生成、运行、观察、再修改”的闭环,而不是单轮看图问答。功能说明官方案例说明
官方还介绍了面向视觉 Coding 的数据合成流水线,以及利用环境反馈和真实用户流程强化 GUI 判断的方法。这意味着多模态训练不仅要让模型识别画面内容,还要训练它判断何时需要观察、从画面中寻找什么问题,以及如何把视觉结论转化为下一步操作。不过,这些能力在不同网页框架、屏幕分辨率和复杂交互条件下的稳定性,仍需独立测试,官方展示不应直接视为所有生产环境的成功率。训练与视觉反馈说明公开模型资料
训练投入与推理成本需要分开观察
30T Token 说明预训练数据规模很大,却不能据此计算实际训练成本。公开资料尚未披露完整训练周期、芯片数量、有效训练 Token、失败实验开销和总能耗,因此目前无法可靠估算其预训练费用。对开发者更有现实意义的是推理侧结构:320B 是总参数量,而每个 Token 仅激活约 18B 参数,这种 MoE 设计能够减少单次推理实际参与计算的参数规模。参数信息官方模型文档
GLM-5.3-Flash 首次在 GLM 系列中组合稀疏注意力与线性注意力:线性注意力用于捕获局部依赖,稀疏注意力通过索引机制召回全局相关内容,IndexPool 则把四个索引缓存向量压缩为一个。按照官方计算口径,与 GLM-5.3 相比,其注意力计算量降低约 3.01 倍,KV Cache 大小降低约 4.44 倍。这些数字是架构层面的官方比较,不等同于不同硬件和并发条件下的实际账单降幅。架构数据官方技术说明
成本优势尤其可能体现在长上下文和多轮 Agent 任务中。该模型支持最高 1M Token 上下文,输入可包含文本、图像、视频和文件,但上下文越长,预填充耗时、缓存占用和视觉编码成本通常越值得关注。企业评估时不应只比较每百万 Token 标价,还应记录完成一次任务所需的输入量、思考长度、工具调用轮数、失败重试次数及最终交付成功率。接口与上下文规格部署资料
更适合怎样的实际测试
- 视觉前端回归:向模型提供设计参考图,让它生成页面并通过截图检查布局、字体、间距和交互状态。
- 长文档与图表理解:使用包含表格、图形和正文的真实文件,检验跨页引用、数据溯源和视觉定位能力。
- Agent 成本压测:固定任务、工具权限和最大 Token 预算,对比总耗时、调用次数、缓存占用与完成率。
- 本地部署评估:分别测试短文本、长上下文和多图输入,避免根据 18B 激活参数误判完整权重及运行时内存需求。
总结
GLM-5.3-Flash 的核心观察点,是用 30T Token 多模态预训练语料建立原生视觉基础,再通过 18B 激活参数的 MoE 结构、稀疏与线性混合注意力降低推理负担。它把视觉能力从“识别输入”推进到“参与 Coding 和 Agent 自我验证”,但公开信息尚不足以核算其完整训练成本。对使用者而言,最可靠的判断方式仍是以真实工作流测试单位任务成本、视觉纠错能力和最终交付成功率,而不是只看语料规模或厂商基准。官方发布开源模型卡
事件或资料日期:GLM-5.3-Flash 于 2026 年 8 月 26 日公开发布;本文资料检索与核验日期为 2026 年 8 月 28 日。发布日期由腾讯云开发者社区发布记录交叉核验,模型架构、30T Token 多模态预训练语料及原生视觉能力信息来自Z.ai 官方发布资料、智谱开放文档与Hugging Face 官方模型卡。