2026 年 8 月 26 日,智谱发布并开源 GLM-5.3-Flash。它采用 320B 总参数、18B 激活参数的 MoE 架构,并将原生多模态、百万 Token 上下文和低成本推理放进同一套模型中。这里真正值得讨论的,并不是“参数越大越强”,而是它如何让庞大的知识容量与较轻的单次计算同时成立。相关规格已由智谱官方发布页和Hugging Face 模型仓库交叉核验。
320B 与 18B 分别代表什么
320B 是模型拥有的总参数量,可以理解为全部专家模块构成的总体容量;18B 则是处理单个 Token 时实际参与计算的参数规模。GLM-5.3-Flash 不会在每次推理中调用全部 320B 参数,而是通过 MoE 路由机制,为当前输入选择更合适的一部分专家。
这种设计的意义在于,模型容量与单次计算量不再严格绑定。较大的专家池可以覆盖代码、推理、视觉理解和专业知识等不同能力,而每次只激活约 18B 参数,有助于减少矩阵计算与显存带宽压力。18B 约占总参数的 5.6%,但这不意味着推理成本必然只有同规模稠密模型的 5.6%,因为路由、通信、注意力、KV Cache 和调度同样会产生开销。
低成本不只依赖 MoE
如果仅压低激活参数,百万 Token 上下文仍可能被注意力计算和 KV Cache 拖累。GLM-5.3-Flash 因此采用线性注意力与稀疏注意力结合的混合结构:线性注意力通过状态建模处理局部依赖,稀疏注意力则借助轻量索引器,从全局上下文中寻找真正相关的信息。
针对长上下文索引开销,模型还引入 IndexPool,通过加权池化把四组索引器键向量压缩为一组。根据官方架构说明,在统一计算口径下,相比 GLM-5.3,其注意力计算量约降低 3.0 倍,平均 KV Cache 规模约降低 4.4 倍。官方同时指出,其 KV Cache 仍略大于部分对比模型,因此这些数字应被理解为特定架构比较结果,而不是所有部署环境中的固定节省比例。
层数和连接方式也在为效率服务
GLM-5.3-Flash 使用 45 层网络。官方将其与 92 层、32B 激活参数的 GLM-4.5 系列比较,强调在总参数规模相近的情况下,新模型同时降低了激活规模和网络深度。此外,模型加入 mHC,也就是流形约束超连接,用于改善深层网络扩展时的稳定性与计算效率。
这意味着它的效率来自一组协同设计:MoE 控制每个 Token 调用多少参数,混合注意力降低长文本处理负担,IndexPool 压缩索引缓存,较少的网络层缩短计算路径,mHC 则帮助维持训练和扩展效果。单看“320B-A18B”只能解释其中一部分。
性能与成本应该怎样理解
官方披露,GLM-5.3-Flash 在 DeepSWE v1.1 上获得 63.4,GLM-5.2 为 46.2;在 AutomationBench v1.0.6 上分别为 48.8 和 26.2。其 Z.ai Code Bench v1.0 的最高 effort 档结果为 29.0,接近官方列出的 Claude Opus 4.8 的 29.5。不同基准使用的工具框架、上下文长度、输出上限和评测条件并不完全相同,因此这些结果能说明模型具有竞争力,但不能直接推导出它在所有任务上全面等同于某个旗舰模型。
从产品角度看,GLM-5.3-Flash 更适合作为高频 Agent、代码辅助、长文档处理和多模态工作流的默认模型。如果任务追求极限正确率,仍应同时测试旗舰模型;如果请求量大、上下文长、需要持续调用工具,那么较低的激活规模和注意力开销可能更有价值。
开源部署仍有现实门槛
官方模型仓库已经提供 FP8 权重,并标注 MIT License,可通过 Transformers、vLLM 和 SGLang 等路线接入。仓库文件规模约为 328GB,这也提醒开发者:18B 激活参数降低的是单步计算负担,并不等于只需保存 18B 参数。自部署仍需容纳完整权重,并为 KV Cache、运行时缓冲和并行通信预留资源。
总结
GLM-5.3-Flash 兼顾性能与推理成本的关键,是把总容量和每次调用量拆开:320B 专家池承担能力覆盖,18B 激活参数控制单步计算,再以混合注意力、IndexPool、45 层结构和 mHC 压低长上下文成本。它不是把一个 320B 稠密模型简单量化,而是从路由、注意力到服务系统共同围绕效率重新设计。实际选型时,建议用自身业务数据同时记录任务成功率、总 Token、首字延迟、生成速度、显存占用和人工接管次数,避免只依据总参数或单项跑分做判断。
事件或资料日期:2026 年 8 月 26 日。
来源:智谱官方:GLM-5.3-Flash 产品与架构说明;Z.ai 官方 Hugging Face 模型卡;2026 年 8 月 27 日公开报道与规格整理。