2026年8月26日,GLM-5.3-Flash公开发布。最吸引眼球的变化之一,是网络深度由早期GLM架构常见的92层缩减为45层。但这并不是把原模型机械删掉一半层数,而是伴随参数规模、专家路由、注意力机制和残差连接的整体重构。因此,判断它对推理时延和复杂任务能力的影响,不能只看“少了47层”。
45层首先减少了串行计算路径
Transformer推理具有明显的逐层依赖:后一层必须等待前一层完成。层数从92降至45,理论上能够显著缩短单个Token穿过网络的串行路径,减少层归一化、注意力、专家路由及通信同步的执行次数。这对解码阶段尤其重要,因为模型需要逐Token重复执行整个网络,任何单层开销都会随输出长度不断累积。
不过,层数减少约一半,并不意味着首字延迟或每Token时延必然降低约一半。GLM-5.3-Flash是320B总参数、每Token激活18B参数的混合专家模型,实际速度还取决于专家并行、显存带宽、跨卡通信、批处理规模、量化精度以及推理框架。如果部署中的主要瓶颈是专家权重读取或设备通信,减层带来的收益可能低于纸面比例。
真正影响长上下文时延的是混合注意力
公开配置显示,GLM-5.3-Flash采用45层骨干,其中包含34个KDA线性注意力层和11个MLA稀疏注意力层。线性注意力适合用递归状态处理连续上下文,避免每一步都对全部历史Token执行完整注意力;稀疏注意力则负责从长上下文中检索更关键的信息。两者组合的意义,是把“快速处理”与“全局召回”分配给不同层,而不是单纯依靠较浅网络提速。
因此,在短对话中,45层主要减少串行执行和算子启动开销;在长文档、代码仓库或长时间Agent轨迹中,注意力结构与KV缓存策略可能比层数本身更关键。官方资料称,这一架构面向百万Token上下文重新设计,目标是在保留精确长上下文能力的同时降低服务成本。该说法说明性能提升来自系统性改造,不能全部归功于“压缩层数”。
复杂任务能力为何没有必然随深度下降
网络更深通常意味着更多连续非线性变换,但层数并不是能力的唯一来源。GLM-5.3-Flash每个Token只激活部分专家,不同专家可以形成更细的功能分工;mHC流形约束超连接则通过多路残差状态改善信息流动与扩展效率。换句话说,新架构尝试让单层承载更多有效计算,并降低传统深层网络中的信息衰减和优化困难。
公开评测亦没有显示其复杂任务能力因45层而整体坍塌。官方模型卡称其在多项基准和实际工作负载上超过GLM-5.2,并强化了编程、工具调用及原生多模态能力。但这些成绩主要属于发布方评测,测试框架、上下文管理、推理预算和采样参数都会影响结果,不应直接等同于所有业务场景中的稳定表现。
较浅网络仍可能存在边界。在需要极长推理链、精细符号演算或多轮自我修正的任务上,如果训练没有把原本分散于更多层中的计算过程迁移到专家、残差通道和注意力模块,能力就可能受损。当前公开资料只能证明整体设计具有竞争力,尚不能单独量化“减少47层”对某一类复杂任务贡献了多少正向或负向变化。
部署评估不能只比较模型层数
- 测试首Token时延:分别使用短提示词和长提示词,区分预填充阶段与解码阶段的收益。
- 记录每Token延迟:在相同硬件、并发量、输出长度和精度下比较,避免被服务端排队或缓存命中干扰。
- 检查长上下文召回:使用代码依赖定位、跨文档问答和多步工具调用,而不是只看普通聊天速度。
- 评估专家通信:观察显存带宽、跨卡流量和专家负载是否均衡,确认45层优势有没有被MoE通信抵消。
- 复测复杂任务:采用多次运行和固定评测协议,不能仅依据发布方单次基准得分下结论。
总结
GLM-5.3-Flash由92层缩减到45层,最直接的潜在收益是缩短串行计算链,降低逐Token重复执行的固定开销;在长上下文场景中,混合线性与稀疏注意力还可能进一步减少注意力计算和缓存压力。复杂任务能力没有必然随层数同步下降,因为MoE专家、mHC连接、多模态预训练及后训练共同补偿了网络深度。但现有公开信息不足以把实际时延提升或能力变化精确归因于减层,最终仍应以同硬件、同框架、同任务的端到端测试为准。
事件及资料日期:GLM-5.3-Flash于2026年8月26日发布;Z.ai官方模型配置公开了45层架构及相关参数,见官方配置文件[1];官方模型资料介绍了320B总参数、18B激活参数、混合注意力和多模态设计,见官方模型卡镜像[2];2026年8月26日,机器学习研究者Sebastian Raschka对34层KDA、11层MLA/DSA及mHC结构进行了独立拆解,见架构分析[3]。