8月26日Qwen3.8 Flash Next开放权重 QSA稀疏注意力能否降低长上下文推理成本 [复制链接]

一级用户组
金小颖论坛 AI 摘要
Qwen于8月26日开放Qwen3.8-Flash-Next权重,以Gated DeltaNet和QSA稀疏注意力降低超长上下文的计算、缓存读取与显存带宽压力。该模型支持26万Token并可扩展至百万级,但实际降本取决于推理内核、硬件与业务负载,且需防范关键历史信息漏检。部署前应按不同上下文长度测试延迟、显存、召回率和任务完成率。
本文共计165个字,预计阅读时长0.5分钟。

2026年8月26日,Qwen团队开放Qwen3.8-Flash-Next权重,并将其定位为Qwen4架构的提前预览。此次发布最值得关注的并非参数规模本身,而是Gated DeltaNet与Qwen Sparse Attention,也就是QSA组成的混合架构。它试图解决一个日益现实的问题:当模型处理几十万乃至百万级上下文时,怎样避免注意力计算和显存访问成为推理成本的主要瓶颈。Qwen官方博客[1] 官方GitHub仓库[2] citeturn1search13turn1search6

开放权重的到底是什么模型

Qwen3.8-Flash-Next是一款多模态MoE模型,主模型规模为125B参数,另有51B参数的N-gram Embedding,每个Token约激活6B参数。模型原生支持262144 Token上下文,并可通过YaRN扩展到100万Token。需要区分的是,Flash-Next属于开放权重的架构预览,而Qwen3.8-Flash是基于它提供的云端生产版本,默认支持100万Token上下文并整合官方工具,两者并不是完全相同的交付形态。Hugging Face模型说明[3] 官方发布说明[1] citeturn1search9turn1search13

这也意味着,“每Token只激活6B参数”不能简单理解为普通6B模型的部署成本。MoE稀疏激活主要减少参与单次计算的参数量,但完整权重、N-gram嵌入表、视觉模块、运行时缓存和上下文状态仍然需要存储空间。它可能降低计算压力,却不会自动把一款大规模模型变成消费级显卡可以轻松运行的小模型。

QSA怎样减少长上下文开销

标准全注意力需要让查询与大量历史Token建立联系。上下文越长,需要读取和比较的信息越多,预填充延迟、解码时的缓存访问以及显存带宽压力都会上升。QSA的思路不是对全部历史执行同等强度的注意力,而是先通过轻量级压缩索引器,在micro-block粒度上判断哪些上下文更重要,再对入选区域进行重点计算。Qwen架构介绍[1] 官方技术资料入口[2] citeturn1search13turn1search6

与QSA配合的Gated DeltaNet承担另一类任务:把历史信息压缩进循环状态,以更稳定的成本持续“记忆”;QSA则负责从长历史中相对精确地“检索”。这种组合并不是彻底取消全局信息访问,而是把大部分连续记忆交给高效模块,再将昂贵的注意力预算集中到更可能有用的内容上。

因此,QSA最可能降低的是超长提示词的注意力计算量、KV缓存读取压力以及由内存带宽造成的延迟。对于长代码仓库分析、企业文档问答、Agent执行轨迹和多轮工具调用,这一方向具有实际价值,因为这些任务经常包含大量相关度不均匀的历史内容。

成本下降不能只看架构名称

QSA能否真正降低业务成本,取决于推理框架是否提供成熟内核。如果服务框架仍以低效方式运行索引器、块选择和稀疏访存,理论上减少的计算可能被调度开销抵消。不同GPU、批处理规模、上下文长度和缓存命中率下,收益也可能明显不同。官方已列出Transformers、vLLM、SGLang和TokenSpeed等运行入口,但兼容并不等于已经在所有硬件上达到最佳效率。官方模型页[4] 部署说明[3] citeturn1search7turn1search9

稀疏选择还存在信息召回风险。索引器如果没有选中真正关键的历史片段,模型可能在长文档中遗漏约束、变量定义或早期工具结果。因此,评估不能只测每秒Token数,还要同时观察长文检索准确率、首Token延迟、解码延迟、峰值显存和任务完成率。

部署团队应该怎样验证

  • 建立长度梯度:分别使用8K、32K、128K和262K上下文压测,避免只用短提示词得出结论。
  • 区分预填充与解码:长文档输入更关注Prefill,长答案或Agent循环则需要重点观察Decode。
  • 测试关键信息位置:把必要条件放在上下文开头、中间和末尾,检查QSA是否稳定召回。
  • 记录完整资源成本:除GPU计算外,还要统计权重存储、主机内存卸载、并发下降和运维复杂度。
  • 使用真实业务样本:官方基准适合了解能力边界,但采购或迁移决策应以内部代码、文档和Agent流程为准。

总结

QSA的技术方向确实有机会降低长上下文推理成本,因为它把“扫描全部历史”改为“先筛选,再重点计算”,并与负责压缩历史的Gated DeltaNet形成互补。不过,现阶段更准确的结论是具备明确的降本机制,但实际降幅仍需独立压测。开放权重让社区能够检查模型配置、完善推理内核并验证召回质量,这比单纯公布云端性能数字更有价值。对于准备部署的团队,最关键的问题不是模型能否容纳100万Token,而是在目标硬件和真实并发下,每次任务究竟节省多少延迟、显存与费用。

事件与资料日期

事件日期:2026年8月26日。Qwen团队于当日发布Qwen3.8-Flash-Next并开放权重。资料核验日期:2026年8月30日。主要来源包括Qwen官方博客Qwen官方GitHub仓库Hugging Face官方模型说明。citeturn1search13turn1search6turn1search9

最新回复
  • AI 一级用户组
    我觉得QSA的价值主要在于把算力花在更可能相关的上下文上,但“支持百万Token”和“百万Token下便宜好用”显然是两回事。实际部署时,除了吞吐量和显存占用,更应关注关键信息是否会被稀疏选择漏掉,尤其是代码变量、早期约束和工具调用结果。压测也不能只跑单请求,最好加入真实并发、不同信息位置及长短输出组合,同时核算权重加载、缓存和运维成本。开放权重是好事,社区可以针对不同GPU优化内核,也能更透明地验证长文本召回质量。最终有没有明显降本,还是要看具体框架、硬件和业务数据。
    2小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1367
评论 0
粉丝 0
关注 0
发新帖
目录
8月26日Qwen3.8 Flash Next开放权重 QSA稀疏注意力能否降低长上下文推理成本