摘要:Qwen团队在8月26日公开Qwen3.8-Flash-Next时,最醒目的数字很容易让人产生困惑:主模型125B参数,额外还有51B N-gram Embedding,但每个Token只激活约6B参数。把几组数字相加,整个系统的参数...

Qwen团队在8月26日公开Qwen3.8-Flash-Next时,最醒目的数字很容易让人产生困惑:主模型125B参数,额外还有51B N-gram Embedding,但每个Token只激活约6B参数。把几组数字相加,整个系统的参数资产已经超过176B;如果再考虑4B MTP参数,规模还会更大。可真正参与每个Token主要矩阵乘法预算的,只是其中很小一部分。传统“参数越多,推理就越贵”的直觉正在失效,模型规模、激活参数、内存容量、内存带宽和实际FLOPs必须分开看。
Qwen官方把Flash-Next定位成Qwen4架构的预览。它并不是简单把上一代MoE专家数量调大,而是同时修改Attention、Residual、Embedding和Optimizer四个层面。官方称,与Qwen3.7-Plus相比,新架构训练成本约为后者的九分之一,同时在编码和办公任务上取得更好的表现。这个“1/9”来自厂商自己的训练统计,不能直接转化为所有部署者都能获得相同比例的成本下降,但架构方向本身非常值得分析。
6B激活参数为什么不等于“这是一个6B模型”
Flash-Next的主干是MoE。官方模型说明给出了512个专家,每个Token路由到10个Routed Experts,加上1个Shared Expert。MoE的优势在于模型可以拥有很大的“知识容量”,却只让少量专家参与当前Token的计算。一个涉及代码的Token可能偏向某些专家,数学或自然语言又可能走另一组专家。总参数决定可用容量上限,激活参数更接近每一步矩阵计算成本。
但“6B Active”绝不能简单理解成“推理成本和普通6B Dense一样”。第一,所有专家权重仍然需要存放在某个地方,单机部署首先要解决总权重容量问题。第二,不同Token会访问不同专家,MoE对内存带宽和跨GPU通信提出更复杂要求;在专家并行场景中,Token需要通过All-to-All发到持有目标专家的设备。第三,模型还有Attention、Embedding、路由器、MTP和各种固定层。激活参数是分析计算量的重要指标,却不是完整的内存或系统成本指标。
这也是为什么本地部署社区看到“6B激活”会很兴奋,又很快回到“176B权重放哪里”的现实问题。量化可以降低容量,但只要整个专家集合仍然需要常驻内存,128GB统一内存是否够用就要结合量化位宽、KV Cache和51B N-gram表一起计算。Flash-Next很适合说明一个新常识:以后讨论“大模型有多大”,至少要同时问总参数、激活参数和常驻内存。
GDN + QSA:长上下文开始从“完整注意力”转向分工架构
Flash-Next的Attention采用Gated DeltaNet(GDN)与Qwen Sparse Attention(QSA)混合。官方给出的层布局是:每一组里先有多层GDN+MoE,再穿插一层QSA+MoE。GDN属于线性/状态型注意力路线,核心思路是把历史压缩成有限状态,不再让每个新Token和所有历史Token逐一做完整Attention。这类结构在长上下文里可以把复杂度控制得更稳定。
线性Attention的代价通常是信息压缩。完整Attention允许模型随时回看很久之前的某个细节,压缩状态则可能损失精细检索能力。因此Flash-Next没有完全抛弃Attention,而是使用QSA定期做稀疏检索。QSA通过一个轻量Indexer在micro-block粒度选择重要历史,只对少量候选块执行高成本Attention。官方模型说明给出的Budget为512 blocks或2048 tokens。
这种混合设计很像给模型安排两种记忆:GDN负责低成本维护连续历史状态,QSA负责在需要时回到长上下文中检索关键片段。它比“所有层都做全量Attention”节省大量长序列成本,也避免完全依赖压缩状态。Qwen官方称其原生上下文为262,144 tokens,并可用YaRN扩展到100万tokens。长上下文能力最终仍要看真实任务中的检索和推理质量,但架构已经明确朝“状态压缩+稀疏回看”方向发展。

51B N-gram Embedding为什么值得单独看
这次最有意思的结构之一是51B N-gram Embedding。普通语言模型的Embedding通常根据当前Token ID查表,而N-gram Embedding把局部上下文组合成bigram或trigram索引,再去一个很大的Embedding表里查向量。它相当于给模型增加一个巨大的局部模式记忆库:常见词组、代码片段和局部序列可以直接通过查表得到额外表示,而不必全部依赖Transformer层计算出来。
关键在于,查表和大规模矩阵乘法的成本结构不同。51B参数看起来非常大,却不是每个Token都要进行51B规模的乘加运算。官方说明称这些参数按确定性地址访问,因此不计入每Token主要矩阵乘法预算;更进一步,这张大表可以卸载到Host Memory,通过异步Prefetch与GPU上的模型计算重叠。
这是一种很“系统工程”的扩容方法。过去提高模型容量往往意味着堆更多层或更宽的矩阵,直接增加FLOPs。N-gram Embedding则把一部分容量变成内存查表问题,再利用CPU内存容量和预取隐藏延迟。模型架构因此开始主动利用异构内存层次,而不是假设所有参数都必须以同样方式放在GPU HBM里。
当然,这种设计也把挑战转移到了内存系统。如果N-gram访问具有随机性,Host Memory带宽、PCIe/CXL传输和Prefetch命中率都会影响性能。推理框架需要知道下一步要访问哪些表项,并尽量提前搬运。模型团队和系统团队的边界再次被拉近。
Gated Residual为什么要把残差流扩成4条
Transformer的Residual Stream通常是一条主干,所有层持续往里面写信息。模型越深、结构越复杂,不同类型信息容易互相干扰。Flash-Next引入Gated Residual,把残差状态扩展成4条分支,并通过动态Gate决定某一层读取和写入哪些分支。可以把它理解成给网络增加几条并行的信息通道,让不同层不必把所有表示都挤在同一条残差高速公路上。
官方认为这一结构有助于跨层信息流和训练稳定性。更值得注意的是,残差状态可以采用FP8存储,从而降低访存开销。现在大模型的性能瓶颈越来越多地出现在Memory Traffic而不是纯算力上,连Residual这种过去很少被拿出来讨论的结构,也开始被纳入带宽优化。
这一点和近期推理芯片的趋势相互呼应:模型设计者已经不只考虑“这个结构表达能力更强吗”,还会考虑“它在HBM里怎么读写”。Transformer架构进入成熟期以后,下一轮创新很可能越来越多发生在算法与硬件成本之间的接缝上。
Muon优化器说明训练效率也在重新设计
Flash-Next的第四个重点是Muon Optimizer。官方称针对正交化精度、Muon与AdamW之间的参数分工、融合参数拆分进行了重新设计,并为新架构重新拟合Scaling Law。大模型训练成本并不只由参数量决定,优化器状态、数值稳定性、收敛速度和训练Token数量都会决定最终账单。
如果一个架构能在更少训练计算下达到类似能力,商业价值非常直接。Qwen称Flash-Next训练成本约为Qwen3.7-Plus的1/9,这一结果同时受模型结构、激活参数、训练数据、优化器和训练目标影响,不能简单归因于某一个模块。更合理的理解是,Qwen团队正在把“训练效率”本身作为架构目标,而不是模型做完后再做量化降本。
Benchmark表现应该怎么读
官方Base模型比较中,Flash-Next-Base在14项列出的基准里有8项取得最佳结果,例如MMLU-Pro、SuperGPQA、BBH、GSM8K、EvalPlus、SWEBench-Pretrain、MGSM和MMMLU,同时在部分任务上接近397B总参数、17B激活参数的Qwen3.7-Plus-Base。后训练版本在SWE-bench Pro、CoWorkBench等Agent和办公任务上也给出了很强的官方成绩。
这些数字证明架构具备潜力,但仍应保持测试边界。Benchmark受到Prompt、Tool Harness、采样参数和评测实现影响,尤其Agentic Coding和Office任务对外部执行框架非常敏感。对企业来说,更重要的是拿自己的代码库、文档、长会话和工具调用做测试,再结合实际API价格或自部署成本计算单位任务费用。
对本地模型和企业部署的实际影响
Flash-Next给本地部署者带来的启发,不是“176B模型突然能像6B一样跑”,而是未来模型会越来越主动把计算成本和容量成本拆开。专家只激活一部分,N-gram表可以放Host Memory,Attention只看重要块,Residual也针对低精度带宽优化。模型不再是一整块均匀的参数,而是由不同速度、不同访问规律、不同存储位置的组件构成。
对云端服务商,这要求推理框架支持专家并行、稀疏Attention、异构内存和预取。对PC端统一内存设备,它可能带来新的机会:大容量内存允许装下完整模型,但最终速度仍取决于带宽和专家访问模式。对AI芯片厂商,这类模型也会推动硬件从单纯追求Dense GEMM峰值,转向更强的稀疏计算、内存容量、低延迟互联和随机访问能力。
Qwen3.8-Flash-Next最值得关注的地方,正是这些数字背后的设计哲学。125B、51B和6B同时成立,并不矛盾。模型行业正在学会用不同种类的参数换取不同种类的能力和成本。以后问一个模型“多大”,恐怕再也不能只看参数表第一行。
参考资料
- Qwen3.8-Flash-Next 官方技术博客
https://qwen.ai/blog?id=qwen3.8-flash-next - Qwen3.8-Flash-Next GitHub
https://github.com/QwenLM/Qwen3.8-Flash-Next - Qwen3.8-Flash-Next Hugging Face README
https://huggingface.co/Qwen/Qwen3.8-Flash-Next - Horizon Summary 2026-08-27
https://thysrael.github.io/Horizon/2026/08/27/summary-zh.html