摘要:Qwen3.8-2.4T-A95B以2.4万亿总参数、每Token约950亿激活构建旗舰级开放模型。本文拆解512专家路由、DeltaNet与全注意力混合架构、长上下文状态、FP8机架级部署及企业采用边界。
## 摘要
Qwen3.8-2.4T-A95B 是 Qwen 于 2026 年 8 月开放权重的旗舰级文本模型:总参数量 2.4T,但每个 token 仅激活约 95B 参数。它并非简单地把稠密 Transformer 放大,而是同时采用细粒度 MoE、Gated DeltaNet 线性注意力与 GQA 全注意力混合骨干、原生 262,144 token 上下文以及多步 MTP 训练。本文依据 Qwen 官方模型卡,并交叉核对 NVIDIA、vLLM 与 SGLang 的首日部署资料,解释参数规模、专家路由、长上下文状态和 FP8/GB300 部署的实际含义;同时严格区分厂商公布的基准结果与可独立复核的架构、权重和运行事实,最后给出企业选型与验证建议。
一、先读懂名字:2.4T 不等于每次推理都算 2.4T
“2.4T-A95B”中的 2.4T 是模型全部参数容量,A95B 表示处理每个 token 时约有 95B 参数参与计算。两者之比约为 4%,这正是稀疏 MoE 的价值:大量专家共同形成很高的知识容量,但路由器只为当前 token 选择少量专家执行。因此,单 token 的主要算术量更接近百亿级激活模型,而不是 2.4T 稠密模型。
不过,“计算接近 95B”不能被误读成“部署成本等同于 95B 稠密模型”。推理节点仍需保存或分片全部 2.4T 权重;专家选择还会产生 token dispatch、跨卡 all-to-all、负载均衡和尾延迟问题。以纯权重粗算,BF16 的 2.4T 参数约需 4.8 TB,FP8 约需 2.4 TB,尚未包含量化元数据、运行时工作区、激活、全注意力 KV cache、DeltaNet 状态及冗余。也就是说,MoE 显著降低计算量,却没有同比消除权重容量和互连压力。
官方模型卡给出的骨干宽度为 8192、共 92 层,布局为 23 组重复单元:每组先运行三次“Gated DeltaNet → MoE”,再运行一次“Gated Attention → MoE”。换算后是 69 层线性注意力与 23 层全注意力,比例为 3:1。模型还训练了多步 Multi-Token Prediction(MTP)头,可供支持它的推理引擎做投机解码。
二、512 个路由专家:容量、激活量与通信的三角关系
每个 MoE 层包含 512 个路由专家,并采用 top-10 路由,同时还有 1 个共享专家;专家中间维度为 2048。共享专家对所有 token 提供通用变换,路由专家则由学习得到的门控分数选出。细粒度设计把少数大专家拆成更多小专家,使模型能形成更细的功能分工,也让每次激活的专家组合更丰富。
一次前向过程中,路由大致包含四步:计算 token 对各专家的门控分数;选择排名最高的 10 个路由专家;把 token 表示发送到持有相应专家权重的设备;汇总专家输出并与共享专家路径融合。训练时还需避免少数热门专家过载;推理时,即使平均分布均衡,某批请求的瞬时偏斜仍可能令某张卡成为短板。
这解释了为什么专家并行(EP)和高速互连对该模型特别重要。把 512 个专家分散到大量 GPU 后,每层都可能交换 token。若跨节点网络带宽、拓扑感知调度或 dispatch/combine 内核不足,节省下来的矩阵乘计算会被通信抵消。vLLM 公布的实现会组合数据并行、注意力张量并行与专家并行;SGLang 则指出 prefill 与 decode 的最优切分不同,因而采用预填充—解码分离。它们说明的不是某个万能启动参数,而是一个工程原则:MoE 部署必须按请求长度、并发量和互连拓扑联合设计。
三、混合注意力与 DeltaNet:长上下文为何不只靠扩窗
传统全注意力在 prefill 阶段随序列长度呈平方级计算趋势,解码时每层还要持续保存并读取增长的 KV cache。Qwen3.8 将四分之三的注意力层替换为 Gated DeltaNet(GDN)线性注意力:它以固定大小的循环状态压缩历史,并结合门控 Delta Rule 与因果卷积更新状态。SGLang 对实现的描述显示,每个请求实际上同时维护三类状态:23 个全注意力层的 KV cache、69 个 GDN 层的循环状态,以及 GDN 的卷积窗口。
因此,“线性注意力”并不意味着模型没有状态,也不意味着任意长度输入都免费。它的关键收益是 GDN 层的状态大小不随上下文线性增长,序列计算可按 O(N) 扩展;每隔三层插入一个 GQA 全注意力层,则保留 token 间直接、全局交互的通道。官方配置中,全注意力使用 64 个查询头、4 个 KV 头,属于分组查询注意力,进一步压缩 KV 成本。
官方模型卡标注原生上下文为 262,144 token,可扩展至 1,010,000 token。这里应区分“支持窗口”和“业务有效窗口”:百万 token 能装入,不代表模型能无损找回每个细节,也不代表延迟和费用可接受。长输入仍要做 prefill,全注意力层仍持有 KV,检索质量还受文档结构、干扰信息和任务提示影响。企业应分别测量首 token 延迟、长上下文召回、跨文档推理、状态迁移开销和并发退化,而不是只记录最大可提交 token 数。
混合状态也给推理框架带来新难题。例如 MTP 一次验证多个草稿 token,但 GDN 状态会原地更新;若只有部分草稿被接受,引擎必须把状态恢复到正确位置。SGLang 披露其使用 ReplaySSM 记录并重放被接受前缀,并让前缀缓存、投机解码和 prefill/decode 分离同时兼容。这类能力决定了“能加载模型”与“能稳定高效服务模型”之间的距离。
四、上下文、推理模式与开放权重版本的边界
开放权重的 Qwen3.8-2.4T-A95B 是纯文本、强制 thinking 的后训练模型;官方模型卡明确写明不能关闭思考,输出包含推理段与最终答案。它支持 reasoning_effort 调节推理深度,档位为 low、medium 与 xhigh(默认),并默认保留历史思考上下文。企业若通过兼容 OpenAI 的网关接入,不能假设所有框架都以相同字段、相同计费方式处理思考 token,应实际核对模板、解析器和 usage 返回。
还需避免把开放权重模型与 Qwen3.8-Max 服务画等号。Qwen 官方称,Qwen3.8-Max 基于该开放模型,但增加了视觉输入、可关闭思考、默认 1M 上下文和官方内置工具等功能。官方模型卡中的大型横向表格标题与列名评测的是 Qwen3.8-Max,而不是在任意自建环境下直接运行开放 checkpoint 的承诺值。
五、怎样阅读基准:官方成绩不是独立结论
Qwen 公布的 Qwen3.8-Max 成绩包括 Terminal Bench 2.1 为 86.6、SWE-bench Pro 为 67.7、PaperBench 为 93.0、IFBench 为 82.8、MRCR v2 256K(8-needle)为 92.9。它们可用于理解官方定位:重点是编码代理、专业工作、工具使用和长程任务,而非仅追求短问答分数。
但这些数字必须标注为官方评测结果。模型卡脚注显示,不同模型可能使用不同 agent harness;Qwen 系列与外部模型在部分项目上分别运行于 OpenCode、Claude Code、Codex 或 Qwen-Agent;若干 Qwen 基准属于内部测试;评测还有特定超时、上下文、采样和多次平均设置。框架、工具权限、推理预算与失败重试都会显著改变 agent benchmark。因而这张表不能被视为统一条件下的第三方排行榜,更不能直接推导企业内部任务的成功率。
相对而言,以下属于更容易独立核验的事实:Hugging Face 仓库公开了配置与权重;配置可验证 92 层、512 路由专家、top-10 加共享专家、69/23 混合层和 262K 原生窗口;vLLM、SGLang 均已发布首日支持及可运行配方。第三方团队公开的性能数据仍是其测试结果,并非中立实验室结论,但至少提供了更具体的硬件、精度、输入输出长度和并行方案,复现价值高于脱离环境的单一分数。
六、FP8 与 GB300 NVL72:真正瓶颈是系统协同
Qwen 同时发布 BF16 与官方 FP8 checkpoint。FP8 模型卡说明其采用 block size 128 的细粒度 FP8 量化,并宣称指标与原模型“近乎一致”。这是一项官方质量声明,企业仍应在自己的语言、代码、JSON 约束和长上下文集合上做回归。FP8 的直接收益是把权重存储大致减半,并降低权重读取带宽;但对于 2.4T 参数,它仍是 TB 级模型,需要机架级分片。
NVIDIA 公布 Qwen3.8-2.4T-A95B 在 GB300 NVL72 上的 Day-0 TensorRT-LLM/FP8 结果:峰值超过 4,000 token/s/GPU,并超过 350 token/s/user,且称未做额外模型调优。GB300 NVL72 将 72 张 Blackwell Ultra GPU 纳入一个 NVLink 域,NVIDIA 标称聚合互连带宽 130 TB/s;这正适合高频专家 all-to-all。需要强调,这些是 NVIDIA 在特定平台、软件栈与负载点上的厂商数据,吞吐峰值和单用户速度通常位于 Pareto 曲线的不同端点,不能相加,也不能直接套用到其他输入长度、并发或网络环境。
SGLang 给出了更细的 8K 输入/1K 输出测试:FP8 的 prefill/decode 分离峰值为 3,532 token/s/GPU、约 30 token/s/user;低延迟聚合端点为 220 token/s/GPU、362 token/s/user。其 NVFP4 配置峰值达到 5,126 token/s/GPU,但 NVFP4 权重由 RadixArk 等生态团队提供,并非 Qwen 官方 FP8 checkpoint。两组数据共同表明,生产优化不能只选“最快内核”:prefill 偏计算吞吐,decode 偏权重带宽与低延迟,二者可能需要不同 GPU 数量和并行拓扑。
部署时建议至少记录以下条件:checkpoint 与量化格式、引擎和提交版本、GPU 数及节点拓扑、TP/PP/EP/DP 切分、输入/输出长度、并发、首 token 延迟、每输出 token 延迟、吞吐统计口径、前缀缓存命中率及 MTP 接受长度。缺少这些元数据,“每秒多少 token”几乎没有跨环境比较意义。
七、从 checkpoint 到在线服务:一条可执行的部署路径
第一阶段是权重与兼容性验证。下载时固定仓库 revision,记录配置、分词器和 chat template 的哈希;在单个可运行分片组上先验证短文本生成、长输入、工具调用格式、思考解析以及流式输出。不要把“服务进程启动成功”当成兼容性完成:混合架构要求引擎正确处理 GDN 状态、全注意力 KV、因果卷积窗口与 MTP 草稿状态,任何一处版本不匹配都可能表现为静默质量下降,而不一定立即报错。
第二阶段是容量基线。分别建立 prefill 密集、decode 密集和混合流量三组压测:例如长文档短回答、短提示长推理,以及企业真实长度分布。对每组绘制并发—TTFT—TPOT—吞吐的 Pareto 曲线,并观察 P50、P95、P99,而不是只取暖机后的峰值。MoE 还应监控专家负载分布、dispatch/combine 通信时间、跨节点流量及最慢 rank;长上下文则要监控 KV 与循环状态占用、缓存淘汰和请求排队。
第三阶段才是拓扑优化。FP8 通常是官方支持与资源占用之间较稳妥的起点;在 GB300 NVL72 这类大 NVLink 域中,可优先探索宽专家并行和 prefill/decode 分离。若硬件由多个互连较弱的节点组成,应让专家映射尽可能局部化,并用实测判断跨节点 EP 是否得不偿失。MTP 能减少解码步骤,但收益取决于草稿接受率;接受率低时,额外验证和状态恢复反而可能增加复杂度。因此它应作为可开关的优化项,而非默认视为固定倍数加速。
最后是生产保护。为超长请求设置独立队列、并发上限与 token 预算,避免少数百万级上下文请求阻塞普通流量;按 prompt、thinking、answer 三部分观测成本;为失败重试设置幂等键,防止代理工具重复执行。模型服务、调度器和业务代理应分层发布,使量化或内核升级可以灰度回滚,而不必同时更换业务逻辑。
八、企业采用建议:先证明业务增益,再决定是否自建
第一,按工作负载分层选型。 Qwen3.8-2.4T-A95B 更适合代码仓库级代理、长文档研究、多工具工作流和高价值专业任务。客服分类、字段抽取、短摘要等稳定任务,较小模型往往有更好的总拥有成本。可建立路由层:默认走中小模型,只有复杂度、风险或上下文达到阈值时升级到 2.4T 模型。
第二,用真实流程而非学术题做验收。 评测集应覆盖任务完成率、工具参数正确率、引用可追溯性、长上下文证据召回、代码测试通过率、幻觉、敏感数据处理和人工接管率。对强制 thinking 模型还要分别统计输入、思考与最终输出 token,并比较 low、medium、xhigh 三档的边际收益。
第三,先 API 验证,再考虑私有化。 官方也建议希望免运维的用户使用托管 API。若数据主权、稳定容量或深度定制要求必须自建,才进入容量规划;同时比较 SGLang、vLLM、NVIDIA Dynamo/NIM 等路径。试点阶段应固定版本和模板,防止引擎升级导致路由、工具调用或思考解析行为漂移。
第四,把互连和运维视为模型的一部分。 采购 GPU 不能只按 FP8 权重容量相除。还需预留运行时空间与故障冗余,评估跨节点通信、专家热点、长请求抢占、prefix cache、PD 分离、监控和滚动升级。对于现有集群,先做小规模可复现实验;若必须跨低速网络承载大量专家通信,模型即使“放得下”,服务质量也可能不可用。
第五,建立可审计的质量与安全门禁。 开放权重提供了本地控制权,但不自动解决许可证审查、数据治理、提示注入、工具越权与输出责任。对代理任务应采用最小权限工具、命令沙箱、人工审批、证据引用和全链路日志;领域微调或 LoRA 之后要重新执行通用能力、安全性和量化回归测试。
九、评估设计:把“模型强”转化为可采购的指标
一个可操作的企业评测至少包含四层。第一层是离线答案质量,用固定样本比较准确性、完整性、格式遵循和引用真实性;第二层是代理轨迹质量,检查计划是否合理、工具是否选对、错误后能否恢复,以及最终是否真正完成任务;第三层是系统指标,包括 TTFT、TPOT、每请求 GPU 秒、峰值显存和失败率;第四层是经济指标,以一次成功任务的总成本衡量,而非仅比较每百万 token 标价。
测试时需要锁定模型版本、引擎、模板、采样参数和 reasoning effort,并至少重复运行高方差任务。对长上下文不能只做“针在草堆”检索,还要加入跨段综合、冲突证据判断、时间顺序恢复和无答案拒答。对量化版本则采用配对样本比较 BF16 与 FP8:即使平均分接近,也要检查代码编译失败、数值推理、少数语言和结构化输出这些尾部风险。
上线门槛可以写成业务化规则,例如“任务成功率提升不少于若干百分点,同时 P95 延迟和单次成功成本不超过预算”;若模型只在极少数复杂任务胜出,就通过模型路由把这部分流量导入旗舰模型。这样,2.4T 容量成为按需调用的能力池,而不是所有请求都承担的固定税负。
十、结论
Qwen3.8-2.4T-A95B 的技术意义不只是“参数更多”,而是把 2.4T 容量压到每 token 约 95B 激活,并通过 512 专家细粒度路由、3:1 的 DeltaNet/全注意力混合和 MTP,将旗舰级开放模型推向长上下文代理场景。与此同时,它也是典型的数据中心模型:全量权重、MoE 通信、混合状态管理与机架级并行决定了实际成本。
对企业而言,最稳妥的判断不是追逐某个榜单或峰值吞吐,而是分清三类证据:Qwen 的模型规格与官方评测、硬件/框架厂商在明确条件下的性能报告、以及自身业务环境中的独立验收。只有第三类证据能最终回答:更大的模型,是否真的带来了足以覆盖基础设施和治理成本的任务成功率提升。
参考资料
- Qwen Team, Qwen/Qwen3.8-2.4T-A95B Model Card, Hugging Face, 2026-08-12:https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
- Qwen Team, Qwen/Qwen3.8-2.4T-A95B-FP8 Model Card, Hugging Face, 2026-08:https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B-FP8
- NVIDIA Technical Blog, Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72, 2026-08-12:https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
- vLLM Team, Day 0 Support for Qwen3.8-2.4T-A95B on vLLM, 2026-08-12:https://vllm.ai/blog/2026-08-12-qwen3.8
- SGLang / LMSYS, SGLang and Miles Add Day-0 Support for Qwen3.8, 2026-08-12:https://www.lmsys.org/blog/2026-08-12-qwen3-8-day0-support