摘要:SGLang v0.5.17为Kimi K3与MiniMax-H3提供day-0部署支持,推理框架、内核、缓存、并行策略和硬件适配正在成为模型商业化的主战场。
SGLang v0.5.17表面上是一次开源推理框架升级:194位贡献者合入582个PR,新增Kimi K3、MiniMax-H3等模型支持。但如果只把它理解为“兼容列表又多了两个名字”,就低估了这次发布的产业信号。
Kimi K3是一个总参数量2.8万亿、拥有896个专家、原生支持图像与100万token上下文的混合架构模型;MiniMax-H3则不是传统文本模型,而是能够在一次请求中联合生成视频和同步立体声音轨的扩散模型。两者在发布时即由SGLang提供可部署方案,并给出从数据中心Blackwell GPU、AMD加速卡到消费级RTX 5090的验证配置。这说明国产模型竞争正在跨过“模型能不能做出来”的阶段,进入“新模型能否当天跑起来、能否稳定服务、每张卡能承载多少业务”的系统工程阶段。
一、为什么Kimi K3会让传统推理栈失效
Kimi K3的难点并不只是规模大。它把多种新结构同时放进一套模型:93层注意力中,69层采用KDA(Kimi Delta Attention)线性注意力,24层采用MLA(Multi-head Latent Attention);MoE从K2.5的384个专家、每token激活8个,扩展为896个专家、激活16个;专家计算又不直接在完整隐藏维度中进行,而是在3584维潜在空间中路由和计算,即LatentMoE;此外还有Attention Residuals和MoonViT3d视觉塔。
MoE的价值是“总容量很大、单次只算少数专家”。K3拥有2.8万亿总参数,却不会在每个token上激活全部参数。但896选16仍会带来新的路由、专家权重搬运和跨卡通信问题。LatentMoE先把表示压缩到较低维潜在空间,再完成路由与专家计算,试图在扩大专家容量的同时控制激活开销。不过,它也意味着既有SwiGLU MoE内核、张量布局和通信假设不能直接套用,SGLang必须增加K3专用内核与SiTU激活路径。
KDA与MLA的混合则是100万token上下文能够落地的关键。传统注意力需要保存随序列增长的KV Cache,长上下文会迅速消耗显存。KDA属于线性注意力:它不保存每个历史token的完整KV,而是把历史压缩进固定大小、随token更新的循环状态,因此上下文越长,状态本身不会线性膨胀。MLA仍保留按token增长的压缩KV,以维持关键层的表达能力。两者交叉排列,是在长上下文成本和模型质量之间做系统级折中。
问题在于,两类状态的生命周期完全不同。MLA的KV写入后基本只追加、不修改,天然适合前缀缓存;KDA状态却会在每个token后原地覆盖。若多个请求共享同一段系统提示词,直接复用可变状态就可能相互污染。SGLang为此设计了copy-on-write、snapshot和donate三种状态移动:请求使用缓存检查点前先复制到私有槽位,计算后生成快照,再把可共享快照交回Radix Cache。检查点优先放在提示词分叉点和对齐的chunk边界,未命中时从最近检查点向前重放,而不是从头计算。
SGLang还需要同时管理两种尺度相差约三个数量级的内存单元。官方博客给出的TP=8示例中,一个请求覆盖69层KDA的状态约54MB,而覆盖24层MLA的单token KV约27KB。若预先划分两个固定池,短请求多时可能KDA池先满,超长请求多时又可能KV池先满。其统一内存方案让KDA状态和MLA KV从同一片空间的两端相向增长,使容量跟随真实流量变化,而不是依赖启动时猜测。
二、从“模型可运行”到“服务可盈利”的六层优化
第一层是原生MXFP4权重。K3以MXFP4 checkpoint发布,即用带共享尺度的微缩放4位格式存储权重。相对BF16,它显著降低2.8万亿参数的存储、加载和显存带宽压力。4位并不等于所有运算都以4位完成:实际执行可能把权重与更高精度激活组合,并依赖特定硬件内核完成反量化、矩阵乘和累加。产业价值在于,量化不再是部署方事后转换、再承担精度风险,而成为模型方与推理框架共同验证的交付格式。
第二层是DSpark推测解码。它让一个较小的draft模型一次提出一组候选token,再由K3并行验证;验证通过多个token,就能减少昂贵目标模型逐token前向的次数。SGLang披露,K3在单请求、未启用推测时经过内核优化约为113 token/s,加入专门训练的DSpark draft后约423 token/s。但该数字代表特定GB300级配置下的batch 1解码,不应外推为所有并发和所有硬件的普遍速度。
KDA又给推测解码增加了“状态回滚”难题:候选8个token,最终可能只接受前3个,但循环状态已经向前走了8步。ReplaySSM不为每一步复制整份KDA状态,而是保留约1KB的原始输入,在接受长度确定后重放已接受部分。官方数据称,draft窗口内存可由约512KB降至16KB,减少约32倍。其意义不仅是省显存,更是释放并发容量。
第三层是按阶段选择并行策略。长提示词的prefill计算密集,逐层张量并行会频繁AllReduce;SGLang把93层拆成流水线阶段,再把长prompt切成多个chunk,让不同阶段同时处理不同chunk,尽量用计算覆盖阶段间传输。解码阶段每次只生成少量token,更容易受通信延迟和KV容量约束,因此可采用TP,或用DCP按token位置切分MLA上下文。DCP让每张卡只保存约1/N的KV,再通过每层一次通信合并局部注意力结果。官方在K3方案中进一步采用prefill/decode分离:prefill节点使用深流水线,decode节点根据负载选TP或DCP,避免“一套并行参数兼顾所有阶段”的低效。
第四层是分层缓存HiCache。GPU显存是L1,主机内存可作为L2,冷前缀从显存淘汰后仍可留在主机内存,需要时再加载。v0.5.17修复并验证了DCP逻辑索引与每卡物理分片之间的映射,使K3的MLA缓存能够在DCP下安全地在GPU和主机之间迁移。对百万上下文而言,主机内存不是简单的“慢显存”,而是提高长前缀复用率、降低重新prefill概率的容量层。
第五层是量化权重上的LoRA。LoRA冻结庞大的基础权重,只训练低秩增量。SGLang与Miles展示了在原生MXFP4 checkpoint上进行LoRA强化学习、训练与rollout共用GPU的路径,官方案例中AIME-2024成绩在12小时运行后由43.3%提升至76.7%。这不是一个可普遍复现的业务承诺,却说明部署框架正在与后训练框架打通:企业未来购买的不是一份静态模型权重,而是一条“量化加载—推理采样—低成本微调—再次部署”的闭环。
第六层是API与工程交付。推理、工具调用、OpenAI兼容接口、Docker镜像和cookbook同时到位,才称得上day-0。真正的day-0不是仓库中出现一个模型类,而是客户能按经过验证的拓扑启动服务、进行压测并接入现有应用。
三、DWDP的1.92倍,应该怎样正确理解
v0.5.17还加入DWDP(Distributed Weight Data Parallelism),用于MoE的prefill。传统专家并行会把token通过All-to-All发送给对应专家,流量受路由分布和通信影响。DWDP反过来:通过NVLink P2P预取其他卡的专家权重,在本地计算全部所需专家,从而取消专家并行的token All-to-All。
发布说明给出两组结果:在4张B200、gpt-oss-120b、仅prefill测试中,当最大新token为32K、输入长度32K时,DWDP4相对DEP4达到1.92倍;在并发128、输入8K的饱和负载下为506K token/s对329K token/s,即1.54倍。
这组数据不能写成“所有MoE推理快1.92倍”。边界至少有四个:测试模型是gpt-oss-120b而非Kimi K3;测试阶段只有prefill,不包含decode和端到端排队;硬件是4张B200并依赖高速NVLink P2P;该功能在发布说明中被明确标注为early-development。DWDP本质上是用专家权重搬运换掉token分发,是否划算取决于专家规模、序列长度、并发、互联带宽和缓存命中。它更重要的意义,是推理框架开始根据具体拓扑动态选择“移动token还是移动权重”,而非把专家并行当作唯一答案。
四、多种硬件适配,改变国产模型的商业半径
K3的day-0路径已在NVIDIA GB300与AMD MI35x验证。GB300代表高端Blackwell机架级系统,适合把低延迟内核、MNNVL通信与大显存优势推到极致;MI35x验证则意味着模型不被单一CUDA硬件完全锁死,为云厂商和大型客户提供第二供应链选择。这里的“支持”不代表不同平台性能相等,而是模型结构、量化格式、通信后端和服务接口已具备可运行且经过测试的组合。
MiniMax-H3把硬件覆盖进一步向下延伸。SGLang-Diffusion原生支持文生视频与音频、首尾帧控制,以及图像、视频、音频参考条件;发布说明列出的验证拓扑包括B200上的TP2加Ulysses4、H100上的TP2加Ulysses2,以及两张RTX 5090通过逐层offload运行。cookbook还给出H200、MI300X、MI355X等配置。Ulysses属于序列并行,把视频token沿序列维度拆到多卡;TP拆模型张量;逐层offload则用主机内存换显存容量。两张32GB RTX 5090的方案还要求约384GB级主机内存,且速度不能与B200相提并论,但它把“必须进入顶级数据中心才能验证模型”变成了“工作室也可建立本地能力”。
由此看,国产大模型的竞争指标正在变化。第一,模型发布速度要与推理框架适配速度绑定;只有权重没有高效内核,参数越大,商业负担越重。第二,芯片竞争不再只是峰值算力,而是量化格式、注意力内核、集合通信、显存层级和框架适配的联合竞争。第三,生态壁垒将来自可复制的部署配方:同一模型如何跑在旗舰机架、AMD平台和消费卡上,决定它能覆盖多少客户。第四,推理系统会反向影响模型设计,KDA、LatentMoE、MXFP4必须与缓存、调度、并行和后训练共同设计。
SGLang v0.5.17真正值得关注的地方,因此不是多支持了两个国产模型,而是模型厂商、开源框架、芯片企业和部署团队正在同一天完成联合交付。下一阶段的胜负,不会只由谁的榜单分数高决定,还取决于谁能把每百万token成本降下来、把首token等待压下来、把长上下文复用起来,并让模型在更多硬件和更多企业环境中稳定运行。模型能力仍是起点,但推理系统已经成为把能力转化为收入的主战场。
参考资料
- https://github.com/sgl-project/sglang/releases/tag/v0.5.17
- https://www.lmsys.org/blog/2026-07-27-kimi-k3-day0-support
- https://docs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3
- https://docs.sglang.io/cookbook/diffusion/MiniMax/MiniMax-H3
- https://platform.kimi.ai/docs/guide/kimi-k3-quickstart
- https://github.com/sgl-project/sglang/pull/32541
- https://github.com/sgl-project/sglang/pull/32828
- https://github.com/sgl-project/sglang/pull/33112
- https://github.com/sgl-project/sglang/pull/33275
- https://github.com/sgl-project/sglang/pull/29778