0
大模型一次只能生成一个Token,为什么投机解码还能让它快2到3倍?
大语言模型最让人觉得“违反直觉”的优化之一,是Speculative Decoding。自回归模型在逻辑上必须一个Token接一个Token生成:第51个Token取决于前50个,没看到第50个就无法确定第51个。既然这个因果链不能打...
大语言模型最让人觉得“违反直觉”的优化之一,是Speculative Decoding。自回归模型在逻辑上必须一个Token接一个Token生成:第51个Token取决于前50个,没看到第50个就无法确定第51个。既然这个因果链不能打...
2026年8月26日,vLLM 0.28.0 发布。单从版本号看,它像一次常规升级;翻开 release notes,规模却很不寻常:584 个提交、270 名贡献者,其中 76 名是首次参与。更值得关注的是这些提交集中在什么地方。K...