0
大模型一次只能生成一个Token,为什么投机解码还能让它快2到3倍?
大语言模型最让人觉得“违反直觉”的优化之一,是Speculative Decoding。自回归模型在逻辑上必须一个Token接一个Token生成:第51个Token取决于前50个,没看到第50个就无法确定第51个。既然这个因果链不能打...
大语言模型最让人觉得“违反直觉”的优化之一,是Speculative Decoding。自回归模型在逻辑上必须一个Token接一个Token生成:第51个Token取决于前50个,没看到第50个就无法确定第51个。既然这个因果链不能打...
DeepSeek 开源 DeepSpec,把投机解码从论文概念推进到训练、评估和部署工具链。大模型竞争正在从参数规模转向单位 token 成本。