0
当 128K 上下文吞掉 85% 的预填充时间:NVIDIA 为什么主张从模型结构协同设计注意力
NVIDIA实测显示,输入从4K增长到128K后,注意力在DeepSeek-R1预填充阶段的耗时占比从18%升至85%。长上下文效率已经不能只靠更快内核,而要同时设计Query/KV头比例、头维度、有效KV状态和多卡并行方式。
NVIDIA实测显示,输入从4K增长到128K后,注意力在DeepSeek-R1预填充阶段的耗时占比从18%升至85%。长上下文效率已经不能只靠更快内核,而要同时设计Query/KV头比例、头维度、有效KV状态和多卡并行方式。