0
推荐系统正在“语言模型化”:HSTU、Semantic ID与生成式推荐架构
生成式推荐正把用户历史视为序列,把下一物品视为token。本文系统解释HSTU、Semantic ID、DynamicEmb、分层缓存、AOTInductor与短解码大Beam的生产架构和适用边界。
生成式推荐正把用户历史视为序列,把下一物品视为token。本文系统解释HSTU、Semantic ID、DynamicEmb、分层缓存、AOTInductor与短解码大Beam的生产架构和适用边界。
NVIDIA实测显示,输入从4K增长到128K后,注意力在DeepSeek-R1预填充阶段的耗时占比从18%升至85%。长上下文效率已经不能只靠更快内核,而要同时设计Query/KV头比例、头维度、有效KV状态和多卡并行方式。