0
一个176B模型,每个Token只激活6B:Qwen3.8-Flash-Next正在重新定义“大模型有多大”
Qwen团队在8月26日公开Qwen3.8-Flash-Next时,最醒目的数字很容易让人产生困惑:主模型125B参数,额外还有51B N-gram Embedding,但每个Token只激活约6B参数。把几组数字相加,整个系统的参数...
Qwen团队在8月26日公开Qwen3.8-Flash-Next时,最醒目的数字很容易让人产生困惑:主模型125B参数,额外还有51B N-gram Embedding,但每个Token只激活约6B参数。把几组数字相加,整个系统的参数...