0
一个176B模型,每个Token只激活6B:Qwen3.8-Flash-Next正在重新定义“大模型有多大”
Qwen团队在8月26日公开Qwen3.8-Flash-Next时,最醒目的数字很容易让人产生困惑:主模型125B参数,额外还有51B N-gram Embedding,但每个Token只激活约6B参数。把几组数字相加,整个系统的参数...
Qwen团队在8月26日公开Qwen3.8-Flash-Next时,最醒目的数字很容易让人产生困惑:主模型125B参数,额外还有51B N-gram Embedding,但每个Token只激活约6B参数。把几组数字相加,整个系统的参数...
Qwen 3.6 27B 的意义,不是证明本地模型已经全面追平云端,而是让“私有代码助手”第一次接近可长期使用的工程状态。
r/LocalLLaMA 上一位 OpenYabby 作者把原本依赖 Claude 的推理层换成单张 RTX 3090 上本地运行的 Qwen3.6-27B,并用 47 个多步骤编码工作流做了两周对比。结果显示,本地模型已经可以承担规划、记忆和部分审查,但工具调用、长上下文稳定性与执行安全仍需要系统闸门。
大模型竞争越来越像一场全球统一命题的高考。每家公司都能讲自己的故事,但一旦进入公开测评、盲测榜单、数学证明、代码修复和长任务Agent场景,故事就会被压缩成一句话,你到底考了多少分。
在本地大模型玩家圈里,RTX 3090 仍然是一张极有代表性的“临界点显卡”。24GB 显存、成熟的软件生态和相对可承受的成本,让它成为很多人判断本地模型是否真正可用的一把尺子。问题是,一张3090到底能干什么,边界又在哪?