开源大模型追赶前沿的时间正在压缩:当模型差距只剩几个月,AI行业会发生什么

摘要:开放模型追赶闭源前沿所需的时间正在缩短。当模型层的领先优势只能维持几个月,产业价值将更多沉淀到推理基础设施、Agent Harness、企业数据、工具和工作流。

开源大模型追赶前沿的时间正在压缩:当模型差距只剩几个月,AI行业会发生什么

过去三年,大模型行业有一个反复出现的节奏。

闭源实验室先发布一代明显更强的模型,开发者惊叹能力跃迁;几个月后,开源或开放权重阵营开始追上;等差距看起来快要被抹平,闭源前沿又向前跳一步。

这种“拉开—追赶—再拉开”的循环一直存在。变化出现在最近两年:追赶速度明显变快了。

SemiAnalysis 8 月 21 日发布了一篇很有讨论价值的分析。他们没有拿一套固定 Benchmark 去评估所有历史模型,而是把大模型发展拆成三个阶段:Early Scaling、Reasoning、Agentic,然后选择每个时代当时真正有区分度的测试集,计算开放模型和闭源前沿之间的追赶时间。

他们得到的趋势很醒目:每进入一个新的能力阶段,开放模型追上该阶段早期闭源前沿所需的时间,都在缩短。

进入 Agentic 阶段以后,这个窗口已经被压到半年左右。

这个结论当然不能简单理解成“开源已经全面等于闭源”。SemiAnalysis 自己也承认,Benchmark 和日常工作体验之间存在明显差距。不过,把它和 Kimi K3、GLM 等近期模型放在一起看,一个更现实的问题摆到了行业面前:如果模型层的领先优势只能维持几个月,长期价值会往哪里沉淀?

为什么不能拿MMLU一张表评三年模型

SemiAnalysis 这篇文章最合理的一点,是先承认 Benchmark 会过期。

于是 SemiAnalysis 把历史切成三个 Era,分别比较。

第一阶段,开源追赶花了一年多

Early Scaling 阶段,Llama 2 是一个很好的起点。

2023 年 6 月前后,Llama-2-70B 已经属于最强开放模型之一,但和 GPT-3.5 Turbo、GPT-4 一类闭源模型仍有明显差距。SemiAnalysis 用当时有代表性的四类 Benchmark 做归一化综合评分,GPT-3.5 Turbo 得到 75.7,Llama-2-70B 只有 39.9。

到 2024 年 7 月,Llama-3.1-405B 的综合分达到 86,算是越过早期 GPT-3.5 Turbo 那条线;2024 年 12 月的 DeepSeek V3,则基本追到 GPT-4o 的评分水平。

推理阶段,窗口缩到8个多月

2024 年 9 月,o1-preview 把行业带入新的推理阶段。

DeepSeek R1 出现后,开放模型在推理维度快速接近前沿。SemiAnalysis 的统计里,R1-0528 在 2025 年 5 月追平这一阶段最初的差距,大约用了 8.5 个月。

一项新方法在头部实验室被证明有效以后,很难长期保持完全不可见。论文、模型行为、产品特征、人员流动、开源实现都会暴露信号。再加上蒸馏和合成数据,后来者并不需要从零探索全部路线。

到Agent阶段,半年已经足以追上一轮

第三阶段的基准换成了 Agent。

SemiAnalysis 把 Opus 4.5 看作这一阶段的一个标志节点,理由不只是单项测试分数,而是模型与 Claude Code Harness 组合后的可靠性。文章甚至提到,当时 GPT-5.2 在他们的综合 Benchmark 上更高,但实际用户体验并没有简单跟分数一致。

在他们的统计里,Kimi K2.6 用 4.8 个月超过 Opus 4.5 对应的综合得分,GLM-5.2 用 6 个月跨过 GPT-5.2 的评分线。与此同时,OpenAI 和 Anthropic 的模型发布频率也在加快:SemiAnalysis 统计 Agentic Era 两家平均约 51 天发布一代重要模型,相比早期阶段的 213 天和推理阶段的 120 天,节奏大幅压缩。

也就是说,前沿在跑,追赶者也在跑,而且两边都在加速。

开放模型追赶闭源前沿的时间窗口正在缩短

Kimi K3把“追赶”推到了3T级稀疏模型

Kimi K3 是这条趋势里一个很有代表性的技术样本。

官方披露的总参数量达到 2.8 万亿,进入 3T 级别。单看这个数字很容易误解为推理时需要像 2.8T Dense Model 一样计算,K3 采用的是高度稀疏 MoE:896 个 Expert 中,每次有效激活 16 个,并结合 Stable LatentMoE。

这类设计的思路很清楚:模型总容量继续做大,让不同 Expert 学习更多专业模式;每个 Token 只激活很小一部分 Expert,把实际计算量压下来。

K3 同时使用 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)。官方描述里,这两项结构调整主要针对长序列和深层网络中的信息流,再配合训练与数据配方,相比 Kimi K2 获得约 2.5 倍 scaling efficiency 提升。

K3 的目标也明显朝 Agent 工作负载倾斜。

官方展示的任务不再局限于“回答一道代码题”,而是让模型在相同 Sandbox 里最长运行 24 小时,做 GPU Kernel Profiling、重写和 Benchmark;还让模型从头构建一个类似 Triton 的 MiniTriton 编译器,包含 DSL、tile-level IR、MLIR 上的优化 Pass、PTX Codegen 和 Runtime,并用 nanoGPT 训练验证整条编译链。

模型越接近,Harness差距反而越值钱

SemiAnalysis 在文章后面给了一个很有意思的自我校正。

他们的综合评分里,某些开放模型已经非常接近甚至超过部分闭源模型,可 SemiAnalysis 团队日常工作仍更偏好成熟的闭源 Agent 产品。原因之一就是产品化和 Harness。

所谓 Harness,可以理解成模型周围那一整套“工作系统”:

如何把仓库交给模型;怎样选择文件;什么时候搜索;什么时候跑测试;工具报错以后怎么恢复;上下文怎样压缩;历史怎样保存;子任务怎么分派;命令执行怎么隔离;高风险操作怎么审批;任务跑两个小时以后如何继续。

模型本身决定能力上限,Harness 很大程度上决定用户每天到底能不能稳定用到这个上限。

这解释了一个看起来有些矛盾的现象:Benchmark 越来越接近,产品体验仍然可能差一截。

企业AI会越来越像“模型路由”

如果开放模型长期能在几个月内接近上一轮闭源前沿,企业的部署策略会发生变化。

内部知识问答需要便宜、稳定、可私有化;代码 Agent 需要强 Tool Use 和长上下文;工业现场可能要求数据不出厂;复杂研究和一次性高难推理又愿意为最强闭源模型付费。

更合理的架构是模型路由。

日常低难任务交给小模型;敏感数据交给本地模型;高并发业务交给成本合适的开放模型;极难任务临时升级到 Frontier API。模型根据任务动态选择,上层 Agent Runtime 保持统一的 Memory、Tools、Permissions、Workflow 和 Audit。

更耐久的资产是企业自己的高质量数据、业务对象模型、知识体系、工具接口、评测集、工作流、权限规则和行业 Know-how。

闭源前沿会不会因此失去商业价值

追赶时间缩短,最容易引出的判断是“模型要商品化了”。

第一,领先几个月本身就有商业价值。AI 产品迭代速度极快,企业愿意为能提前半年完成一类任务的能力付钱。

第四,Benchmark 本身有局限。公开测试被针对性强化、训练集污染、Harness 差异、采样设置都会影响结果。SemiAnalysis 也明确提醒,综合分数不能等价于真实工作体验。

因此更准确的说法是:模型层单独享有的溢价正在承压。

过去“一代模型领先一年”的时代里,闭源 API 可以靠能力差距建立很宽的护城河;如果这个窗口缩到四五个月,商业竞争会更多转向推理成本、Agent 产品、开发工具、企业集成、分发渠道和专有数据。

开源追赶越快,应用层越应该少赌模型、多做系统

模型选择越来越多,价格会持续受到竞争压力,本地部署的能力上限也在迅速提高。很多过去只能调用闭源 API 的工作负载,开始有机会迁回私有环境。

半年以后一定还会有新模型。与其反复讨论今天榜单第一名是谁,不如先把系统做成可替换的:Prompt 和 Tool Schema 版本化;关键任务有自己的 Eval;推理层支持多 Provider;Memory 不绑死模型;工作流能在本地和云端切换;高价值 Know-how 留在企业自己的数据和规则体系里。

模型仍然重要,而且前沿模型仍会不断把上限往前推。只是模型之外的那部分——推理基础设施、Agent Harness、数据、工具、工作流、权限和行业知识——正在获得越来越大的价值占比。

大模型竞争没有变简单,只是战场开始从一张 Benchmark 排行榜,扩展到了完整的软件系统。

参考资料

  • SemiAnalysis:Are Open Models Catching Up?,2026-08-21
  • Kimi:Kimi K3 Tech Blog: Open Frontier Intelligence,2026-07
  • Horizon Daily:2026-08-23 技术资讯汇总
分享到