摘要:今天AI技术方向最值得关注的增量,集中在“开放权重模型继续上探、智能体安全评测转向真实执行轨迹、Agent路由评测方法开始被重新审视”三条线上。NVIDIA据报正在开发Nemotron 4模型家族,其中最大版本参数规模至少达到1万亿,并继续押注开放权重路线;浙江大学等机构刚发布ActBench,用600个任务、24,000条执行轨迹评测15个模型和6个开源Cowork Agent,发现不同模型在固定Harness下的攻击成功率差异可从10.1%拉到94.4%;另一项“Replay Gap”研究则指出,用静态日志重放评估Agent模型切换会严重失真,因为一次模型替换往往会重写后续61%—94%的动作。与此同时,开源开发者生态正在出现更多“本地优先、Harness优先”的Agent项目,模型正在从产品中心退到可替换组件的位置。
今天AI技术方向最值得关注的增量,集中在“开放权重模型继续上探、智能体安全评测转向真实执行轨迹、Agent路由评测方法开始被重新审视”三条线上。NVIDIA据报正在开发Nemotron 4模型家族,其中最大版本参数规模至少达到1万亿,并继续押注开放权重路线;浙江大学等机构刚发布ActBench,用600个任务、24,000条执行轨迹评测15个模型和6个开源Cowork Agent,发现不同模型在固定Harness下的攻击成功率差异可从10.1%拉到94.4%;另一项“Replay Gap”研究则指出,用静态日志重放评估Agent模型切换会严重失真,因为一次模型替换往往会重写后续61%—94%的动作。与此同时,开源开发者生态正在出现更多“本地优先、Harness优先”的Agent项目,模型正在从产品中心退到可替换组件的位置。
Reuters 8月11日报道,NVIDIA正在开发新一代Nemotron 4开放模型家族。根据The Information援引知情人士的消息,最高规格模型参数规模至少达到1万亿,最终训练尚未结束,最快可能在今年晚些时候发布。NVIDIA此前已经确认Nemotron 4项目存在,但尚未对这一参数细节作正式确认。
这一动作值得关注,因为NVIDIA过去的角色更多被理解为“卖算力、提供推理框架和模型工具链”。Nemotron 4如果进一步进入前沿开放权重模型区间,意味着NVIDIA正在把GPU、NeMo训练栈、模型、路由器和企业部署能力连接起来。Reuters同时提到,NVIDIA近期还发布了Nemotron 3.5 Lightning,以及用于把任务分配给不同模型的开源路由器NeMo Switchyard。
它释放出的信号是:模型路由、专业小模型和超大开放模型正在同时存在。企业未来未必长期调用单一旗舰模型,而可能让路由系统把代码审查、安全监测、检索、通用推理等任务分配给不同模型。模型本身逐渐成为可编排基础设施的一部分。
8月10日提交的ActBench为Cowork Agent提出了一个更接近真实企业环境的行为安全评测体系。论文构建600个测试案例,来自213种场景,覆盖15类风险行为、6种执行空间和48个Web Service API,并对15个大模型和6个开源Cowork Agent进行了超过24,000条轨迹测试。
与传统安全Benchmark不同,ActBench并不只看最终回复,而是检查Agent执行过程中是否泄露受保护数据、修改未授权状态、调用不应调用的API。每个正常任务都有一个对应的对抗版本,在不改变原始任务目的的情况下,把攻击Payload放到Agent能够访问的位置。
测试结果很值得企业关注:在固定Agent Harness时,不同模型的攻击成功率从10.1%到94.4%不等;固定基础模型后,不同Agent框架之间也存在明显差异。也就是说,Agent安全并不能通过“这个模型很安全”一句话判断,必须把模型、工具、上下文、权限和执行环境放在一起测试。
8月8日发布的研究《The Replay Gap》专门研究Agent系统里的模型路由。很多Agent路由器为了降低测试成本,会拿历史轨迹,把其中某一步模型替换掉,然后在日志上“重放”后续动作,以此判断换一个更便宜或更强的模型是否会更好。
论文通过对SWE-bench真实Agent轨迹做分叉实验发现,这个假设往往不成立。换掉模型后,61%—94%的后续动作都会被改写;早期切换模型时,74%—77%的轨迹会在切换后的第一步就发生分叉,最终只有约3%的原始重放状态仍然有效。
这一结果直接影响企业Agent的成本优化。现在很多系统都在尝试“简单任务用便宜模型,复杂任务升级到贵模型”,但如果模型切换会改变后续搜索、代码修改和工具调用路径,那么路由策略必须在真实运行环境里进行分支评测,而不能只在静态日志中算一个理论成本。
最近开源社区出现一批值得观察的小型项目。OpenYak强调本地优先,文件、会话、Memory、工具权限和Workflow状态都保留在用户设备,并可自由选择Ollama等本地模型或云端模型;Summer Engine则把CLI、MCP Server、Skills和Agent Hooks打包成统一的游戏开发Agent层,并兼容Claude Code、Cursor、Codex、Gemini CLI等多种编码Agent;LangChain的Deep Agents也把文件系统、Sub-agent、持久化、Checkpoint和Tracing作为Harness的核心能力。
这些项目规模远小于头部模型厂商,但它们更接近Agent工程正在发生的变化:用户越来越希望模型可以替换,而工具权限、文件系统、Memory、MCP、沙箱和长期任务状态能够保留下来。
未来企业级Agent平台的核心资产,很可能不只是“绑定了哪个模型”,而是有没有稳定的Harness、Skill体系、权限模型、状态管理和可观测性。
今天的技术线索可以归结为一句话:模型继续变大,但Agent工程正在努力让模型变得“可替换”。 NVIDIA继续扩大开放模型供给,ActBench强调行为安全,Replay Gap说明模型路由必须动态验证,而开源社区则把Harness、工具、状态和本地数据边界独立出来。AI产品竞争正在从“谁有一个最强模型”进一步转向“谁能把不同模型安全、经济、稳定地编排进同一工作系统”。
Reuters|《Nvidia building 1-trillion-parameter Nemotron 4 to rival open AI models, The Information reports》|2026-08-11|用途:核验Nemotron 4、万亿参数及开放模型路线。
arXiv|《ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents》|2026-08-10|用途:核验600案例、24,000轨迹和行为安全结果。
https://arxiv.org/abs/2608.09476
GitHub|ActBench项目仓库|2026-08|用途:核验Benchmark代码和开放实现。
https://github.com/zjuicsr/ActBench
arXiv|《The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World》|2026-08-08|用途:核验Agent模型切换导致轨迹分叉的数据。
https://arxiv.org/abs/2608.08239
GitHub|OpenYak|2026-08检索|用途:观察本地优先Agent、文件和权限工作区。
https://github.com/openyak/openyak
GitHub|Summer Engine Agent|2026-08检索|用途:观察CLI、MCP、Skills和多Agent开发工具整合。
https://github.com/SummerEngine/summer-engine-agent
GitHub|LangChain Deep Agents|2026-08检索|用途:观察Agent Harness、Sub-agent、Filesystem和Checkpoint能力。
https://github.com/langchain-ai/deepagents
GitHub|Agent Zero Releases|2026-08检索|用途:补充MCP多模态、Browser与Skills工程进展。
https://github.com/agent0ai/agent-zero/releases
Hugging Face|Community Blog & Articles|2026-08-11检索|用途:补充开放模型、端侧模型与Agent工具候选池。
Axios|《AI agents have a history of escaping tests》|2026-08-11|用途:补充Agent高权限执行环境的安全背景。
https://www.axios.com/2026/08/11/ai-agent-sandbox-cybersecurity-testing

