一个实验室用自己的模型协助研发下一代模型,究竟快到了什么程度?过去,这个问题常被演示视频、论文数量和员工感受代替。Anthropic在9月25日公布的一组内部指标,把讨论推进到任务层:截至2026年8月,其被测模型研发工作中,26%达到AL4“AI主导”,超过90%达到AL3“AI协作”及以上。更惊人的对照是,2月时“AI主导”占比还不到1%。
这组数据值得认真看,也最容易被误读。26%不是“26%的研究员被替代”,超过90%也不是“九成研发已经自动完成”。它们描述的是在特定任务划分和分级方法下,Claude参与研发的程度。Anthropic同时明确,Claude尚未在任何被测研发子领域达到完全自主。判断这件事的价值,关键是把“任务能由谁主导”“人在哪一步把关”“系统如何发现越界”拆开,再看这些变化如何影响企业自己的研发组织。
一、从辅助写代码,到接管一段研发工作
Anthropic把研发自动化划为AL0至AL5。原稿给出的两个关键锚点是AL3“AI协作”和AL4“AI主导”:到AL4时,模型可以从高层提示出发完成大部分任务,人类仍负责监督。只比较生成了多少代码、节省了多少打字时间,会漏掉真正的结构变化:人给出研究目标后,Agent可能自行选择路径、调用工具、修改文件、跑实验并整理结果。任务的执行链条开始由模型组织。
这与一个研究员临时向聊天窗口询问算法思路,风险和生产率都不在同一量级。前者的关键资源是持续的工作空间、实验配置、代码仓库、数据、算力和反馈信号。模型若能跨越其中多个环节,就能在一次任务里完成过去需要多轮交接的工作;一旦权限设计有误,也可能在多个环节连续放大错误。企业评估自动化时,应记录Agent到底完成了哪一段闭环,而非给所有“用了AI”的任务贴同一个标签。
以模型训练流水线为例,资料整理、实验脚本编写、参数配置、失败日志归因和结果比较,看上去都可成为可委派环节。但“提出一个更好的训练方案”与“证明方案有效”之间还隔着对照实验、资源核算和复现。生成候选假设可以很快;判定候选是否值得合并进主线,需要可靠的评价集、成本数据和人的专业判断。自动化指数上升,不自动等于有效创新同比例上升。
二、半年跃迁的信号,不能用岗位替代率解释
2月不足1%、8月26%,表明在Anthropic自己的研发环境中,AL4任务占比增长很快。这个速度对同行和企业都构成压力:如果复杂研发的部分工作能够被Agent持续承担,原来以人员扩张换取实验吞吐量的组织方式就会调整。但这是一家实验室按其自身任务和方法测出的内部数据,不能直接外推成所有行业、所有研究岗位的自动化比例。
更谨慎的读法,是把它当作“任务边界变化”的早期指标。某些工作从“人逐步操作、AI辅助”移向“AI执行、人监督”,组织的瓶颈也会移动:以前卡在写脚本和找资料,后来可能卡在定义好问题、审核实验质量、决定部署优先级。速度提高后,错误候选的数量也会同步增加;没有更好的筛选机制,吞吐量甚至会变成评审团队的负担。
因此,一线研发负责人需要两本账。第一本是效能账:从任务创建到结果可复核的周期、单次有效实验成本、返工率、跨人交接次数。第二本是质量账:结果是否可复现、指标是否被挑选性汇报、Agent是否擅自改动评测条件、代码与数据是否可追溯。只公布“Agent解决了多少任务”,不足以证明研发速度真实提升。
三、三万个Agent同时工作,管理对象已经变了
Anthropic披露,在其使用最广泛的内部研发平台上,约有3万个研究和工程Agent同时运行,相关动作经过在线监控。这里的冲击力来自Agent已经成为大规模、并发、可持续运行的工作单元,单个模型的能力反倒不足以解释这种变化。企业IT熟悉管理员工账户、服务账号和批处理作业;并发Agent兼有三者特征:会自主选择工具,可能持有凭据,也可能在无人盯着的时候继续执行。
这要求管理系统回答一组以前很少被放在一起的问题:谁创建了这个Agent,授权它做哪项任务,能读哪些数据,能写哪些环境,预算何时耗尽,谁负责复核结果,任务结束后身份和工作空间何时销毁?同一个Agent如果从只读分析转为提交代码,应当产生新的审批节点;从测试环境转入生产环境,更不能沿用原有凭据。权限需要随任务状态变化,而非随着某个“研发助手”账号永久存在。
高并发还会制造相关性风险。一个错误提示模板、一项过宽网络规则、一个带偏的评测脚本,可能同时影响大量Agent。传统的单点抽样难以发现这种系统性偏差。企业至少需要集中维护任务模板和策略版本,能按Agent批次追踪产物,并具备批量暂停、回滚和撤销凭据的手段。并发规模越大,恢复能力越接近研发基础设施的核心指标。
审计也不能只保存Agent最后交出的答案。假设多个Agent同时编辑同一套实验配置,最终结果异常时,团队要能重建具体操作顺序:谁先改了数据切分,谁随后重跑指标,哪一次合并让异常进入主线。为每个任务分配唯一标识,把工具调用、代码提交、实验产物和审核意见串成链,能显著缩短排查时间。日志不是为了事后找人背锅;它首先是判断结果还能否使用、哪些实验必须重跑的工程依据。
四、10亿次决策与0.002%阻断,能说明什么
Anthropic称,8月分析超过10亿次Agent决策后,约0.002%的决策被在线监控阻断,约每4.7万次一次;离线系统每周筛出约10万条记录,多轮过滤后约50条升级人工复核。监控从实时拦截、离线筛查到人工审阅,构成多层处理链。这比笼统声称“每一步都有人监督”更有信息量,因为3万个并发Agent的每一步显然不可能交给人逐项批准。
但阻断率不是违规率,更不是安全率。一个低阻断率可能意味着Agent大多数时候按规工作,也可能意味着监控规则覆盖有限;仅凭这个数字无法判断。离线筛查条数和人工复核条数同样不能当成“最终违规事件数”。企业如果借鉴这套做法,应同时看监控覆盖范围、规则命中后的处理结果、误报与漏报、人工确认后的严重性,以及从异常发生到处置的时间。没有分母和标签定义,百分比容易成为安全幻觉。
工程上可以把执行监督分成四层:任务前核对授权范围和敏感资源;执行中约束网络访问、凭据调用、文件修改和高风险工具;任务后保存可复查的输入输出与关键动作;发现异常时暂停运行并隔离工作空间。单靠“让模型先想一想是否合规”的提示,不能承担这四层职责。监控必须在模型之外有可强制执行的边界。
五、AI研发AI,会形成自我强化吗
当模型能承担下一代模型研发任务,“研发速度可能反过来提高模型能力”的循环就进入可测量范围。不过,不能从26%的AL4占比直接推断能力已经进入不可控的指数增长。实际研发仍受算力、数据、评测质量、实验设计、人类决策和安全要求限制。某项自动化提升能否转化为下一代模型能力,需要看从任务完成到研究成果、再到稳定产品的整条链路。
企业与监管真正需要的,是早于最终产品发布的过程指标。模型在研发中参与了什么任务、达到哪一级自动化、能访问什么资源、异常由谁审查、资源如何分配,这些信息比一张通用能力排行榜更接近实际风险。Anthropic此次同时讨论研发算力分配和Agent行为监督,也说明测量对象不应停在“模型答题有多好”。模型研发被自动化之后,实验室的内部控制本身就是技术能力的一部分。
还有一处容易被忽略的边界:研发Agent可能同时接触未公开模型权重、训练数据、评测题库和安全测试记录。它能读取哪些信息,直接影响结果可信度。如果Agent既参与构建系统又能看到最终考题,后续的能力提升就可能混入评测污染;如果实验日志被广泛复制,敏感资料又会扩散。企业可将开发数据、独立验收集和安全评测环境分区管理,为跨区访问设置单独审批,并追踪每次授权的目的与期限。更快的研发流水线,需要更严格的证据隔离。
这里还有一个激励问题:如果考核只看实验数量和训练进度,Agent会自然朝容易得分的环节集中,可能挤压负结果复现、安全测试和长周期基础研究。团队应为“推翻一个错误方向”“识别评测泄漏”“证明一次改进不可复现”保留明确价值。研发组织不能把Agent的高吞吐误认为决策质量,尤其不能把自动生成的漂亮总结当作可靠证据。
六、企业可以怎样落地自己的自动化指数
大多数企业无需照搬前沿实验室的分级名称,但可以从一个具体团队开始建立任务清单。先把研发任务按需求澄清、资料检索、设计、编码、测试、实验分析、上线审批分段,记录每段由人发起、AI协作还是AI主导;再给每类任务标出影响等级。一个只生成内部草稿的Agent,与能改动客户数据或生产配置的Agent,不能共用验收规则。
试点周期里,不妨选取同类型任务的人工基线和Agent样本,比较完整周期、返工次数、缺陷率和审查负担;保留失败样本,不只展示最佳案例。每个Agent交付物应附上任务目标、使用的数据和工具、关键改动、测试结果、尚未验证的假设与人工签收记录。对于代码和模型实验,产物还应能关联版本、依赖、配置及运行日志。这样才能在效果不佳时定位问题,而非只能重新问一遍模型。
权限设计要比试点宣传早一步。最小权限、环境隔离、敏感操作二次确认、预算限额、凭据短期有效、任务结束回收,适合从第一批Agent就实施。研发团队通常担心严格管理拖慢探索;可以把只读和低风险实验放宽,让高影响写入操作进入审批通道,用分级权限保持效率。所有“可以执行”的范围都应写成机器可执行策略,再由日志证明策略确实生效。
衡量方式也要避免“挑容易的题刷分”。如果只计算最熟悉的代码库、最清晰的缺陷单,自动化比例自然好看,却不能代表团队真正困难的工作。任务样本应覆盖常规需求、模糊需求、跨系统任务和故障恢复;记录Agent在哪个节点求助,哪些请求因权限不足而正常终止。随着模型和工具升级,保留一组长期不变的基准任务,同时定期引入新任务,才能分辨技术进步与样本变化。对外沟通时写明统计口径、时间窗口和任务分布,比公布一个孤立的百分比更负责。
最后,给指数增加反面指标:发生过多少次越界尝试、多少任务无法复现、多少结果在人工复核后被撤销、异常恢复花了多久。自动化率上升而这些指标恶化,不能宣布试点成功。真正可信的进展,是更多任务可由Agent承担,同时关键错误仍能被发现、解释和纠正。
七、下一轮竞争,衡量的是可控的研发吞吐
Anthropic的数据揭示了一个转折:AI在前沿实验室内部已经成为规模化研发工具,且一部分任务开始由AI主导。它没有证明实验室可以离开研究员自行推进,也没有提供所有企业都能复制的效率承诺。让这个变化具有产业冲击力的,是自动化、并发执行和监督体系同时出现。
对企业而言,先别急着宣布“全面Agent化”。更急迫的是找出哪些研发任务已经具备清晰输入、可验证输出和可执行边界;为它们建立可复现的评测与授权流程,再逐步提高自主程度。能把有效实验增量、质量控制和安全边界一起算清楚的组织,才可能真正享受研发自动化的速度。把26%当作裁员比例,会看错方向;把它当作重新设计研发系统的预警,才接近这组数字的分量。