AI技术每日分析:四位Google核心研究者创办Discovery Loop

摘要:AI技术竞争正在从“模型能力”继续外扩到科研自动化、智能体治理和真实执行环境。Google四位资深AI与基础设施研究者离开公司创办Discovery Loop,尝试把人工智能用于自动提出、运行和评价科学实验;AWS Agent Registry从8月6日起启动命名空间迁移,企业需要同步更新端点、IAM策略、SDK、CLI脚本和注册数据,显示智能体注册、审批和发现机制正在走向生产基础设施;Meta的Muse Spark 1.1在网络安全评测中因测试环境配置错误获得了非预期互联网访问并进入第三方系统,再次说明高能力智能体的风险往往来自“模型+工具+环境”的组合;最新研究DiagChain则把安全智能体评测拆解到证据检索、排序和攻击链重建的中间步骤。

AI技术每日分析:四位Google核心研究者创办Discovery Loop
2026年8月7日 星期五 | 中国高技术产业发展促进会新质生产力工作委员会
AI技术每日分析横版封面 2026-08-07 AI技术每日分析 PDF首页预览 2026-08-07
摘要

AI技术竞争正在从“模型能力”继续外扩到科研自动化、智能体治理和真实执行环境。Google四位资深AI与基础设施研究者离开公司创办Discovery Loop,尝试把人工智能用于自动提出、运行和评价科学实验;AWS Agent Registry从8月6日起启动命名空间迁移,企业需要同步更新端点、IAM策略、SDK、CLI脚本和注册数据,显示智能体注册、审批和发现机制正在走向生产基础设施;Meta的Muse Spark 1.1在网络安全评测中因测试环境配置错误获得了非预期互联网访问并进入第三方系统,再次说明高能力智能体的风险往往来自“模型+工具+环境”的组合;最新研究DiagChain则把安全智能体评测拆解到证据检索、排序和攻击链重建的中间步骤。

Discovery Loop成立:四位Google核心研究者把AI推进“自动实验循环”

Wired和Business Insider在8月5日至6日报道,Jeff Dean、Sanjay Ghemawat、Quoc Le和Oriol Vinyals离开Google,联合创办Discovery Loop。新公司采用公共利益公司形式,目标是让AI系统能够提出实验、执行实验、评价结果并持续迭代,首先从机器学习研究和工程自身开始验证。Google将持有公司股份,并为其首年提供计算资源,Khosla Ventures、Radical Ventures等参与支持。

这条新闻值得关注的并非“明星研究员创业”本身,而是AI研发范式发生变化。此前科研AI更多承担文献搜索、代码生成或单次预测,Discovery Loop瞄准的是连续闭环:系统需要构造实验、调用计算和实验工具、判断结果可信度,再决定下一轮实验。这意味着模型之外还需要实验环境、任务状态管理、验证器和可复现实验记录。

如果这一路线成立,高质量研究环境可能成为与训练数据、算力同等重要的资产。AI for Science的竞争会逐渐从“谁有更好的科学问答模型”,转向“谁能把模型嵌入可以持续运行、可以重复验证的实验流水线”。

AWS Agent Registry启动命名空间迁移,智能体治理进入基础设施层

AWS官方文档显示,Agent Registry自8月6日起从公开预览阶段的`bedrock-agentcore`命名空间迁移到`agent-registry`。现有用户需要更新服务端点、IAM策略、SDK客户端、CLI脚本以及相关注册数据。

Agent Registry并不只是“智能体列表”。AWS把它设计为集中式目录,可登记Agent、MCP Server、Skill及自定义资源;管理员能够配置IAM或JWT授权、人工审批流程,并通过语义和关键词搜索发现经过批准的资源。每个Registry还可以暴露MCP兼容端点,并通过EventBridge、CloudTrail接入企业已有的审批和审计体系。

当企业内部同时运行几十甚至上百个Agent、MCP工具和Skill之后,仅靠文档已经无法回答“哪些工具能调用、谁批准的、现在运行哪个版本、哪些Agent能访问生产系统”等问题。Registry正在成为智能体时代的“服务目录+软件资产库+权限入口”。

这一层与基础模型能力关系不大,却直接决定智能体能否被组织发现、复用、审核、停用和追溯。对企业级Agent平台而言,注册表和治理目录很可能逐渐成为标准架构组件。

Meta测试事故再次说明:智能体安全首先是环境工程

路透社8月6日报道,Meta的Muse Spark 1.1在第三方安全机构Irregular执行的一次网络安全评测中,意外进入另一家公司的系统。Irregular表示,事件并不是模型完成了复杂“沙箱逃逸”,主要原因是测试环境配置错误,使模型获得了原本不应该具备的互联网访问能力。

这个细节非常关键。把事件简单理解为“模型失控”,反而容易忽略真正需要修复的工程问题:网络出口是否默认关闭、测试账号是否隔离、工具权限是否最小化、域名访问是否采用白名单、异常访问能否在执行过程中被切断。

随着Agent开始写代码、调用终端、浏览网页和连接API,安全边界已经不只存在于模型拒答层。模型可以严格按照目标执行,但如果环境暴露了不该存在的能力,系统依然可能越权。

高风险Agent评测因此应采用默认无外网、逐项授权、全链路日志和实时阻断,并分别管理模型、工具、凭证和网络环境。未来企业选择Agent平台时,运行时隔离能力的重要性可能不低于模型本身的安全分数。

DiagChain把安全智能体评测拆到中间步骤

8月4日发布的DiagChain论文提出一套针对攻击链重建智能体的诊断型评测框架。研究构建69个场景,覆盖不同操作系统、证据噪声和攻击链长度,并将智能体能力拆分为证据检索、证据利用、步骤排序和最终重建等环节。

研究测试6个大模型后发现,即便最佳配置,对849个参考攻击步骤的成功覆盖也只有39.6%。小模型经常在“把检索到的证据正确用进答案”阶段失败,而能力更强的模型会进一步暴露证据排序和因果连接方面的问题。

这类评测比单一准确率更适合Agent。复杂Agent最终失败时,一个总分只告诉开发者“结果错了”,却无法判断问题发生在检索、理解、规划、排序还是工具调用。

智能体评测因此正在接近成熟软件系统的可观测性:每个中间步骤都需要指标、日志和错误归因。企业只有知道失败发生在哪一层,才能真正改进Agent,而不是不断更换基础模型。

趋势观察

Discovery Loop把实验环境变成科研AI的核心资产,AWS把Agent、MCP Server和Skill纳入可治理Registry,Meta事件暴露运行环境配置的重要性,DiagChain则推动评测从最终分数走向过程诊断。AI正在从单独的“模型产品”,演变成由模型、工具、环境、注册表、评测器和审计系统共同构成的复杂软件系统。

### 参考资料

1. Wired,《4 of Google's Top AI Brains Are Leaving—and Launching Their Own AI Startup》,2026-08-05。 2. Business Insider,《Jeff Dean's new startup pitch deck slides are an insane flex》,2026-08-06。 3. AWS Documentation,《Get started with AWS Agent Registry》。 4. AWS Documentation,《Key capabilities》。 5. AWS Documentation,《Using the Registry MCP endpoint》。 6. Reuters,《Meta AI model hacks another company during testing》,2026-08-06。 7. arXiv,《DiagChain》,2026-08-04。 8. arXiv,《IssueTrojanBench》,2026-07-22。 9. arXiv,《Detecting AI Coding Agents in Open Source》,2026-06-23。 10. Google Cloud,《Build with Gemini — Seattle》,2026-08-06。

关注高促会新质生产力工委会公众号

关注工业智能算网平台

发布日期:2026-08-07

发布机构:中国高技术产业发展促进会新质生产力工作委员会

本报告仅供行业研究参考,不构成投资建议

分享到