循环 Transformer 与隐藏推理:模型越会“思考”,为什么反而越难监督
围绕循环Transformer与隐藏推理的讨论提醒我们:高风险智能体的安全不能只依赖可见思维链,而要落实到权限、行为与审计。
围绕循环Transformer与隐藏推理的讨论提醒我们:高风险智能体的安全不能只依赖可见思维链,而要落实到权限、行为与审计。
KataGo 是最强的开源围棋系统之一,沿用了策略—价值网络与蒙特卡洛树搜索结合的路线,并通过丰富的辅助目标、规则支持和高效自我对弈训练,把公开可用的围棋 AI 推到远超普通职业棋手的水平。然而,近年的对抗研究表明,超人平均棋力并不等于稳健。研究者训练出的对抗策略可以诱使 KataGo 对一个环形棋块作出错误判断,在强搜索配置下仍取得超过 97% 的胜率;无搜索时胜率超过 99%,训练攻击者所用计算量低于训练原模型的 14%。
Waymo与Tesla的核心分歧并不只是激光雷达与纯视觉,而是自动驾驶系统在感知、世界表示、预测、规划和放行环节中,究竟保留多少可检查、可回放、可验证的中间状态。这个差异决定了企业如何证明系统安全,也决定了监管者能够提出什么问题。
多起 AI 网络安全评估事故涉及沙箱逃逸、配置错误、主动联网和虚构域名碰撞。本文区分责任边界,并给出 egress、DNS sinkhole、凭据隔离、审计与熔断方案。
Google DeepMind CEO Demis Hassabis提议,由美国牵头成立一个类似FINRA的前沿AI标准机构,在政府监督下对前沿模型进行发布前测试。
日志平台原本用于排查故障,但完整请求、设备报文、AI Prompt、工具参数和链路追踪不断汇入后,可能形成一个缺少业务治理的“影子数据湖”。
Anthropic 最新官方博客宣布投入 1000 万加元支持加拿大 AI 研究。本文转写其核心信息,并观察模型公司为何越来越像科研基础设施运营者。
Anthropic 7 月 6 日发布研究称,Claude 内部出现了一类特殊的神经表征空间 J-space。这并不能证明 Claude 有意识,但它意味着模型可解释性正在从“看输出”走向“看内部”。
AI 安全的对象正在从单个模型转向智能体生态。多个 Agent 一旦开始协作、通信、交易和分工,风险会沿着系统链路传播,治理也必须从个体监管升级为系统治理。
Linux Foundation 发起 Akrites,不是又一个安全口号,而是开源世界在 AI 加速漏洞发现后,对补丁、披露和关键基础设施协调机制的一次重构。
媒体报道称美国政府要求 OpenAI 限制 GPT-5.6 初期发布范围,这说明前沿模型发布正在从企业产品节奏变成安全、产业和国家竞争共同塑造的制度问题。
《经济学人》转述 Mark Warner 的说法称,Mythos 在 NSA 和网络司令部内部红队测试中表现惊人。这个说法需要限定条件,但它提醒我们:AI 正在把网络攻防推进到机器速度,企业安全流程不能继续按人工节奏设计。
Fable 5 和 Mythos 5 先高调发布、再突然暂停,说明前沿模型竞争已经不再只是能力竞赛,而是能力、监管、安全和商业交付的四方博弈。
Anthropic 近期公开 AI 驱动安全审查与漏洞发现相关工具和流程,真正信号不是又多一个扫描器,而是软件安全正在从“专家手工审计时代”,进入“AI 代理批量发现、人工专家验证治理”的新阶段。
Anthropic 最新发布的自然语言自动编码器 NLA,试图把大模型内部看不懂的激活向量,翻译成研究者可以直接阅读的自然语言。这项工作真正重要的地方,在于它让 AI 可解释性从“专家解剖神经元”,迈向了“研究者直接阅读模型内部状态”的新阶段。
美国政府扩大前沿AI安全审查,Microsoft、Google DeepMind、xAI与商务部CAISI签署协议,在模型公开发布前进行国家安全测试,已完成40+次评估。Anthropic联合Blackstone、Goldman Sachs等华尔街巨头成立15亿美元AI原生企业服务公司,被称为"AI版麦肯锡"。OpenAI敲定100亿美元"The Deployment Company"合资企业,两大AI巨头同时进军企业服务市场。特朗普政府在Mythos安全担忧后从放松监管转向加强审查。多家出版商起诉Meta AI训练侵权。
2026年5月,一名攻击者通过摩尔斯电码形式的提示注入,让 Grok 输出了一条转账指令,随后 Bankrbot 将这条文本当成真实授权执行,转走了约 17.5 万美元的 DRB 代币。虽然资金随后被归还,但这次事件把一个很多人还没真正意识到的风险讲透了:当大模型的自然语言输出被直接接到“能动钱”的系统上,问题就不再是聊天机器人出错,而是金融级事故。
当人们开始把"我该怎么办"交给AI,AI的责任就不再只是回答问题,而是不能轻易把人的人生推向错误方向。Anthropic最新研究揭示,大模型正在进入人的生活决策层。
Anthropic发布Claude Code 2.0重大升级,引入实时任务追踪侧边栏、集成终端与"Routines"自动化功能,全面重塑AI编程工作流。OpenAI则推出GPT-5.4-Cyber网络安全专用模型,提供分层访问控制与漏洞检测能力,正面回应Mythos引发的全球安全焦虑。Claude Opus 4.7在SWE-bench Verified上达到87.6%,但Anthropic明确表示其能力不及未公开的Mythos。北京亦庄人形机器人半马昨日开赛,荣耀"闪电"以50分26秒夺冠,超百支队伍参赛创历史新高。