标签: AI安全

0

顶级围棋 AI 也会掉进“圈套”:从 KataGo 看智能系统的最坏情况评测

KataGo 是最强的开源围棋系统之一,沿用了策略—价值网络与蒙特卡洛树搜索结合的路线,并通过丰富的辅助目标、规则支持和高效自我对弈训练,把公开可用的围棋 AI 推到远超普通职业棋手的水平。然而,近年的对抗研究表明,超人平均棋力并不等于稳健。研究者训练出的对抗策略可以诱使 KataGo 对一个环形棋块作出错误判断,在强搜索配置下仍取得超过 97% 的胜率;无搜索时胜率超过 99%,训练攻击者所用计算量低于训练原模型的 14%。

0

AI技术每日分析-20260506

美国政府扩大前沿AI安全审查,Microsoft、Google DeepMind、xAI与商务部CAISI签署协议,在模型公开发布前进行国家安全测试,已完成40+次评估。Anthropic联合Blackstone、Goldman Sachs等华尔街巨头成立15亿美元AI原生企业服务公司,被称为"AI版麦肯锡"。OpenAI敲定100亿美元"The Deployment Company"合资企业,两大AI巨头同时进军企业服务市场。特朗普政府在Mythos安全担忧后从放松监管转向加强审查。多家出版商起诉Meta AI训练侵权。

0

Grok 被一句“摩尔斯电码”骗走 17.5 万美元,这次事故到底是怎么发生的?

2026年5月,一名攻击者通过摩尔斯电码形式的提示注入,让 Grok 输出了一条转账指令,随后 Bankrbot 将这条文本当成真实授权执行,转走了约 17.5 万美元的 DRB 代币。虽然资金随后被归还,但这次事件把一个很多人还没真正意识到的风险讲透了:当大模型的自然语言输出被直接接到“能动钱”的系统上,问题就不再是聊天机器人出错,而是金融级事故。

0

AI技术每日分析-20260420

Anthropic发布Claude Code 2.0重大升级,引入实时任务追踪侧边栏、集成终端与"Routines"自动化功能,全面重塑AI编程工作流。OpenAI则推出GPT-5.4-Cyber网络安全专用模型,提供分层访问控制与漏洞检测能力,正面回应Mythos引发的全球安全焦虑。Claude Opus 4.7在SWE-bench Verified上达到87.6%,但Anthropic明确表示其能力不及未公开的Mythos。北京亦庄人形机器人半马昨日开赛,荣耀"闪电"以50分26秒夺冠,超百支队伍参赛创历史新高。