
本文选自 Horizon 2026年9月4日技术简报。
赢过人类不等于理解所有局面
KataGo 是最强的开源围棋系统之一,沿用了策略—价值网络与蒙特卡洛树搜索结合的路线,并通过丰富的辅助目标、规则支持和高效自我对弈训练,把公开可用的围棋 AI 推到远超普通职业棋手的水平。然而,近年的对抗研究表明,超人平均棋力并不等于稳健。研究者训练出的对抗策略可以诱使 KataGo 对一个环形棋块作出错误判断,在强搜索配置下仍取得超过 97% 的胜率;无搜索时胜率超过 99%,训练攻击者所用计算量低于训练原模型的 14%。
2026 年的人机让子比赛再次把这一问题带入公众视野。申真谞在受让两子的三番棋中以 2 比 1 获胜,其中一局经过 221 手、约 3 小时 5 分钟,以 11.5 目结束。需要强调的是,让两子给人类提供了巨大先手优势,这不能证明人类在分先条件下重新超过 AI。技术价值在另一处:顶尖棋手可以围绕复杂局部变化和非典型全局结构组织策略,测试 AI 在分布边缘的判断是否可靠。
KataGo 的强大来自哪里
现代围棋 AI 通常由神经网络和 MCTS 组成。策略头给出候选落子的先验概率,价值头估计当前局面的胜率或得分,搜索树通过多次模拟在探索与利用之间平衡。网络缩小搜索空间,搜索纠正网络的局部误差,两者形成互补。KataGo 还引入得分预测、所有权预测等辅助任务,提高训练效率和不同贴目、规则条件下的泛化。
这种架构在常规分布上极其有效。自我对弈产生的大量局面与比赛局面高度相关,网络学会识别常见棋形,MCTS 在高概率分支上投入算力。问题是围棋合法状态空间极大,19×19 棋盘有 361 个交叉点,可能局面的数量远超任何训练集。若某类合法结构在自我对弈中极少出现,价值网络可能形成系统性盲点;搜索又依赖网络引导,不一定能在有限模拟次数内跳出错误先验。
环形攻击正利用了这种耦合。对手诱导 KataGo 形成一个看似安全的大环形棋块,再从外部逐步包围。网络长期高估该棋块的生存状态,搜索因此把算力投向其他区域,等到价值估计突然修正时已经来不及。攻击者自身棋力并不需要达到顶级水平,它只需稳定地把受害模型带入错误区域。这与图像分类中添加微小扰动不同:棋盘每一步都是合法且语义明确的动作,漏洞表现为长时序策略失效。
为什么增加搜索量仍未必解决问题
直觉上,MCTS 模拟越多,系统越应该发现大龙会被吃。但搜索不是无偏穷举。361 路选择随棋局推进形成指数级树,哪怕每步进行数百万次模拟,也只覆盖极小部分。策略先验决定哪些分支得到访问,价值估计决定叶节点好坏。如果两者在同一类局面上共同偏置,更多搜索可能只是更精细地确认错误结论。
研究中甚至把每步搜索提高到约 1000 万次访问,攻击仍然能够奏效。这说明“算力换可靠性”存在边界。搜索确实会降低普通错误率,但最坏情况可能被策略性对手主动寻找。对于部署系统,平均基准从 99.0% 提高到 99.9%,不能替代对失败模式的结构化探索。
后续研究还发现,简单防御通常只能堵住已知攻击。KataGo 的训练加入针对循环局面的对抗样本后,旧攻击成功率下降,新的攻击策略又能找到不同漏洞。AAAI 相关工作报告,某些新对抗者对 2023 年末模型仍可取得很高胜率。这并不意味着对抗训练无效,而是说明覆盖有限模板与获得开放环境鲁棒性之间存在巨大距离。
比赛胜率不是充分的安全指标
评测博弈 AI 可以分成四个层次。第一层是总体实力,用 Elo、对固定版本胜率和人类比赛衡量。第二层是分布外泛化,测试不同规则、贴目、棋盘大小、罕见定式和人为构造局面。第三层是对抗鲁棒性,让攻击者针对冻结模型训练,主动寻找可重复失败。第四层是可恢复性:系统识别不确定状态、增加搜索、切换模型或请求人工介入后,能否避免灾难性决策。
还应把“局面正确率”与“策略可利用性”区分开。模型在一万个随机局面中只错十个,看似达到 99.9%;若攻击者能把对局稳定引导到这十类局面,实际防御能力可能接近零。工业视觉、自动驾驶、网络防御和智能体系统也有同样规律。随机测试衡量自然错误,对抗测试衡量错误能否被组织成路径。
一种更严格的方法是建立红队联赛。攻击者不知道生产模型的全部参数,但可以通过接口对弈或查询;防守方定期更新,攻击者必须在计算预算和查询预算内找到策略。评测报告同时记录自然分布性能、最坏胜率、攻击迁移性、所需查询数与修复后的回归结果。这样才能避免团队只针对公开棋谱打补丁。
从围棋漏洞理解智能体风险
围棋是封闭环境:规则明确、状态完全可见、胜负可计算。即便如此,超人系统仍有可解释而稳定的盲点。现实智能体面对网页、代码库、工厂设备和人类语言,状态不完整,工具会失败,目标还可能互相冲突,鲁棒性挑战更大。
围棋案例至少带来三点启示。其一,能力评测和安全评测必须分开。编码基准、任务成功率高,只说明模型在样本分布上有用。其二,工具调用与长程规划要测试“诱导路径”:攻击者能否用一系列看似正常的局部输入,把智能体带到危险状态。其三,系统需要不确定性出口。当局面偏离训练分布时,应该扩大验证、调用规则检查器、切换保守策略或交由人类,而不是继续以高置信度行动。
在工业智能体中,可把物理约束、工艺规则和安全联锁作为搜索之外的独立防线。模型即使错误估计工况,规则层仍应阻止超温、超压或越权操作。测试集不仅来自历史正常数据,还要通过仿真生成边界状态、冲突指令和长期诱导序列。与 KataGo 一样,单次错误并不可怕,可怕的是存在一条低成本、可重复触发的失败路径。
超人系统需要最坏情况工程
KataGo 的成绩没有因这些漏洞而失去价值。相反,正因为它在常规围棋上足够强,研究者才看清“能力”与“稳健”是两条不同轴线。自我对弈善于提高平均竞技水平,对抗训练善于暴露已知薄弱点,形式化规则和运行时监控则提供底线。没有一种机制可以独自覆盖巨大状态空间。
未来评测强 AI 系统时,应少问一句“它超过了多少人”,多问几句:失败状态能否被主动搜索?攻击能否迁移到新版本?增加算力是否真正降低最坏风险?系统何时知道自己不知道?围棋棋盘把这些问题压缩在 361 个交叉点上,为更复杂的智能体提供了一间珍贵的安全实验室。
参考资料
- Wang 等,Adversarial Policies Beat Superhuman Go AIs,ICML 2023。
- Tseng 等,Can Go AIs Be Adversarially Robust?,AAAI 2025。
- KataGo 官方代码仓库及训练文档。
- GoAttack 项目:对抗策略、棋谱与复现实验。