Skip to main content
QUICK REVIEW

[论文解读] Adversarial Policies Beat Superhuman Go AIs

Tony Tong Wang, Adam Gleave|arXiv (Cornell University)|Nov 1, 2022
Adversarial Robustness in Machine Learning被引用 10
一句话总结

本文提出对抗性策略,利用超级人类水平围棋AI(如KataGo)中的关键脆弱性,通过诱导灾难性错误而非凭借强大棋力,实现超过97%的胜率。这些攻击可零样本迁移至其他顶级围棋AI,且人类专家可复现,揭示即使最先进的系统在平均表现超人类的情况下,仍缺乏最坏情况下的鲁棒性。

ABSTRACT

We attack the state-of-the-art Go-playing AI system KataGo by training adversarial policies against it, achieving a >97% win rate against KataGo running at superhuman settings. Our adversaries do not win by playing Go well. Instead, they trick KataGo into making serious blunders. Our attack transfers zero-shot to other superhuman Go-playing AIs, and is comprehensible to the extent that human experts can implement it without algorithmic assistance to consistently beat superhuman AIs. The core vulnerability uncovered by our attack persists even in KataGo agents adversarially trained to defend against our attack. Our results demonstrate that even superhuman AI systems may harbor surprising failure modes. Example games are available https://goattack.far.ai/.

研究动机与目标

  • 探究超级人类水平围棋AI是否在平均表现强劲的情况下仍存在关键的最坏情况失效模式。
  • 开发针对最先进围棋AI(如KataGo)中特定且非显而易见脆弱性的对抗性策略。
  • 评估这些攻击在其他超级人类围棋AI上的可迁移性,并评估其对人类玩家的实际可行性。
  • 检查对抗性训练是否能有效修补受害模型中发现的漏洞。

提出的方法

  • 使用类似AlphaZero的自我对弈强化学习框架训练对抗性策略,期间在树搜索中使用受害模型(KataGo)选择走法。
  • 通过灰盒访问受害网络指导策略训练,使攻击者能够学习受害模型决策中的可利用弱点。
  • 设计两种不同的攻击策略:一种为'循环对抗者',诱导循环型棋形被吃;另一种为'弃子对抗者',通过过早认输迫使游戏提前结束。
  • 在不同搜索设置下评估攻击效果(例如每步1000万次访问),以测试其在高搜索、超级人类配置下的鲁棒性。
  • 在其他超级人类围棋AI上进行零样本迁移评估,以检验攻击的泛化能力。
  • 通过消融实验和对模型内部激活的分析,理解漏洞的根本原因,特别是与循环拓扑结构及‘活棋’行为相关的机制。

实验结果

研究问题

  • RQ1对抗性策略是否能在不依赖更优棋力的情况下,诱导超级人类水平围棋AI发生灾难性失败?
  • RQ2这些攻击是否可零样本迁移至其他最先进围棋AI,表明存在更广泛的系统性脆弱性?
  • RQ3人类专家是否无需算法辅助即可复现对抗性策略,并稳定击败超级人类水平AI?
  • RQ4KataGo中的核心漏洞是否对对抗性训练具有鲁棒性,暗示其存在根本性设计缺陷?
  • RQ5内部模型动态(如激活模式)如何与可利用弱点(如循环拓扑或‘活棋’问题)的出现相关联?

主要发现

  • 即使KataGo每步使用1000万次蒙特卡洛树搜索访问,对抗性策略仍实现了超过97%的胜率,证实超级人类鲁棒性并非必然。
  • 循环对抗者成功诱导KataGo在循环拓扑结构中损失一大块棋,该失效模式在高强度搜索下依然持续存在。
  • 弃子对抗者利用了Tromp-Taylor规则集中的基于规则的漏洞,诱使KataGo过早认输,最终因地盘规则输掉。
  • 人类专家可手动复现循环对抗者策略,并在无计算辅助的情况下,一致击败多款超级人类围棋AI。
  • 即使在对抗性微调以防御该攻击后,KataGo仍对相同失效模式保持脆弱,表明该缺陷具有结构性,难以通过简单修补解决。
  • 对内部激活的分析揭示,KataGo在处理循环与非循环棋形时表现出截然不同的表示模式,将漏洞与特定模型行为直接关联。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。