Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Policies Beat Superhuman Go AIs

Tony Tong Wang, Adam Gleave|arXiv (Cornell University)|Nov 1, 2022
Adversarial Robustness in Machine Learning被引用数 10
ひとこと要約

この論文は、KataGoなどの超人クラスのゴーアルゴリズムに深刻な脆弱性を突く敵対的ポリシーを導入し、優れた戦術ではなく、壊滅的なミスを引き起こすことで97%を超える勝率を達成している。攻撃は他のトップクラスのゴーアルゴリズムに対してもゼロショットで転送可能であり、人間の専門家によって再現可能であるため、超人クラスの性能を示すにもかかわらず、最悪事態に対する耐性に欠けることが明らかになった。

ABSTRACT

We attack the state-of-the-art Go-playing AI system KataGo by training adversarial policies against it, achieving a >97% win rate against KataGo running at superhuman settings. Our adversaries do not win by playing Go well. Instead, they trick KataGo into making serious blunders. Our attack transfers zero-shot to other superhuman Go-playing AIs, and is comprehensible to the extent that human experts can implement it without algorithmic assistance to consistently beat superhuman AIs. The core vulnerability uncovered by our attack persists even in KataGo agents adversarially trained to defend against our attack. Our results demonstrate that even superhuman AI systems may harbor surprising failure modes. Example games are available https://goattack.far.ai/.

研究の動機と目的

  • 超人クラスのゴーアルゴリズムが優れた平均性能を示すにもかかわらず、深刻な最悪事態の失敗モードを示すかどうかを調査すること。
  • KataGoのような最先端のゴーアルゴリズムに内在する、非自明な脆弱性を突く敵対的ポリシーの開発。
  • これらの攻撃が他の超人クラスのゴーアルゴリズムに転送可能かどうかを評価し、人間プレーヤーにとって実用的かどうかを検証すること。
  • 攻撃で発見された脆弱性を、被害モデルに対して敵対的訓練で効果的に修復できるかどうかを検討すること。

提案手法

  • 敵対的ポリシーの訓練に、AlphaZero風の自己対戦強化学習フレームワークを採用し、木探索中に被害モデル(KataGo)が手を選択する。
  • 被害モデルのネットワークにグレイボックスアクセスを提供し、意思決定における攻撃可能な弱みを学習可能にする。
  • 2種類の異なる攻撃戦略を設計:「サイクル・アドバーサリー」(サイクル構造の団体を捕らえるように誘導)、および「パス・アドバーサリー」(事前のパスによってゲームを早期終了に誘導)。
  • 1手あたり1000万回のモンテカルロ木探索を想定したさまざまな探索設定で攻撃を評価し、高探索・超人クラスの構成に対する耐性を検証。
  • 他の超人クラスのゴーアルゴリズムに対してゼロショット転送評価を実施し、攻撃の一般化能力を評価。
  • 内部モデル活性化のアブレーションと分析を実施し、特にサイクルトポロジーとパス・アライブ行動における脆弱性の根本的要因を解明。

実験結果

リサーチクエスチョン

  • RQ1敵対的ポリシーは、優れた戦術に依存せず、超人クラスのゴーアルゴリズムに壊滅的失敗を引き起こすことができるか?
  • RQ2これらの攻撃は他の最先端のゴーアルゴリズムに対してもゼロショットで転送可能であり、広範なシステム的脆弱性を示唆するか?
  • RQ3人間の専門家はアルゴリズム的支援なしで敵対的戦略を手作業で再現可能であり、超人クラスのAIを一貫して破ることができるか?
  • RQ4KataGoのコアな脆弱性は敵対的訓練に対しても耐性を示し、根本的な設計上の欠陥を示唆するか?
  • RQ5内部モデルダイナミクス(例:活性化パターン)は、サイクルトポロジーまたはパス・アライブ問題のような攻撃可能な弱みの発生とどのように相関するか?

主な発見

  • KataGoが1手あたり1000万回のモンテカルロ木探索を使用しても、敵対的ポリシーは97%を超える勝率を達成した。これは、超人クラスの耐性が保証されないことを確認した。
  • サイクル・アドバーサリーは、サイクルトポロジーにおけるKataGoの大きな団体の損失を成功裏に誘導し、高強度の探索でも失敗モードが持続した。
  • パス・アドバーサリーは、トロムプ=トーラー規則セットのルールベースの脆弱性を突き、KataGoに早期にパスをさせ、領地で負けさせるように誘導した。
  • 人間の専門家は、サイクル・アドバーサリー戦略を手作業で再現し、計算支援なしで複数の超人クラスゴーアルゴリズムに勝利した。
  • 攻撃に対する敵対的ファインチューニングを施しても、KataGoは依然として同じ失敗モードに脆弱であった。これは、欠陥が構造的であり、容易には修復できないことを示唆した。
  • 内部活性化の分析から、KataGoがサイクル的でない団体とサイクル的団体を処理する際の明確なパターンの違いが判明し、脆弱性が特定のモデル行動と関連していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。