Skip to main content
QUICK REVIEW

[論文レビュー] Robust Deep Reinforcement Learning through Bootstrapped Opportunistic Curriculum

Junlin Wu, Yevgeniy Vorobeychik|arXiv (Cornell University)|Jun 21, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、各カリキュラム段階を複数の過去の実行で最も高い性能を示したモデルでブートストラップし、すでに耐性が確保されている場合には機会的(オポチュニスティックに)高い摂動レベルに飛ばすことで、深層強化学習(DRL)におけるロバストネスを向上させる、新たな敵対的カリキュラムフレームワーク「Bootstrapped Opportunistic Curriculum Learning(BCL)」を提案する。BCLは最先端のロバストネスを達成し、Pongではε=25/255までの敵対的摂動に耐えられるようになる。これは、ε=5/255を超えると失敗してしまう従来手法に比べて顕著に優れている。

ABSTRACT

Despite considerable advances in deep reinforcement learning, it has been shown to be highly vulnerable to adversarial perturbations to state observations. Recent efforts that have attempted to improve adversarial robustness of reinforcement learning can nevertheless tolerate only very small perturbations, and remain fragile as perturbation size increases. We propose Bootstrapped Opportunistic Adversarial Curriculum Learning (BCL), a novel flexible adversarial curriculum learning framework for robust reinforcement learning. Our framework combines two ideas: conservatively bootstrapping each curriculum phase with highest quality solutions obtained from multiple runs of the previous phase, and opportunistically skipping forward in the curriculum. In our experiments we show that the proposed BCL framework enables dramatic improvements in robustness of learned policies to adversarial perturbations. The greatest improvement is for Pong, where our framework yields robustness to perturbations of up to 25/255; in contrast, the best existing approach can only tolerate adversarial noise up to 5/255. Our code is available at: https://github.com/jlwu002/BCL.

研究の動機と目的

  • 深層強化学習(DRL)のポリシーが、状態観測値における小さな敵対的摂動に対して極めて脆弱であるという問題に取り組むこと。
  • 従来の敵対的訓練や単純なカリキュラムアプローチには、より大きな摂動に耐えうるロバストネスをスケーリングできないという限界があるため、それを克服すること。
  • 名目性能を損なわせることなく、柔軟で適応的なカリキュラムフレームワークを構築すること。
  • 構造的で段階的なカリキュラム進行を通じて、DRLエージェントが次第に深刻化する敵対的攻撃に対して一般化できるようにすること。

提案手法

  • フレームワークは、前段階の複数回の敵対的訓練実行で得られた最高性能のモデルを次段階の開始点として選ぶ、ブートストラップされたカリキュラム段階を採用する。
  • 現在のモデルが特定の摂動レベルに対してロバストであると確認された場合にのみ、そのレベルに飛躍的に進む機会的(オポチュニスティック)なスキップ機構を導入する。
  • 敵対的例は、区間境界伝搬とFGSMベースの攻撃を組み合わせたハイブリッドアプローチによって生成され、カリキュラムの進行を導く。
  • カリキュラムは、小さなεから始まり、段階的に摂動の大きさを増加させる構造となっており、ロバストネスが確認された段階でのみ次に進む。
  • 各段階で複数回の訓練を実行することで、高品質な初期化が可能となり、モデル性能のばらつきが低減される。
  • 本手法は、DQNスタイルのアーキテクチャを用いて、Atari環境(Pong、Freeway、BankHeist、RoadRunner)で評価され、名目報酬への影響は最小限に抑えられている。

実験結果

リサーチクエスチョン

  • RQ1標準的な敵対的訓練と比較して、カリキュラム学習フレームワークが、より大きな敵対的摂動に対してDRLポリシーのロバストネスを顕著に向上させられるか?
  • RQ2複数回の実行で得られた最高性能のモデルを用いた各カリキュラム段階のブートストラップが、ロバストネスと訓練の安定性を向上させるか?
  • RQ3カリキュラムの前進を機会的(オポチュニスティック)にスキップすることで、訓練時間を短縮しながらもロバストネスを維持または向上させられるか?
  • RQ4BCLフレームワークは、RADIAL-DQN や SA-DQN といった最先端手法と比較して、摂動の大きさが増すに従い、どのようにロバストネスを発揮するか?
  • RQ5BCLフレームワークは、多様なAtari環境において、優れたロバストネスを達成しつつ、高い名目性能をどの程度維持できるか?

主な発見

  • Pongでは、BCLで訓練されたポリシーが、ε=25/255までの敵対的摂動に対してもロバストな性能を示す。これは、従来の最先端手法(RADIAL-DQN)がε=5/255で失敗するのと比べて顕著な改善である。
  • BankHeistでは、SA-DQNと比較して、ε=15/255で1桁以上も高いロバストネスを達成しており、攻撃下での一般化性能に優れていることが示された。
  • RoadRunnerでは、ε=15/255でRADIAL-DQNを数個のオーダーも上回っており、ロバストなポリシー学習における顕著な向上が確認された。
  • BCLフレームワークは、すべての環境で強い名目性能を維持しており、標準DQN訓練と比較してほとんど劣化がない。
  • 機会的(オポチュニスティック)スキップ機構により、不要な段階を回避することで訓練時間を短縮した。一方、ブートストラップされた初期化により、全実行で一貫した性能向上が得られた。
  • 複数回の実行と複数の環境にわたり、ロバストネス指標のばらつきが低く、一貫した改善が得られており、信頼性の高さが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。