Skip to main content
QUICK REVIEW

[論文レビュー] CROP: Certifying Robust Policies for Reinforcement Learning through Functional Smoothing

Fan Wu, Linyi Li|arXiv (Cornell University)|Jun 17, 2021
Adversarial Robustness in Machine Learning参考文献 70被引用数 4
ひとこと要約

CROPは、関数平滑化を用いた最初の統合的フレームワークを提示し、強化学習におけるロバストネスを証明する。2つの認証基準を導入する:状態別アクション安定性と累積報酬の下限。局所的およびグローバルな平滑化アルゴリズムを用いて理論的根拠に基づくロバストネス保証を提供し、Atari、Highway、CartPoleの複数の環境およびアルゴリズム(敵対的訓練や正則化RL手法を含む)できわめてきつい認証を実現した。

ABSTRACT

As reinforcement learning (RL) has achieved great success and been even adopted in safety-critical domains such as autonomous vehicles, a range of empirical studies have been conducted to improve its robustness against adversarial attacks. However, how to certify its robustness with theoretical guarantees still remains challenging. In this paper, we present the first unified framework CROP (Certifying Robust Policies for RL) to provide robustness certification on both action and reward levels. In particular, we propose two robustness certification criteria: robustness of per-state actions and lower bound of cumulative rewards. We then develop a local smoothing algorithm for policies derived from Q-functions to guarantee the robustness of actions taken along the trajectory; we also develop a global smoothing algorithm for certifying the lower bound of a finite-horizon cumulative reward, as well as a novel local smoothing algorithm to perform adaptive search in order to obtain tighter reward certification. Empirically, we apply CROP to evaluate several existing empirically robust RL algorithms, including adversarial training and different robust regularization, in four environments (two representative Atari games, Highway, and CartPole). Furthermore, by evaluating these algorithms against adversarial attacks, we demonstrate that our certification are often tight. All experiment results are available at website https://crop-leaderboard.github.io.

研究の動機と目的

  • 強化学習における理論的ロバストネス認証の欠如、特に敵対的摂動下での逐次的意思決定に対して、それを解決すること。
  • 1ステップの予測を越えた意味のあるロバストネス基準を定義すること。アクション安定性と累積報酬の耐性に焦点を当てる。
  • Q学習ベースのエージェントにおけるアクションと報酬の両方のロバストネスに対して、証明可能な保証を提供するスケーラブルで統合された認証フレームワークを開発すること。
  • 既存の経験的ロバストな強化学習アルゴリズムの認証可能なロバストネスを、敵対的攻撃下で実証的に評価・比較すること。
  • 認証が状態空間における脆弱性のパターンを明らかにでき、よりロバストな方策の設計を支援できることを示すこと。

提案手法

  • 2つの認証基準を提案:局所的平滑化による状態別アクション安定性と、グローバルおよび局所的平滑化による有限時限の累積報酬の下限。
  • CROP-GReを導入。これは、全軌道にわたるノイズ列を用いて累積報酬の期待値または百分位数の下限を推定するグローバル平滑化手法。
  • CROP-LoReを開発。これは、アクション空間における反復的探索を通じて、累積報酬のきわめてきつい下限を認証する適応的局所的平滑化アルゴリズム。
  • Q関数に確率的平滑化を適用し、アクションが変化しない範囲の摂動半径を証明的に導出することで、状態レベルでのロバストネスを保証する。
  • 決定論的検証とは対照的に、確率的認証を用いることで、より広範な適用可能性ときつい下限を実現する。
  • CROP-LoReでは、累積報酬の下限を改善するための適応的探索を用い、グローバル平滑化手法と比較してよりきつい下限を達成する。

実験結果

リサーチクエスチョン

  • RQ1有界な摂動下で、強化学習におけるアクションと累積報酬の両方のロバストネスを形式的にどのように認証できるか。
  • RQ2逐次的意思決定設定において、計算効率と下限のきつさの両立を図る有効な認証技術は何か。
  • RQ3既存の経験的ロバストな強化学習アルゴリズムの認証可能なロバストネスは、異なる環境や方策アーキテクチャにおいてどのように変動するか。
  • RQ4状態別ロバストネス認証は、状態空間における周期的または構造的脆弱性を明らかにでき、標的型防御改善に役立つか。
  • RQ5敵対的攻撃下での経験的性能と比較して、累積報酬の認証下限はどの程度きついのか。

主な発見

  • CROPは、強化学習における累積報酬のロバストネスを認証する最初のフレームワークを提供し、グローバル平滑化手法よりもきつい、新規の下限認証を実現した。
  • CROP-LoReは、CROP-GReと比較して累積報酬の下限を著しくきつくなった。これは、適応的局所的平滑化の有効性を示している。
  • Freeway環境では、RadialRLが最も認証可能なロバスト性を示した。これは、認証が防御戦略の比較に有用であることを示している。
  • 状態別認証により、Pongでは周期的なロバストネスパターンが明らかになり、特定の状態が本質的に脆弱であることが判明。これにより、標的型防御改善が可能になった。
  • 敵対的攻撃下での経験的評価により、CROPの認証下限がしばしばきつかったことが確認され、理論的保証の実用的妥当性が裏付けられた。
  • フレームワークは4つの環境で9つの経験的ロバストな強化学習アルゴリズムを評価し、認証可能なロバストネスがアルゴリズム設計と環境ダイナミクスの両方に依存することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。