Skip to main content
QUICK REVIEW

[論文レビュー] On the Robustness of Safe Reinforcement Learning under Observational Perturbations

Zuxin Liu, Zijian Guo|arXiv (Cornell University)|May 29, 2022
Cardiac electrophysiology and arrhythmias被引用数 9
ひとこと要約

本稿は、安全な強化学習(RL)ポリシーが観測的敵対的摂動に対してどれほど脆弱であるかを調査し、危険な安全性の欠如を露呈する2つの新しい攻撃手法—コスト最大化と報酬最大化—を提案する。これらの攻撃を用いたロバストな訓練フレームワークを導入し、複数の連続的制御環境において敵対的条件下でも制約の満たされやすさが向上することを示している。

ABSTRACT

Safe reinforcement learning (RL) trains a policy to maximize the task reward while satisfying safety constraints. While prior works focus on the performance optimality, we find that the optimal solutions of many safe RL problems are not robust and safe against carefully designed observational perturbations. We formally analyze the unique properties of designing effective observational adversarial attackers in the safe RL setting. We show that baseline adversarial attack techniques for standard RL tasks are not always effective for safe RL and propose two new approaches - one maximizes the cost and the other maximizes the reward. One interesting and counter-intuitive finding is that the maximum reward attack is strong, as it can both induce unsafe behaviors and make the attack stealthy by maintaining the reward. We further propose a robust training framework for safe RL and evaluate it via comprehensive experiments. This paper provides a pioneer work to investigate the safety and robustness of RL under observational attacks for future safe RL studies. Code is available at: \url{https://github.com/liuzuxin/safe-rl-robustness}

研究の動機と目的

  • 安全なRLポリシーが観測的敵対的摂動に対してどれほど脆弱であるか、特に安全が重要な応用において調査すること。
  • 標準的なRLに適用される既存の敵対的攻撃手法が、制約違反が深刻な安全なRLに適用された場合に、なぜ不十分であるかを特定すること。
  • 安全なRLに特化した効果的な敵対的攻撃者を設計し、不正な行動を誘発しながらも、隠れることを可能にするか、またはコストを最大化すること。
  • 最悪の観測摂動に対して耐性を持つポリシーを学習できるロバストな訓練フレームワークを開発すること。
  • 提案手法の有効性を、複数の安全なRLアルゴリズムと環境で検証し、制約の満たされやすさにおけるロバスト性の向上を示すこと。

提案手法

  • 安全なRLのための2つの新しい敵対的攻撃戦略を提案する:(1) 制約違反を直接増加させるコスト最大化(MC)と、(2) 高報酬の危険な行動を誘発する報酬最大化(MR)。
  • ポリシー最適化中にMCおよびMR攻撃を用いたロバストな訓練フレームワークを導入し、エージェントが最悪の摂動に対して耐性を持つポリシーを学習できるようにする。
  • MCとMRの目的関数の線形結合を用いたミックスドアタッカーを採用し、多様な敵対的状況下でのロバストネスを評価する。
  • SAC-Lagrangian、FOCOPS、CVPOに敵対的訓練を適用し、提案された攻撃を用いてポリシーおよび価値ネットワークを更新することで、より高いロバストネスを実現する。
  • 理論的分析により、提案された攻撃下でのベルマン作用素の収縮性を示し、学習プロセスの収束性と安定性を裏付ける。
  • ハイパーパrameter重み付きミックスドアタッカー(w × MC + (1−w) × MR)を用いて、攻撃強度や報酬・コスト目的のトレードオフに応じたロバストネスを評価する。

実験結果

リサーチクエスチョン

  • RQ1安全なRLポリシーは、特に制約違反の観点から、観測的敵対的摂動に対してどれほど脆弱であるか?
  • RQ2標準的な敵対的攻撃手法(例:報酬最小化)が、安全なRLの文脈ではなぜ効果的でないか、あるいは不十分であるのか?
  • RQ3報酬最大化攻撃は、コスト最大化攻撃よりも不正な行動を誘発する上でより効果的であり、かつ隠れやすいのか?
  • RQ4提案された攻撃を用いた敵対的訓練により、最悪の摂動下でも制約の満たされやすさのロバストネスが向上するか?
  • RQ5混合敵対的攻撃下で、異なる安全なRLアルゴリズムや環境におけるロバストに訓練されたポリシーの性能は、どのように比較されるか?

主な発見

  • 安全なRL問題の最適解は、クリーンな環境では安全制約を満たしているものの、観測的敵対的摂動に対して脆弱であることが判明した。
  • 最大報酬攻撃(MR)は、不正な行動を誘発するのに非常に効果的であり、高いタスク報酬を維持するため、検出が困難であるという点で隠れやすい。
  • ヴァニラな安全RLエージェント(例:SAC-Lagrangian、FOCOPS、CVPO)は、MCおよびMR攻撃の下で著しい制約違反を示し、Car-Circleでは最大112.53、Car-Runでは184.22のコスト上昇を示した。
  • 敵対的訓練を施したポリシー(ADV-PPOL、ADV-CVPO)は、MCおよびMR攻撃下でもほぼゼロのコスト(例:0.02–0.08)を維持しながら高い報酬を得ており、ロバストネスを示している。
  • ミックスドアタッカー(MC:MR = 1:1)はヴァニラポリシーの性能を一貫して低下させるが、ロバストに訓練されたエージェントは安定したまま安全であるため、攻撃タイプに一般化できることを示している。
  • α=0.01のCar-Run環境では、ADV-PPOL(MR)エージェントはMR攻撃下で557.07 ± 3.05の報酬と0.02 ± 0.13のコストを達成したのに対し、ヴァニラなPPOLは624.68 ± 8.85の報酬を達成したが、コストは184.22 ± 0.45に上昇した。これは、非ロバストなポリシーにおける報酬と安全性のトレードオフを明確に示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。