Skip to main content
QUICK REVIEW

[論文レビュー] Provably Robust Blackbox Optimization for Reinforcement Learning

Krzysztof Choromański, Aldo Pacchiano|arXiv (Cornell University)|Mar 7, 2019
Reinforcement Learning in Robotics参考文献 36被引用数 11
ひとこと要約

この論文は、関数評価の最大23%が任意に破損しても高い精度を達成できる、証明可能に頑健な勾配フリー最適化手法であるRBO(Robust Blackbox Optimization)を導入する。RBOは、頑健な回帰とオフポリシー勾配推定を組み合わせることで、標準的手法が失敗するノイズの多い環境でも効果的なポリシー学習を可能にする。

ABSTRACT

Interest in derivative-free optimization (DFO) and "evolutionary strategies" (ES) has recently surged in the Reinforcement Learning (RL) community, with growing evidence that they can match state of the art methods for policy optimization problems in Robotics. However, it is well known that DFO methods suffer from prohibitively high sampling complexity. They can also be very sensitive to noisy rewards and stochastic dynamics. In this paper, we propose a new class of algorithms, called Robust Blackbox Optimization (RBO). Remarkably, even if up to $23\%$ of all the measurements are arbitrarily corrupted, RBO can provably recover gradients to high accuracy. RBO relies on learning gradient flows using robust regression methods to enable off-policy updates. On several MuJoCo robot control tasks, when all other RL approaches collapse in the presence of adversarial noise, RBO is able to train policies effectively. We also show that RBO can be applied to legged locomotion tasks including path tracking for quadruped robots.

研究の動機と目的

  • 強化学習における勾配フリー最適化(DFO)および進化的戦略(ES)が直面する高いサンプリング複雑性とノイズへの感受性を解消すること。
  • ロボット工学で一般的なノイズの多い報酬と確率的ダイナミクスにおいて、既存のブラックボックス最適化手法の脆さを克服すること。
  • 重要な割合の測定値が敵対的に破損しても高い性能を維持できる手法を開発すること。
  • 過去のサンプルを再利用する手法と頑健な回帰技術を用いて、効率的なオフポリシー勾配推定を実現すること。
  • 提案手法の有効性をMuJoCoベンチマークタスクおよび実世界の四足歩行制御タスクの両方で実証すること。

提案手法

  • ガウススムージングと行列値カーネルを用いて勾配場を補間する正則化回帰問題として勾配推定を定式化する。
  • 過去のロールアウトを再利用することでオフポリシー学習を導入し、局所的な連続勾配場を推定することで、サンプリング複雑性を低減する。
  • LPデコーディングを用いた頑健な回帰により、関数評価に最大23%の任意の破損があっても、正確な勾配再構成を実現する。
  • 圧縮センシングと誤り訂正符号の原理を用いて、測定値における敵対的ノイズに対する証明可能な頑健性を確保する。
  • 正則化を施したカーネル回帰フレームワークを実装することで、ノイズ下での推定安定性を高める。
  • 進化的戦略フレームワークに頑健な勾配推定器を統合し、強化学習におけるポリシー最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1強化学習の勾配フリー最適化手法は、関数評価の最大23%が任意に破損しても高い性能を維持できるか?
  • RQ2過去のロールアウトをオフポリシーで再利用することで、ポリシー学習のブラックボックス最適化におけるサンプル効率がどのように向上するか?
  • RQ3LPデコーディングのような頑健な回帰技術は、敵対的ノイズ下でどれほど正確な勾配推定を保証できるか?
  • RQ4提案手法は、ノイズの多いMuJoCoタスクおよび実世界の四足歩行タスクにおいて、最先端のESおよびポリシー勾配アルゴリズムを上回るか?
  • RQ5RBOは、本質的にノイズの多い報酬信号を持つ実世界のロボット工学アプリケーションでも安定したポリシー学習を可能にするか?

主な発見

  • RBOは、20%の報酬が著しく破損しても、ARL、TRPO、PPOといった他の手法が失敗または負の報酬を達成する中で、全8つのMuJoCoタスクでポリシーの学習に成功した。
  • HalfCheetah(Linear)タスクでは、RBOは20万回のロールアウト後に中央値報酬4220を達成したが、ARSは4205、TRPOとPPOは完全に失敗(-Infとして報告)した。
  • Swimmer環境では、RBOの中央値報酬は360であったのに対し、TRPOとPPOはそれぞれ32および30にとどまり、ARSは学習に失敗した。
  • Walker2dでは、RBOは200万回のロールアウト後に中央値報酬2230を達成し、ARS(172)、TRPO(996)、PPO(312)を上回った。
  • Humanoidタスクでは、20%のノイズ下でもRBOは中央値報酬4865を達成し、ARS(2355)、TRPO(2028)、PPO(2129)を大きく上回った。
  • 四足歩行タスク(Minitaur)では、RBOは25%のノイズのある測定値下でも、前進走行および経路追従タスクの両方で優れた性能を維持し、ARSを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。