Skip to main content
QUICK REVIEW

[論文レビュー] The Differentiable Cross-Entropy Method

Brandon Amos, Denis Yarats|arXiv (Cornell University)|Sep 27, 2019
Reinforcement Learning in Robotics参考文献 98被引用数 7
ひとこと要約

本稿では、非凸で連続的な最適化に対して勾配逆伝播を可能にする、微分可能かつ滑らかな top-k 操作を用いた、交差エントロピー法(CEM)の微分可能変種である微分可能交差エントロピー法(DCEM)を提案する。DCEM により、モデルベース強化学習における CEM に基づく制御系のエンドツーエンド学習が可能となり、PPO を用いた方策最適化を実現し、サンプルの複雑さを1桁低減しながらほぼ最適性能を達成する。

ABSTRACT

We study the cross-entropy method (CEM) for the non-convex optimization of a continuous and parameterized objective function and introduce a differentiable variant that enables us to differentiate the output of CEM with respect to the objective function's parameters. In the machine learning setting this brings CEM inside of the end-to-end learning pipeline where this has otherwise been impossible. We show applications in a synthetic energy-based structured prediction task and in non-convex continuous control. In the control setting we show how to embed optimal action sequences into a lower-dimensional space. DCEM enables us to fine-tune CEM-based controllers with policy optimization.

研究の動機と目的

  • 非凸的かつ連続的な設定における交差エントロピー法(CEM)を用いたエンドツーエンド微分可能最適化を可能にすること。
  • 最大尤度学習と制御目的の間に生じる目的不一致問題を解消すること。
  • PPO などの方策最適化手法を用いて CEM に基づく制御系の微調整を可能にすること。
  • 連続制御における計算コストとメモリコストを低減するため、行動シーケンスを低次元空間に埋め込むこと。
  • 最適化ベースの機械学習部品におけるアンロールド勾配降下の代替としての微分可能代替を提供すること。

提案手法

  • Amos ら(2019)のスムーズな top-k 操作を用いることで、argmin 操作を微分可能にした CEM の微分可能変種 DCEM を提案する。
  • パラメータ θ でパラメータ化された関数 f_θ(x) に対する非凸最適化問題 $\hat{x} = \arg\min_x f_\theta(x)$ の近似解法として DCEM を適用する。
  • DCEM 制御系を微分可能な方策クラス $\pi_\theta(x_{\text{init}})$ として用い、PPO などの方策最適化パイプラインへの統合を可能にする。
  • 潜在空間デコーダ $f^{\text{dec}}$ を用いて潜在コードを行動シーケンスに変換し、DCEM を用いてデコーダのエンドツーエンド最適化を実現する。
  • モデル部品(デコーダ、報酬、遷移モデル)を最大尤度で学習した後、制御性能の向上を図るために PPO を用いて微調整する。
  • DCEM を用いたオンライン学習により、微分可能性を維持し、連続制御タスクにおけるリアルタイム適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1交差エントロピー法を微分可能にすることで、非凸最適化におけるエンドツーエンド学習を可能にすることができるか?
  • RQ2エネルギーベース学習において、DCEM はアンロールド勾配降下よりも一般化性とロバスト性に優れているか?
  • RQ3DCEM を用いて行動シーケンスを低次元空間に埋め込むことで、連続制御における計算コストを低減できるか?
  • RQ4PPO などの方策最適化手法は、最大尤度で学習された CEM に基づく制御系を効果的に微調整できるか?
  • RQ5DCEM はモデルベース強化学習における目的不一致問題を緩和するか?

主な発見

  • DCEM は、連続制御において、1,000 本の軌道サンプルで十分であり、100,000 本のサンプルを必要とする従来手法と比較して、1桁のサンプル数削減を達成しながらほぼ最適性能を実現した。
  • エネルギーベース学習において、DCEM はアンロールド勾配降下に比べてより現実的で整合性のあるエネルギー表面を生成した。アンロールド勾配降下は勾配ステップ数に過剰に適合する傾向があった。
  • PPO の微調整により、DCEM と完全 CEM の間の性能ギャップが顕著に縮小され、効果的な方策改善が確認された。
  • DCEM により、CEM に基づく制御系のエンドツーエンド学習が可能となり、モデルベースの部品を方策最適化パイプラインに統合できるようになった。
  • 本手法は、学習目的と制御性能を一致させることで、目的不一致問題を効果的に解決した。
  • 潜在行動空間の埋め込みにより、DCEM は低メモリ・低計算コストの微分可能モデルベース制御を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。