Skip to main content
QUICK REVIEW

[論文レビュー] Counterfactual Control for Free from Generative Models

Nicholas Guttenberg, Yen Yu|arXiv (Cornell University)|Feb 22, 2017
Reinforcement Learning in Robotics参考文献 1被引用数 3
ひとこと要約

本論文では、行動-状態軌道の生成モデルの潜在空間における勾配降下を用いて、再訓練を伴わずに任意の報酬関数を最適化することで、実行時における制御方策を導出する手法を提案する。主な貢献は、1つの事前学習済み生成モデルを用いて動的目標適合と反事後的計画を可能にすることであり、CartPoleで移動するターゲットのバランスと追跡に成功した。これは、タスクに直接訓練されていないにもかかわらず実現された。

ABSTRACT

We introduce a method by which a generative model learning the joint distribution between actions and future states can be used to automatically infer a control scheme for any desired reward function, which may be altered on the fly without retraining the model. In this method, the problem of action selection is reduced to one of gradient descent on the latent space of the generative model, with the model itself providing the means of evaluating outcomes and finding the gradient, much like how the reward network in Deep Q-Networks (DQN) provides gradient information for the action generator. Unlike DQN or Actor-Critic, which are conditional models for a specific reward, using a generative model of the full joint distribution permits the reward to be changed on the fly. In addition, the generated futures can be inspected to gain insight in to what the network 'thinks' will happen, and to what went wrong when the outcomes deviate from prediction.

研究の動機と目的

  • 報酬仕様と方策学習を分離する制御フレームワークの開発。これにより、動的目標適合が可能になる。
  • 行動状態軌道の生成モデルが想起する反事後的未来に基づいて、エージェントが計画と行動選択を行う仕組みの実現。
  • 1つの生成モデルが再訓練なしに複数の未知のタスクに対応できることの実証。
  • 行動と将来状態の共同生成モデリングが、タスク特化モデルよりもより強固で汎用性の高い制御を可能にするかどうかの探求。

提案手法

  • 本手法は、相互作用データから $p(future, action | state)$ の同時分布を学習するための再帰的変分オートエンコーダ(RVAE)を用いる。
  • 制御方策は、RVAEの潜在空間における勾配降下を用いて、生成された反事後的未来における望ましい報酬関数を最大化することで導出される。
  • 報酬関数は生成された将来の軌道上で直接評価され、生成モデルを介して逆伝播により行動系列が更新される。
  • 本手法は、行動-状態系列の内部整合性と妥当性を保証するため、完全な同時分布を活用する。
  • モデルは一度環境相互作用データで学習され、以降は潜在空間探索により任意の報酬関数をサポートできる。
  • 別個の報酬ネットワークや方策ヘッドの学習を回避し、勾配推定には生成モデルの内部ダイナミクスに依存する。

実験結果

リサーチクエスチョン

  • RQ1訓練時に見未曾有のタスクが含まれていなくても、1つの行動-状態軌道生成モデルを用いて再訓練なしに任意の報酬関数に対する制御方策を導出可能か?
  • RQ2本モデルは、トレーニング時に見なかった新しいタスク、例えば移動するターゲットの追跡に一般化可能か?
  • RQ3特に潜在空間次元数に関して、本手法はどの程度ハイパーパrameterに敏感か?
  • RQ4本モデルは、効果的な計画と制御を可能にする内部的に整合性のある反事後的未来を生成可能か?

主な発見

  • モデルは125エピソードにわたり原点でのポールのバランスを安定して維持し、反事後的計画を用いた安定した制御を示した。
  • 訓練後、エージェントは $x(t) = A\sin(2\pi t/T)$ で表される時間変化するターゲット位置を複数周期にわたり追跡できた。これは訓練目的に含まれていなかった。
  • 移動ターゲットの試行では、最大5000ステップにわたりバランスを維持し、さまざまな振幅と周期に対して、1周期分以上の平均保持時間が達成された。
  • 非常に短い周期(T < 250)では性能が低下し、エージェントがターゲットを追跡できなくなった。これは時間的追跡速度の限界を示している。
  • 潜在空間次元数 $N_L$ が最も重要なハイパーパrameterであった。空間が大きすぎる場合、現実的でない将来予測を悪用することでバランスが崩れた。
  • 平均して100エピソード以内にタスクを達成した。最速の解法は約35エピソードで達成され、最先端のDQNおよびDQNベースのエージェントと同等の性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。