[論文レビュー] One-Shot Learning of Manipulation Skills with Online Dynamics Adaptation and Neural Network Priors
本稿では、事前タスクからのニューラルネットワークダイナミクス事前分布と、オンラインでの局所的線形ダイナミクスモデルの適応を組み合わせることで、複雑なロボット操作スキルのワンショット学習を可能にするモデルベース強化学習手法を提案する。タスク実行中にダイナミクスモデルを繰り返し精緻化し、モデル予測制御を用いることで、高いサンプル効率が達成され、接触を伴う困難なタスクを一度の試行で成功させることが可能になった。
One of the key challenges in applying reinforcement learning to complex robotic control tasks is the need to gather large amounts of experience in order to find an effective policy for the task at hand. Model-based reinforcement learning can achieve good sample efficiency, but requires the ability to learn a model of the dynamics that is good enough to learn an effective policy. In this work, we develop a model-based reinforcement learning algorithm that combines prior knowledge from previous tasks with online adaptation of the dynamics model. These two ingredients enable highly sample-efficient learning even in regimes where estimating the true dynamics is very difficult, since the online model adaptation allows the method to locally compensate for unmodeled variation in the dynamics. We encode the prior experience into a neural network dynamics model, adapt it online by progressively refitting a local linear model of the dynamics, and use model predictive control to plan under these dynamics. Our experimental results show that this approach can be used to solve a variety of complex robotic manipulation tasks in just a single attempt, using prior data from other manipulation behaviors.
研究の動機と目的
- 従来の方法が新しいスキルを学習するのに広範な相互作用を必要とするため、ロボット操作における強化学習のサンプル非効率性という課題に対処すること。
- 非線形で接触を伴う環境において、限られたデータから正確なダイナミクスモデルを学習することが難しいという課題を克服すること。
- デモンストレーションや明示的なドメイン知識を必要とせず、関連するタスクからの事前経験を活用することで、新しい操作タスクのワンショット学習を可能にすること。
- 粗い事前知識とオンラインでのモデル適応を組み合わせることで、現実世界のロボット制御におけるロバスト性とサンプル効率を向上させる手法を開発すること。
提案手法
- 複数の操作タスクからの事前経験を用いて、システムダイナミクスのグローバル事前分布として機能するニューラルネットワークダイナミクスモデルを学習する。
- オンラインタスク実行中は、最新の相互作用データに局所的線形近似をフィッティングすることで、ダイナミクスモデルを適応させる。
- 適応されたダイナミクスモデルに基づいて制御入力を生成するために、モデル予測制御(MPC)フレームワーク内で繰り返し線形二次調節器(iLQR)を用いる。
- 最新の状態-行動遷移を用いて、リアルタイムでダイナミクスモデルを段階的に精緻化し、モデル化されていないダイナミクス変動に対する局所的補正を可能にする。
- ニューラルネットワーク事前分布を用いてダイナミクスモデルを初期化することで、正確なグローバルモデリングの必要性を低減し、新しいタスクでの収束性を向上させる。
- 関節角度、速度、エンドエフェクターポーズといった高次元の状態観測値を、トルクレベル制御を目的としたMPCベースの計画プロセスに統合する。
実験結果
リサーチクエスチョン
- RQ1事前経験とオンライン適応のみを用いて、モデルベース強化学習アプローチが複雑な操作タスクのワンショット学習を達成できるか?
- RQ2非線形ダイナミクスのサンプル効率の良い学習を可能にするために、単純な線形事前分布と比較して、ニューラルネットワーク事前分布はどの程度有効か?
- RQ3オンラインでのダイナミクス適応は、高い不確実性やモデル化されていないダイナミクスを伴うタスクにおいて、どの程度性能を向上させるか?
- RQ4粗く正確でない事前モデルであっても、リアルタイムでの適応と組み合わせることで、タスク実行が成功するか?
主な発見
- 提案手法は、PR2ロボットを用いて、ペグインホール、リングスタッキング、ブロック配置といった接触を伴う困難な操作タスクを、一度の試行で成功裏に学習・実行した。
- 短い時間的文脈を有するニューラルネットワーク事前分布を用いることで、単純な線形事前分布および非適応型ニューラルネットワークベースラインと比較して顕著に優れた性能を発揮した。
- オンライン適応は、ブロック配置のような難しいタスクにおいて特に有効であり、動的不確実性に対する局所的補正を可能にすることで、成功確率の向上を実現した。
- 正確でないグローバル事前モデルであっても、タスク実行中にリアルタイムでモデルを精緻化するため、ロバストな性能を達成した。
- ロバストネス実験では、特に複雑なタスクにおいて、適応により成功確率が著しく向上した。
- タスク実行中に、予期しない接触の後に対象物をプローブするなど、自然な探索的行動が観察され、リアルタイムでの適応的学習が反映された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。