[論文レビュー] REvolveR: Continuous Evolutionary Models for Robot-to-robot Policy Transfer
REvolveRは、物理シミュレーター内でのロボット形状および運動学的特性を段階的に変化させることで、ソースロボットからターゲットロボットへのロボット間ポリシー転送を実現する連続的進化モデルを提案する。中間的で滑らかに変化するロボット上でポリシーを訓練することで、優れたサンプル効率性を達成し、模倣学習が失敗するスパarselyリワードな設定でも成功を収める。
A popular paradigm in robotic learning is to train a policy from scratch for every new robot. This is not only inefficient but also often impractical for complex robots. In this work, we consider the problem of transferring a policy across two different robots with significantly different parameters such as kinematics and morphology. Existing approaches that train a new policy by matching the action or state transition distribution, including imitation learning methods, fail due to optimal action and/or state distribution being mismatched in different robots. In this paper, we propose a novel method named $REvolveR$ of using continuous evolutionary models for robotic policy transfer implemented in a physics simulator. We interpolate between the source robot and the target robot by finding a continuous evolutionary change of robot parameters. An expert policy on the source robot is transferred through training on a sequence of intermediate robots that gradually evolve into the target robot. Experiments on a physics simulator show that the proposed continuous evolutionary model can effectively transfer the policy across robots and achieve superior sample efficiency on new robots. The proposed method is especially advantageous in sparse reward settings where exploration can be significantly reduced. Code is released at https://github.com/xingyul/revolver.
研究の動機と目的
- ソースロボットとターゲットロボットの間で顕著な形状的・動的差異がある状況において、従来の模倣学習が最適な行動/状態分布の不一致により失敗するという課題に対処すること。
- 特に複雑または高次元の環境において、各新しいロボットに対してポリシーを再訓練する非効率性と現実的でない点を克服すること。
- 探索が困難で成功のシグナルが希少なスパarselyリワードな設定において、効果的なポリシー転送を可能にすること。
- 困難なロボット間転送を、より簡単で段階的なポリシー微調整タスクの系列に分解できるスケーラブルなフレームワークを開発すること。
- 局所的ランダム化進化や進化報酬設計といった新規なコンponentsを導入することで、訓練の安定性とサンプル効率を向上させること。
提案手法
- 物理シミュレーター内で、脚の長さ、質量、指の配置などのパラメータを滑らかに変化させることで、ソースロボットとターゲットロボットの間を連続的進化モデルとして定義する。
- 動的特性が変化する中間的ロボットの系列上でポリシーを訓練し、段階的な適応を可能にする。
- 各訓練エポックで進化パラメータの小さな範囲内でロボットのランダムサブセットをサンプリングする局所的ランダム化進化戦略を実装し、耐性と一般化性を向上させる。
- 進化報酬設計を導入し、より進化したロボット上で発生する遷移に高い報酬を割り当てることで、ターゲットロボットに向けた高速収束を促進する。
- 微分可能な補間スキームを用いてロボットパラメータを連続空間に表現し、滑らかな遷移と勾配ベース最適化を可能にする。
- 標準的な強化学習アルゴリズム(例:NPG、SAC)と統合し、サンプル効率を向上させるために適応的訓練スケジューリングを適用する。
実験結果
リサーチクエスチョン
- RQ1連続的進化フレームワークを用いることで、顕著に異なる形状的・動的特性を持つターゲットロボットへのソースロボットのポリシー転送が有効に行えるか?
- RQ2局所的ランダム化進化は、進化するロボット間でのポリシー転送における訓練の安定性と耐性をどのように向上させるか?
- RQ3進化報酬設計は、ポリシー転送におけるサンプル効率と収束速度をどの程度向上させるか?
- RQ4本手法は、標準的な模倣学習や直接的転送が失敗するスパarselyリワードな環境でも、成功したポリシー転送を達成できるか?
- RQ5サンプル効率と最終的パフォーマンスの観点から、連続的進化モデルは直接的転送や模倣学習のベースラインと比べてどのように差をつけるか?
主な発見
- REvolveRは、密度的報酬設定およびスパarsely報酬設定の両方で、直接的転送や模倣学習のベースラインを上回り、より高いサンプル効率と高速な収束を達成した。
- スパarsely報酬設定では、進化報酬設計(h=1.0)を用いたREvolveRは6,279.35 ± 290.33の最適化ステップで90%の成功率を達成し、学習に失敗したベースラインを著しく上回った。
- 局所的ランダム化進化の導入により、エピソード報酬の標準偏差が低下し、決定論的進化と比較して訓練の耐性が向上した。
- スパarsely報酬でさえも、REvolveRは密度的報酬で訓練されたベースラインよりも少ない最適化ステップで収束した。これは、本手法の優れたサンプル効率性を示している。
- アブレーションスタディの結果、局所的ランダム化進化と進化報酬設計の両方が個別にパフォーマンスを向上させ、組み合わせることで最良の結果が得られた。
- 本手法は、人間のデモンストレーションベースの手法が完全に失敗する複雑な操作タスク(ハンマー、リロケート、ドア)において、5本指ロボットから2本指グリッパーへのポリシー転送に成功した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。