[論文レビュー] Hierarchical Few-Shot Imitation with Skill Transition Models
FISTは、スキル遷移モデルを活用して未学習の長時間スパンタスクに一般化する階層的 few-shot 逆強化学習フレームワークを導入する。現在状態と将来状態の両方に条件付けられた逆スキルダイナミクスモデルを学習し、半パrametricな状態選択にコントラスト型距離関数を用いることで、ポリシーのずれを防ぎ、最小限の示範データで未学習のナビゲーションおよびロボット操作タスクにおいて最先端の性能を達成する。
A desirable property of autonomous agents is the ability to both solve long-horizon problems and generalize to unseen tasks. Recent advances in data-driven skill learning have shown that extracting behavioral priors from offline data can enable agents to solve challenging long-horizon tasks with reinforcement learning. However, generalization to tasks unseen during behavioral prior training remains an outstanding challenge. To this end, we present Few-shot Imitation with Skill Transition Models (FIST), an algorithm that extracts skills from offline data and utilizes them to generalize to unseen tasks given a few downstream demonstrations. FIST learns an inverse skill dynamics model, a distance function, and utilizes a semi-parametric approach for imitation. We show that FIST is capable of generalizing to new tasks and substantially outperforms prior baselines in navigation experiments requiring traversing unseen parts of a large maze and 7-DoF robotic arm experiments requiring manipulating previously unseen objects in a kitchen.
研究の動機と目的
- 複雑なサブタスクの連鎖を要する未学習の長時間スパンタスクに、自律エージェントが一般化できるようにすること。
- わずかな示範データしか利用できない状況における少サンプル逆強化学習におけるポリシーのずれの課題に対処すること。
- データ駆動型の行動的事前知識と少サンプル逆強化学習を統合し、単一モードで将来状態に条件付けられたスキルポリシーを学習すること。
- 逆スキルダイナミクスモデルを用いて現在状態と将来状態の両方に条件付けたスキル選択により、一般化を向上させること。
- 多様な分布外(OOD)タスクへの効果的適応を可能にするために、多様なオフラインデータで事前学習を行い、少数のダウンストリーム示範データでファインチューニングすること。
提案手法
- FISTは、現在状態から望ましい将来状態へ遷移するのに必要なスキルを予測する逆スキルダイナミクスモデルを学習し、単一モードかつゴール条件付きのスキル選択を可能にする。
- 推論時に逆スキルモデルの条件付けに適した示範状態を特定するために、コントラスト型距離関数を導入する。
- 現在の観測状態に最も近い状態に基づき、示範データセットから最適なスキルを選択する半パラメトリックアプローチを採用する。
- スキル事前知識は、多様な示範データを含む大規模なオフラインデータセットで事前学習され、ダウンストリーム適応の強力な行動的事前知識を提供する。
- 少数のダウンストリーム示範データでのファインチューニングにより、事前学習時に見られなかった分布外タスクへの適応が可能になる。
- 行動的事前知識の構造的探索と少サンプル逆強化学習のサンプル効率性を統合することで、強靭な一般化を達成する。
実験結果
リサーチクエスチョン
- RQ1事前学習時に未見の長時間スパンタスクにおいて、少サンプルの逆強化学習を可能にするスキル表現を学習できるか?
- RQ2わずか数個の示範データしか利用できない状況で、少サンプル逆強化学習におけるポリシーのずれをどのように防止できるか?
- RQ3現在状態と将来状態の両方に条件付けたスキルポリシーの条件付けが、多様なモードを持つスキル空間における一般化の向上とモード崩壊の低減に寄与するか?
- RQ4分布外(OOD)タスクの一般化において、多様なオフラインデータセットでの事前学習と、ダウンストリームデータへの直接的ファインチューニングの影響は何か?
- RQ5異なる距離尺度(例:コントラスト型 vs. ユークリッド距離)が、FISTにおける半パラメトリック状態選択の性能に与える影響は何か?
主な発見
- FISTは、最も複雑なシナリオにおいて平均成功率4.0 ± 0.0を達成し、未学習の長時間スパンナビゲーションタスクで最先端の性能を示し、ベースラインを大きく上回った。
- 7-DoFのロボット操作タスクにおいて、ケトルやスライドキャビネットなどのオブジェクトを含む未学習タスクで、FISTは成功率3.5 ± 0.3を達成し、SPiRLおよび他のベースラインを上回った。
- アブレーションスタディの結果、ダウンストリーム示範データでのファインチューニングが極めて重要であることが示された:FIST-no-FTは平均成功率2.0 ± 0.0にとどまり、ファインチューニングなしでは一般化に失敗した。
- 多様なオフラインデータセットでの事前学習が一般化に不可欠であることが判明した:FIST-no-pretrainは平均成功率0.5 ± 0.16にとどまり、行動的事前知識の重要性が浮き彫りになった。
- コントラスト型距離関数はユークリッド距離を上回る性能を示した。FIST (Euc.) では4つのタスクのうち3つでわずかに劣る性能を示し、複雑な状態空間においてコントラスト型メトリクスがより強靭であることが示唆された。
- FISTは、スキル事前学習データセットに含まれなかったケトルの操作や下段キャビネットの開閉といった分布外(OOD)タスクに対しても成功し、強力なゼロショット転送能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。