[論文レビュー] Skill Preferences: Learning to Extract and Execute Robotic Skills from Human Feedback
Skill Preferences (SkiP) は、ノイズが多く、最適でないオффラインのデモデータから人間の整合性のある構造的スキルを学習するために、スキル抽出段階と実行段階の両方で人間のフィードバックを活用する強化学習フレームワークである。軌道の上での人間の好みをモデル化することで、SkiP は、シミュレーション上での複雑なマルチステップのロボット操作タスクにおいて、先行するスキル抽出法および人間を含む強化学習手法を著しく上回る頑健な行動的事前知識を抽出する。
A promising approach to solving challenging long-horizon tasks has been to extract behavior priors (skills) by fitting generative models to large offline datasets of demonstrations. However, such generative models inherit the biases of the underlying data and result in poor and unusable skills when trained on imperfect demonstration data. To better align skill extraction with human intent we present Skill Preferences (SkiP), an algorithm that learns a model over human preferences and uses it to extract human-aligned skills from offline data. After extracting human-preferred skills, SkiP also utilizes human feedback to solve down-stream tasks with RL. We show that SkiP enables a simulated kitchen robot to solve complex multi-step manipulation tasks and substantially outperforms prior leading RL algorithms with human preferences as well as leading skill extraction algorithms without human preferences.
研究の動機と目的
- 現行のスキル抽出手法が、現実世界ではめったに入手できない、洗練されたエキスパートレベルのデモデータに依存するという制限を克服すること。
- 不完全または最適でないオフラインデータでトレーニングされた生成モデルの脆さを、人間のフィードバックを組み込むことで、行動的事前知識を人間の意図に適合させ、ノイズ除去すること。
- 人間のフィードバックを用いてポリシーのファインチューニングだけでなくスキル発見にも用いることで、長時間スパンで複合的なタスクにまで人間を含む強化学習をスケーリングすること。
- スキル抽出段階で軌道の上での好みをモデル化することで、マルチモーダルでノイズの多いデータセットから、効率的かつ頑健なスキル学習を可能にすること。
- データが最適でない状況下で、スキル抽出段階での人間のフィードバックが、複雑なダウンストリームタスクで高いパフォーマンスを達成するために不可欠であることを実証すること。
提案手法
- デモ間のペアワイズ比較を用いて、オフラインデータセット内の軌道の上での人間の好みモデルを学習する。
- 学習された好みモデルを用いて、スキル抽出段階で軌道の尤度を再重み付けし、人間の意図に整合する軌道を優遇する。
- 好み重み付きデータセット上で生成モデル(例えば、VAE や自己回帰モデル)をトレーニングし、構造的で人間が好むスキルを抽出する。
- 抽出されたスキルを、特定のタスク向けにポリシーをファインチューニングするために用いるダウンストリーム強化学習ループにおける行動的事前知識として適用する。
- 強化学習のファインチューニング段階で、好みに基づく報酬信号を用いてポリシー最適化を人間が好む行動に導く。
- スキル抽出段階のフィードバックとスキル実行段階のフィードバックの両方を統合した統一パイプラインを構築し、サンプル効率性とタスクパフォーマンスを向上させる。
実験結果
リサーチクエスチョン
- RQ1ノイズが多く、最適でないオフラインデータでトレーニングされた場合、スキル抽出段階での人間のフィードバックが行動的事前知識の質を向上させるか?
- RQ2スキル抽出段階で好みを組み込むことで、フィードバックなしの標準的スキル抽出と比較して、より良いダウンストリームタスクパフォーマンスが得られるか?
- RQ3スパースなバイナリフィードバック(例:サブタスク完了)と比較して、好みに基づくフィードバックは、サンプル効率性と最終パフォーマンスにおいてどのように異なるか?
- RQ4人間のフィードバックを用いたスキル抽出は、複合的推論を要する複雑で長時間スパンの操作タスクに一般化可能か?
- RQ5手動によるデータセットのキュレーションを人間のフィードバックによるスキル学習に置き換えることで、エキスパートデモのキュレーション依存度を低下させることは可能か?
主な発見
- SkiP はスキル抽出段階で人間のフィードバックを用いることで、6つのシミュレーテッドキッチン環境すべてで、フィードバックなしのバージョンを上回り、後者はいかなるタスクも解けなかった。
- 人間のフィードバックを用いたスキル抽出手法は、重みなしベースラインと比較して著しく高速な学習曲線と高い最終パフォーマンスを達成しており、事前知識学習段階での好みモデリングの必要性を示している。
- SkiP がダウンストリームRLで人間の好みを用いる場合、学習されたスパース報酬分類器を用いる同じ手法と比較して、6つの環境のうち5つで優れたパフォーマンスを示し、好み信号がバイナリサブタスク報酬よりも情報量が多いことを示している。
- SkiP は、シミュレーテッドキッチン環境における複雑なマルチステップ操作タスクにおいて、先端の人間を含む強化学習アルゴリズムおよび最先端のスキル抽出ベースラインを著しく上回っている。
- 好み重み付きスキル抽出プロセスは、エキスパート行動とランダム行動の混合の中でも、高品質で人間の整合性のある軌道を的確に特定・強調しており、データノイズに対して頑健であることを証明している。
- 結果は、人間のフィードバックがスキル抽出段階で単なる利点ではなく、不完全なデータで困難な長時間スパンのタスクで信頼性のあるパフォーマンスを達成するために不可欠であることを検証している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。