Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Skill Chaining for Long-Horizon Robot Manipulation via Terminal State Regularization

Youngwoon Lee, Joseph J. Lim|arXiv (Cornell University)|Nov 15, 2021
Reinforcement Learning in Robotics参考文献 49被引用数 5
ひとこと要約

本論文は、終端状態正則化を用いて部分タスク方策の終端分布を直後の方策の開始集合に近づけることで、必要とされる状態カバレッジの累積的増加を防ぐ、敵対的スキルチェイニングフレームワークT-STARを提案する。この手法により、複雑なIKEAの家具組立タスクに対する最初のモデルフリー強化学習ソリューションが実現され、それぞれchair_ingolfとtable_lackで56%および87%の成功率を達成した。これに対して、先行するスキルチェイニングベースラインは完全に失敗するか、低成功率にとどまっていた。

ABSTRACT

Skill chaining is a promising approach for synthesizing complex behaviors by sequentially combining previously learned skills. Yet, a naive composition of skills fails when a policy encounters a starting state never seen during its training. For successful skill chaining, prior approaches attempt to widen the policy's starting state distribution. However, these approaches require larger state distributions to be covered as more policies are sequenced, and thus are limited to short skill sequences. In this paper, we propose to chain multiple policies without excessively large initial state distributions by regularizing the terminal state distributions in an adversarial learning framework. We evaluate our approach on two complex long-horizon manipulation tasks of furniture assembly. Our results have shown that our method establishes the first model-free reinforcement learning algorithm to solve these tasks; whereas prior skill chaining approaches fail. The code and videos are available at https://clvrai.com/skill-chaining

研究の動機と目的

  • 長時間スパンのロボット操作におけるスキルチェイニングの課題に取り組むこと。これは、終端状態と開始状態の分布シフトが生じるため、単純な方策の順序付けでは失敗する。
  • 先行手法の制限を克服すること。これらは開始集合を広げることで、結果として終端集合が指数関数的に拡大し、長大なスキルチェインにおいてスケーラビリティが著しく低下する。
  • 終端状態分布を小さく保ち、次の方策の開始集合と一致させることで、効率的かつスケーラブルなスキルチェイニングを可能にする手法を開発すること。
  • 手動でのタスク分解や工学的設計を一切行わずに、接触が豊富な複雑な操作タスク(例:IKEAの家具組立)に対して、エンドツーエンドのモデルフリー強化学習の実現可能性を示すこと。
  • 敵対的正則化を用いて終端状態を調整することで、独立に訓練された部分タスク方策を、安定的かつ逐次的に実行可能にする仕組みを提供すること。

提案手法

  • 次の方策の開始集合と、現在の方策の終端状態を区別する識別器を備えた敵対的学習フレームワークを導入する。
  • 識別器の損失を正則化信号として用い、部分タスク方策を微調整することで、その終端状態が次の方策の開始集合に集約されるよう促進する。
  • 各々の方策の挙動を繰り返し改善し、最終状態が次の方策の方策ネットワークの定義域内に収まるようにすることで、分布シフトを最小限に抑える。
  • 方策出力の正則化により、状態空間の管理不能な領域に分布が広がるのを防ぎ、終端状態分布を小さくかつ有界に保つ。
  • 事前学習済みの部分タスク方策の微調整中にこの正則化を適用することで、共同学習や大規模データ収集を必要とせず、安定的かつ効率的なチェイニングを実現する。
  • 主成分分析(PCA)を用いて、オブジェクト状態の構成を可視化・分析し、訓練中の終端状態分布の進化を検証する。

実験結果

リサーチクエスチョン

  • RQ1長時間スパンのスキルチェイニングにおいて、終端状態正則化が開始集合要件の累積的増加を防げるか?
  • RQ2手動でのタスク分解や工学的設計を一切行わず、モデルフリーの強化学習アプローチが、接触が豊富な複雑な操作タスク(例:IKEAの家具組立)を効果的に解けるか?
  • RQ3終端状態の敵対的正則化は、単純な方策チェイニングや開始集合の拡大と比較して、逐次的方策実行の成功確率をどのように向上させるか?
  • RQ4訓練中に、終端状態正則化が方策の終了集合のサイズと広がりをどの程度制限するか?
  • RQ5本手法は、複数の部分タスクと複雑なダイナミクスを有する多様で高次元な操作タスクに一般化可能か?

主な発見

  • 提案されたT-STAR手法は、chair_ingolf家具組立タスクで56%の成功率を達成した。これに対して、方策順序ベースラインでは0%であったため、このタスクに対する最初の成功したモデルフリー解法であることが示された。
  • table_lackタスクでは、ベースラインの59%から87%に成功率が向上し、安定性とスケーラビリティの顕著な向上が確認された。
  • PCAによる可視化による定性的分析により、T-STARの終端状態分布は時間経過とともに有界であり、収縮していることが確認された。これに対して、ベースラインの分布は顕著に広がっており、不安定性を示している。
  • T-STARにおける有界な終端状態分布のおかげで、次の方策がカバーすべき状態領域が減少し、複数のスキルにわたる効率的な微調整と安定したチェイニングが可能になった。
  • 本手法は、接触が豊富なダイナミクス下でも、複雑で高自由度の操作タスクに対して、複数のクローズドループ方策を効果的にチェイン可能にした。これに対して、先行するスキルチェイニング手法は失敗していた。
  • 結果から、終端状態正則化が、方策シーケンス間の分布シフトを効果的に緩和し、大規模または複雑な開始集合を必要とせずに、長時間スパンのタスク実行を可能にすることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。