Skip to main content
QUICK REVIEW

[論文レビュー] ACuTE: Automatic Curriculum Transfer from Simple to Complex Environments

Yash Shukla, Christopher Thierauf|arXiv (Cornell University)|Apr 11, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

ACuTEは強化学習における低精度(LF)環境から高精度(HF)環境への自動カリキュラム転送のための新しいフレームワークを提案する。ここで、直接HF環境での相互作用を必要とせずに、単純な環境で最適化されたカリキュラムを複雑な環境にマッピングする。この手法は、物理的ロボットへのSim2Real転送を含む、挑戦的なHFタスクにおいて、収束速度の向上とジャンプスタート性能の向上を達成し、ドメイン適応や自己対戦などのベースラインを上回る。

ABSTRACT

Despite recent advances in Reinforcement Learning (RL), many problems, especially real-world tasks, remain prohibitively expensive to learn. To address this issue, several lines of research have explored how tasks, or data samples themselves, can be sequenced into a curriculum to learn a problem that may otherwise be too difficult to learn from scratch. However, generating and optimizing a curriculum in a realistic scenario still requires extensive interactions with the environment. To address this challenge, we formulate the curriculum transfer problem, in which the schema of a curriculum optimized in a simpler, easy-to-solve environment (e.g., a grid world) is transferred to a complex, realistic scenario (e.g., a physics-based robotics simulation or the real world). We present "ACuTE", Automatic Curriculum Transfer from Simple to Complex Environments, a novel framework to solve this problem, and evaluate our proposed method by comparing it to other baseline approaches (e.g., domain adaptation) designed to speed up learning. We observe that our approach produces improved jumpstart and time-to-threshold performance even when adding task elements that further increase the difficulty of the realistic scenario. Finally, we demonstrate that our approach is independent of the learning algorithm used for curriculum generation, and is Sim2Real transferable to a real world scenario using a physical robot.

研究の動機と目的

  • 複雑で高精度(HF)な環境におけるカリキュラム生成の高い計算コストを低減すること。
  • HFドメインでの直接的相互作用を必要とせずに、低精度(LF)環境からHF環境へのカリキュラムスキーマの転送を可能にすること。
  • 困難なHFタスク、特に追加の複雑さが加わったタスクにおける学習効率と収束速度の向上。
  • 物理的TurtleBotロボットを用いたSim2Real転送の可能性を実証すること。
  • カリキュラム生成に使用された強化学習アルゴリズムに依存しないこと。

提案手法

  • 動的複雑性が低減された簡素化された低精度(LF)環境でカリキュラムを生成・最適化する。
  • ヒューリスティックマッピング関数を用いて、LFカリキュラムのタスクパラメータを高精度(HF)環境の対応するタスクにマッピングする。
  • タスクパラメータとその順序を含むカリキュラムスキーマのみを転送し、高レベルのタスク記述子に基づいてタスク間の関係を保持する。
  • 最終的なターゲットタスクの学習の前に、HF環境で段階的にソースタスクを学習する。
  • HFシミュレーションで学習した同じポリシーを、追加の学習を経ずに物理的ロボットに直接Sim2Realデプロイ可能にする。
  • 物理的アクション(例:フィデューシャルの読み取り)がタスク実行を確認した場合にのみ成功を検証することで、耐性を確保する。

実験結果

リサーチクエスチョン

  • RQ1低精度環境で最適化されたカリキュラムが、高精度環境に効果的に転送可能で、学習を加速できるか?
  • RQ2動的特性に顕著な差がある場合でも、カリキュラム転送が困難なHFタスクにおける学習速度とジャンプスタート性能を向上できるか?
  • RQ3提案手法が、カリキュラム生成に使用された強化学習アルゴリズムに依存しないか?
  • RQ4カリキュラム転送によって学習されたポリシーが、追加のトレーニングを経ずに物理的ロボットに成功裏にデプロイ可能か?
  • RQ5計算コストと学習効率の観点から、カリキュラム転送はドメイン適応や他のベースライン手法と比べてどのように異なるか?

主な発見

  • ACuTEは、ドメイン適応、自己対戦、および教師-生徒カリキュラムベースラインと比較して、ターゲットHFタスクにおける収束速度の向上と閾値到達までの時間の短縮を達成した。
  • HF環境に追加の複雑さが加わった場合でも、優れたジャンプスタート性能を示した。
  • カリキュラム生成に使用されたRLアルゴリズムに依存しないことが示され、HF環境で異なるアルゴリズムを用いた場合でも性能が向上した。
  • 物理的TurtleBotにおいてSim2Real転送に成功し、直接デプロイ後にオブジェクト破壊、収集、作成タスクを完了した。
  • ACuTEの計算コストはベースライン手法と比較して著しく低く、沈没コストは主にLFカリキュラム最適化とHFソースタスク学習に起因した。
  • LF環境とHF環境間のマッピングが不完全であっても、正の転送が観察されたため、マッピングの不正確さに対しても耐性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。