[論文レビュー] Unsupervised Domain Adaptation with Dynamics-Aware Rewards in Reinforcement Learning
本論文では、ダイナミクスのシフトが生じるターゲット環境への効率的なスキル転送を可能にする、非教師付き強化学習のためのドメイン適応手法DARSを提案する。KL正則化付き報酬を導入することで、ソース環境とターゲット環境の行動を整合させ、最小限のターゲット環境でのロールアウトで適応的かつ転送可能なスキルを発見可能となる。この手法により、ターゲット環境での完全な訓練に匹敵する性能を達成しながら、実世界での相互作用時間を最大75%まで短縮できる。
Unsupervised reinforcement learning aims to acquire skills without prior goal representations, where an agent automatically explores an open-ended environment to represent goals and learn the goal-conditioned policy. However, this procedure is often time-consuming, limiting the rollout in some potentially expensive target environments. The intuitive approach of training in another interaction-rich environment disrupts the reproducibility of trained skills in the target environment due to the dynamics shifts and thus inhibits direct transferring. Assuming free access to a source environment, we propose an unsupervised domain adaptation method to identify and acquire skills across dynamics. Particularly, we introduce a KL regularized objective to encourage emergence of skills, rewarding the agent for both discovering skills and aligning its behaviors respecting dynamics shifts. This suggests that both dynamics (source and target) shape the reward to facilitate the learning of adaptive skills. We also conduct empirical experiments to demonstrate that our method can effectively learn skills that can be smoothly deployed in target.
研究の動機と目的
- 高コストな実世界のターゲット環境にポリシーをデプロイする際の高いサンプルコストの課題に対処すること。
- ダイナミクスのシフトが生じるターゲット環境への転送可能性を保証しつつ、ソース環境で非教師付きのスキル発見を可能にすること。
- 事前定義された報酬関数やゴールのアノテーションなしに、ターゲット環境でのロールアウト回数を最小限に抑えること。
- ソースとターゲットの両方のダイナミクスに基づいてスキル発見を形状づける報酬メカニズムを開発すること。
- 複雑なロボットスキルのシミュレーションから実世界への転送を可能にし、実世界での相互作用を最小限に抑えること。
提案手法
- ソース環境とターゲット環境の軌道を整合させるために、ゴール到達報酬関数を変更するKL正則化項を導入する。
- ゴールを表現し、ゴール分布と報酬関数を学習するために、ソース環境で潜在変数条件付きのプロービングポリシーを用いる。
- ダイナミクスに配慮した報酬を用いて、ソース環境でのみゴール条件付きポリシーを訓練する。
- 2つの分類器を用いて、ソースとターゲットの状態分布間のKLダイバージェンスを推定し、ダイナミクスの不一致に基づいた報酬形状づけを可能にする。
- ソース環境で、既存の非教師付き強化学習手法(例:GPIM)を活用して、ターゲット環境に一般化可能なポリシーを学習する。
- ファインチューニング実験において、ターゲットのロールアウトバッファを再利用して、データ効率を評価する。
実験結果
リサーチクエスチョン
- RQ1豊富なロールアウトが可能なソース環境で訓練されたポリシーが、最小限のターゲット環境ロールアウトで、ダイナミクスのシフトが生じるターゲット環境に効果的に適応可能か。
- RQ2ソース環境とターゲット環境の間のダイナミクスのシフトを明示的にモデル化することで、スキル発見をどのように支援できるか。
- RQ3強化学習における非教師付きドメイン適応が、事前定義された報酬関数なしに、ターゲット環境での完全な訓練に匹敵する性能を達成可能か。
- RQ4提案されたKL正則化報酬が、不安定な環境やシミュレーションから実世界への転送環境において、学習されたスキルのロバスト性と転送性を向上させるか。
- RQ5維持されたスキル性能を保ちつつ、必要な実世界のロールアウト回数をどの程度まで削減できるか。
主な発見
- DARSは、100万ステップ以内にターゲット環境での完全な訓練(GPIM in target)に匹敵する性能を達成したが、ターゲット環境でのロールアウト回数は著しく少なかった。
- 同じターゲット環境ロールアウト回数でも、DARSはターゲット環境でのGPIM(10倍の更新回数とファインチューニングベースライン)を上回り、データ効率の高さを示した。
- バランス維持タスクでは、DARSにより実世界での訓練時間を、ファインチューニングの4時間からわずか1時間に短縮した。また、前後方向の移動学習も3時間で達成できたが、ベースラインは6時間以内に失敗した。
- 不安定な環境下でも、DARSは安定的かつ繰り返し可能なスキルを効果的に学習したが、SMiRLおよびそのファインチューニング版はダイナミクスの不一致により適応できなかった。
- ターゲットバッファの再利用は性能向上に寄与しなかったことから、KL正則化が適応に十分なインダクティブバイアスを提供していることが示された。
- DARSは、最小限の実世界相互作用でシミュレーションから実世界への転送においてほぼ最適な性能を達成し、実世界へのデプロイメントにおける有効性を検証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。