[論文レビュー] Improving Policy Learning via Language Dynamics Distillation
本稿では、言語説明付きのラベルなしデモンストレーションから環境のダイナミクスを予測するように事前学習するモデルを提案し、強化学習を用いて微調整しながら言語に根ざした表現を蒸留する、言語ダイナミクス蒸留(LDD)を提示する。LDDは、サンプル効率と一般化性能を向上させ、NetHack、ALFWorld、RTFM、Messenger、Touchdownの5つの言語豊富な環境において、タブラ・ラサRL、VAE事前学習、エキスパートベースの報酬形状よりも優れている。
Recent work has shown that augmenting environments with language descriptions improves policy learning. However, for environments with complex language abstractions, learning how to ground language to observations is difficult due to sparse, delayed rewards. We propose Language Dynamics Distillation (LDD), which pretrains a model to predict environment dynamics given demonstrations with language descriptions, and then fine-tunes these language-aware pretrained representations via reinforcement learning (RL). In this way, the model is trained to both maximize expected reward and retain knowledge about how language relates to environment dynamics. On SILG, a benchmark of five tasks with language descriptions that evaluate distinct generalization challenges on unseen environments (NetHack, ALFWorld, RTFM, Messenger, and Touchdown), LDD outperforms tabula-rasa RL, VAE pretraining, and methods that learn from unlabeled demonstrations in inverse RL and reward shaping with pretrained experts. In our analyses, we show that language descriptions in demonstrations improve sample-efficiency and generalization across environments, and that dynamics modelling with expert demonstrations is more effective than with non-experts.
研究の動機と目的
- 疎で遅延する報酬の下で、強化学習における複雑な言語の抽象的表現を接地する課題に対処すること。
- 強化学習における言語理解とポリシー最適化の分離の難しさを克服すること。
- 言語説明付きの安価なラベルなしデモンストレーションを用いて、言語に根ざしたポリシー学習のサンプル効率と一般化性能を向上させること。
- エキスパート vs. 非エキスパートのデモンストレーションを用いたダイナミクスモデリングが、初期化および蒸留信号としてどの程度効果的かを調査すること。
- 事前学習段階およびその後のポリシー学習段階における言語説明の貢献度を評価すること。
提案手法
- ラベルなしデモンストレーションを用いて、過去の観測から次の観測(言語説明を含む)を予測する教師モデルを事前学習する。
- 強化学習中に、事前学習済みの教師モデルを用いて中間表現をポリシー学習者に蒸留する。
- 累積報酬最適化の過程で、言語に根ざしたダイナミクス知識を保持するための知識蒸留を適用する。
- アクションのアノテーションコストを回避するため、安価に収集されたラベルなしデモンストレーションを用いてダイナミクスモデルを学習する。
- 固定された教師モデルから蒸留を行うことで、言語理解の破綻を防ぐために、ポリシーネットワークを強化学習で微調整する。
- 観測に言語説明(例:イベントメッセージ、空間的キャプション)を入力に含めることで、接地性およびダイナミクスモデリングを向上させる。
実験結果
リサーチクエスチョン
- RQ1言語説明付きのラベルなしデモンストレーションを用いたダイナミクスモデルの事前学習が、強化学習における下流ポリシー学習を改善できるか?
- RQ2事前学習済みのダイナミクスモデルから言語に根ざした表現を蒸留することで、言語豊富な環境におけるサンプル効率と一般化性能が向上するか?
- RQ3デモンストレーションの質(エキスパート vs. 非エキスパート)が、ダイナミクスモデリングおよびその後のポリシー蒸留の有効性に与える影響はいかほどか?
- RQ4観測に含まれる言語説明が、ダイナミクスモデリングの精度および最終ポリシーの性能にどの程度寄与するか?
- RQ5VAE事前学習、逆強化学習、または事前学習済エキスパートを用いた報酬形状と比較して、言語ダイナミクス蒸留はより効果的か?
主な発見
- LDDは、SILGベンチマークの5つのすべての環境で、タブラ・ラサRL、VAE事前学習、エキスパートベースの報酬形状を上回っている。
- NetHackおよびTouchdownでは、ダイナミクス事前学習段階で観測から言語説明を除去すると性能が著しく低下し、言語説明が初期化および蒸留において極めて重要な役割を果たしていることが示された。
- エキスパートのデモンストレーションを用いて学習したダイナミクスモデルは、非エキスパートのロールアウトを用いたものよりも、特に部分観測環境(NetHackやTouchdown)において高いフレーム予測精度を達成している。
- LDDは、例外的にTouchdownを除き、ベースラインよりも収束が早く、評価時の勝利確率も高い。
- 言語説明はダイナミクスモデルの精度を向上させ、その結果、より良いポリシー初期化および蒸留の恩恵を得られる。
- 特に長期計画やレアな状態探索を要する複雑な環境では、エキスパートのデモンストレーションが非エキスパートのロールアウトよりも、より情報量の多いダイナミクス信号を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。