[論文レビュー] Ask Your Humans: Using Human Instructions to Improve Generalization in Reinforcement Learning
本論文では、人間のデモから得られる自然言語指示を用いて、マルチタスク環境におけるゼロショット一般化を向上させる強化学習フレームワークを提案する。言語生成モデルと言語に条件付けられた方策を訓練することで、エージェントは複雑なタスクを分解し、少数のショットで未学習のタスクに一般化し、解釈可能で人間が読みやすい行動シーケンスを生成する。これは、学習済みおよび未学習のクラフトタスクの両方でベースラインを上回る性能を示す。
Complex, multi-task problems have proven to be difficult to solve efficiently in a sparse-reward reinforcement learning setting. In order to be sample efficient, multi-task learning requires reuse and sharing of low-level policies. To facilitate the automatic decomposition of hierarchical tasks, we propose the use of step-by-step human demonstrations in the form of natural language instructions and action trajectories. We introduce a dataset of such demonstrations in a crafting-based grid world. Our model consists of a high-level language generator and low-level policy, conditioned on language. We find that human demonstrations help solve the most complex tasks. We also find that incorporating natural language allows the model to generalize to unseen tasks in a zero-shot setting and to learn quickly from a few demonstrations. Generalization is not only reflected in the actions of the agent, but also in the generated natural language instructions in unseen tasks. Our approach also gives our trained agent interpretable behaviors because it is able to generate a sequence of high-level descriptions of its actions.
研究の動機と目的
- スパarsely-rewardedでマルチタスクな強化学習におけるサンプル効率性と一般化の課題に対処すること。
- わずかな人間のデモと自然言語指示のみを用いて、エージェントが未学習のタスクに一般化できるようにすること。
- 成功および失敗の両ケースに対して人間が読みやすい行動記述を生成する解釈可能なエージェントを作成すること。
- 訓練および評価のための、クラフトベースのグリッドワールド環境における人間がアノテートした言語指示とトラジェクトリーデータセットを開発すること。
- 言語に条件付けられた方策がタスクを分解し、多様で未学習のタスク間で部分タスクの知識を再利用できることを示すこと。
提案手法
- フレームワークは、現在の状態と目的に基づいて自然言語指示を生成する高レベルの言語生成モデルを用いる。
- 生成された言語に条件付けられた低レベルの方策が行動を選択することで、階層的タスク分解が可能になる。
- 人間のデモと言語アノテーションを併用したImitation Learningと強化学習報酬を組み合わせてモデルを訓練する。
- 訓練データは、クラフトベースのグリッドワールド環境における14の訓練タスクで合計6,000件のゲームトレースから構成される。
- エージェントはリアルタイムで段階的な指示を生成し、それらが行動をガイドするだけでなく、タスク分解と一般化の評価にも用いられる。
- 本手法は、追加のデモと指示をわずかに追加することで、新しいタスクにおける少サンプルファインチューニングをサポートする。
実験結果
リサーチクエスチョン
- RQ1人間のデモから得られる自然言語指示は、マルチタスク強化学習におけるゼロショット一般化を向上させることができるか?
- RQ2訓練タスクと共通する部分タスクを持つ未学習のタスクに対して、言語に条件付けられた方策はどの程度一般化できるか?
- RQ3生成された言語は、正確なタスク分解を反映しており、エージェントの失敗を診断するのをどの程度支援するか?
- RQ4エージェントは、新しいタスクに対してわずかなデモでのファインチューニングにより、迅速に学習できるか?
- RQ5テンプレートベースの言語と比較して、人間が生成した多様でノイズを含む言語を用いることで、強化学習におけるロバスト性と解釈可能性が向上するか?
主な発見
- モデルは、35のゼロショットクラフトタスクの平均でベースライン手法を上回り、追加の報酬信号なしに強力な一般化を示している。
- エージェントは、共通する部分タスクを再利用することで、未学習のタスクに成功して一般化しており、これは新しいタスクに対して一貫性があり正しい言語生成がなされていることから裏付けられている。
- 言語生成モデルは、解釈可能で高レベルの行動記述を生成し、成功および失敗の両行動の洞察を可能にしている。
- ゴール/ブリックピックアックスのような5ステップの挑戦的タスクに対しても、限定的な訓練データでも、かなり一貫性があり意味的に正しい指示を生成している。
- 失敗分析の結果、言語生成の誤り(例:「ゴールド」の代わりに「ストックス」を使用)は、特定のアイテムの訓練頻度が低いために発生しており、方策の失敗は正しい指示でも発生することが分かった。
- モデルの一般化は行動実行の面だけでなく、生成された言語の質と整合性の面でも見られ、現実のレシピのようなタスク構造を反映している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。