Skip to main content
QUICK REVIEW

[論文レビュー] Generalization to New Actions in Reinforcement Learning

Ayush Jain, Andrew Szot|arXiv (Cornell University)|Nov 3, 2020
Reinforcement Learning in Robotics被引用数 10
ひとこと要約

本論文は、階層的変分オートエンコーダを用いて観測から行動表現を学習し、その後その学習済み埋め込みに基づいて行動を選択する2段階フレームワークを提案することで、強化学習における新しい行動へのゼロショット一般化を実現する。この手法は、ツール選択や3D形状積み上げなどのタスクで、再訓練を伴わずに未学習の行動に対しても強力な一般化性能を示し、微調整なしで頑健性を示す。

ABSTRACT

A fundamental trait of intelligence is the ability to achieve goals in the face of novel circumstances, such as making decisions from new action choices. However, standard reinforcement learning assumes a fixed set of actions and requires expensive retraining when given a new action set. To make learning agents more adaptable, we introduce the problem of zero-shot generalization to new actions. We propose a two-stage framework where the agent first infers action representations from action information acquired separately from the task. A policy flexible to varying action sets is then trained with generalization objectives. We benchmark generalization on sequential tasks, such as selecting from an unseen tool-set to solve physical reasoning puzzles and stacking towers with novel 3D shapes. Videos and code are available at https://sites.google.com/view/action-generalization

研究の動機と目的

  • 新しい離散的行動が導入された際の強化学習におけるゼロショット一般化の欠如に対処すること。
  • 再訓練を伴わずに、以前に見たことのない行動を用いてタスクを遂行できるエージェントを可能にすること。
  • 観測から意味のある行動表現を学習し、異なる行動集合にわたる方策の一般化を実現するフレームワークを開発すること。
  • 道具、3D形状、ナビゲーション、レコメンデーションを含む多様な環境において、この問題をベンチマーク化すること。
  • 訓練中に多様な行動選択を促進することで、訓練済みの行動に過剰適合しないように方策の一般化を向上させること。

提案手法

  • 階層的変分オートエンコーダ(HVAE)を用いて、行動の観測を低次元の行動表現に符号化する。
  • 行動表現は、動画、画像、または行動実行の状態軌跡など、多様な入力から得られる。
  • 方策ネットワークは、状態符号化と行動表現を用いて行動の価値を計算し、行動のカテゴリカル分布を出力する。
  • ゼロショット一般化を向上させるために、訓練中に多様な行動選択を促進する訓練手順を導入する。
  • 方策は、バリアント分布とカテゴリカル分布を用いて、離散的行動選択と連続的行動(例:位置や終了)を統合したハイブリッド行動空間を用いる。
  • 学習済み表現から行動観測を正確に再構成できるように、VAEに再構成損失を適用する。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、訓練中に見なかった新しい行動に一般化できるか?
  • RQ2動画や軌跡のような多様で高次元の観測から、効果的に行動表現を学習できるか?
  • RQ3どのような訓練手順が、訓練済み行動に過剰適合しないまま、未学習の行動に一般化できるか?
  • RQ4新しい行動が導入された際、提案フレームワークは再訓練と比べてどのように性能を発揮するか?
  • RQ5この手法は、道具、3D形状、ナビゲーションスキルなど、異なるタスクや行動モodalitiesにどの程度一般化できるか?

主な発見

  • 提案された2段階フレームワークは、多様な観測から意味のある行動表現を効果的に学習し、ゼロショット一般化を実現する。
  • エージェントが物理的推論パズルを解くために新しいセットの道具を選択するCREATE環境において、未学習の行動に対しても良好な一般化性能を示す。
  • 形状積み上げタスクでは、訓練中に見なかった新しい3D形状に対しても一般化し、再訓練なしで高い成功確率を達成する。
  • 訓練中に多様な行動選択を促進する訓練手順は、ナチュラルな訓練に比べてゼロショット性能を顕著に向上させる。
  • 特にデータが少ない状況下においても、再訓練よりもサンプル効率と一般化性能に優れる。
  • ナビゲーションやレコメンデーションタスクを含む複数の環境で頑健性を示し、本手法の広範な適用可能性を確認する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。