Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Domain Perceptual Reward Functions

Ashley D. Edwards, Srijan Sood|arXiv (Cornell University)|May 25, 2017
Neural and Behavioral Psychology Studies参考文献 40被引用数 7
ひとこと要約

本稿では、異なる環境からのゴール画像とエージェントの現在状態を一致させることで、強化学習エージェントがタスクを学習できるようにする、ディープラーニングベースのメソッドであるクロスドメインパーセプチュアルリワード(CDPR)関数を導入する。エージェントの状態とクロスドメインのゴール画像間の視覚的類似性を測るニューラルネットワークを訓練することで、手動で設計されたリワードなしに正確で一般化可能な報酬信号を提供し、迷路ナビゲーションおよび音楽生成タスクの両方で高いタスク成功を達成した。

ABSTRACT

In reinforcement learning, we often define goals by specifying rewards within desirable states. One problem with this approach is that we typically need to redefine the rewards each time the goal changes, which often requires some understanding of the solution in the agents environment. When humans are learning to complete tasks, we regularly utilize alternative sources that guide our understanding of the problem. Such task representations allow one to specify goals on their own terms, thus providing specifications that can be appropriately interpreted across various environments. This motivates our own work, in which we represent goals in environments that are different from the agents. We introduce Cross-Domain Perceptual Reward (CDPR) functions, learned rewards that represent the visual similarity between an agents state and a cross-domain goal image. We report results for learning the CDPRs with a deep neural network and using them to solve two tasks with deep reinforcement learning.

研究の動機と目的

  • 強化学習において、各新しいタスクごとに環境固有の報酬関数を手動で設計するという課題に対処すること。
  • エージェントのネイティブな環境に依存せず、画像、図解、または音声による記述といったサrogate環境でのゴール指定を可能にすること。
  • 再訓練なしに多様なゴール設定に適用可能な一般化可能で移譲可能な報酬関数を開発すること。
  • 学習された視覚的類似性が、クロスドメインのゴールとエージェントの状態の間で、深層強化学習を効果的に導くのに適しているかどうかを評価すること。
  • CDPRが未観測のゴールに一般化できること、および複雑なタスクにおける成功したポリシー学習を支援できることを実証すること。

提案手法

  • エージェントの状態画像とクロスドメインのゴール画像の間の視覚的類似性を反映するように、状態とゴールの間の距離が類似度を示すパーセプチュアル埋め込み空間を学習するためのディープニューラルネットワークを訓練する。
  • シアン型ネットワークアーキテクチャを用いた対照学習によりCDPR関数を最適化し、一致する状態・ゴールペア間の距離を最小化するとともに、一致しないペア間の距離を最大化する。
  • CDPRを学習された報酬関数として定義する:r(s, g) = -||f(s) - f(g)||₂、ここでfは状態sおよびゴールgのための学習済み特徴エンコーダである。
  • SACやPPOなどの深層強化学習アルゴリズムにCDPRを報酬信号として適用し、グリッドワールド迷路や音楽生成タスクなどの環境でエージェントを訓練する。
  • 実世界のゴール画像(例:手の形、音声コマンド、楽譜)および合成されたゴール表現を、クロスドメイン入力として使用する。
  • 複数の指標を用いてCDPRを評価する:ゴールリtrieval精度(GRA)、報酬の一貫性、および未観測のゴールインスタンスにおける下流のRLパフォーマンス。

実験結果

リサーチクエスチョン

  • RQ1エージェントの状態とクロスドメインのゴール画像の間のパーセプチュアル類似性は、強化学習における一般化可能な報酬関数として効果的に学習可能か?
  • RQ2CDPRは再トレーニングなしに、新しい未観測のゴール設定にどの程度一般化可能か?
  • RQ3タスク成功度とポリシー品質の観点から、CDPRは手動で設計された報酬と比較してどの程度優れているか?
  • RQ4ドメイン間の視覚的または意味的ギャップが大きい場合、CDPRの限界は何か?
  • RQ5CDPRは、報酬がスパarsな複雑な順序的なタスク(例:音楽生成、ナビゲーション)においても学習を支援できるか?

主な発見

  • CDPRアプローチは、手の形と音声コマンドの両方のゴール表現において、1.0の高いゴールリtrieval精度(GRA)を達成し、エージェントの状態とクロスドメインのゴールの間の強いパーセプチュアル整合性を示した。
  • 迷路ナビゲーションタスクでは、音声コマンドを用いたCDPRが青い部屋と緑の部屋の両方へ到達するようにエージェントを正しく訓練できたが、手の形CDPRは余計な中間報酬のため、1つのゴールで失敗した。
  • 音楽生成タスクでは、ギターと楽譜の両方のゴール表現が最初の楽曲で最大75%の精度に達したが、より複雑な2番目の楽曲では性能が低下した。これは、タスクの複雑さに敏感であることを示している。
  • 手の形ゴールを用いたCDPRは高いGRAを示したが、RLパフォーマンスは最適でなかった。これは、GRAだけでは報酬関数の評価に不十分であり、中間報酬がポリシーを誤導する可能性があることを示している。
  • 特徴エンコーディングネットワークは、状態がゴールと一致する場合にのみ非負の報酬を出力し、正のフィードバックループを回避し、安定した学習を保証した。
  • 結果から、CDPRが複数のゴールインスタンスに変更なしに使用可能であり、クロスドメインのゴール指定における一般化能力が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。