Skip to main content
QUICK REVIEW

[論文レビュー] Positive-Unlabeled Reward Learning

Danfei Xu, Misha Denil|arXiv (Cornell University)|Nov 1, 2019
Adversarial Robustness in Machine Learning参考文献 49被引用数 10
ひとこと要約

本稿では、教師あり強化学習およびGAILに類似した手法における報酬学習を、陽性-未ラベル(PU)学習として再定式化する統一フレームワークであるPositive-Unlabeled Reward Learning(PURL)を提案する。専門家(陽性)とエージェントが生成する(未ラベル)軌道を用いてディスクライマを成功と失敗を区別するように訓練することで、PURLは教師あり学習における報酬の過大評価とGAILにおけるディスクライマの過学習の両方を軽減し、追加の仮定やアノテーションなしに顕著な性能向上を達成する。

ABSTRACT

Learning reward functions from data is a promising path towards achieving scalable Reinforcement Learning (RL) for robotics. However, a major challenge in training agents from learned reward models is that the agent can learn to exploit errors in the reward model to achieve high reward behaviors that do not correspond to the intended task. These reward delusions can lead to unintended and even dangerous behaviors. On the other hand, adversarial imitation learning frameworks tend to suffer the opposite problem, where the discriminator learns to trivially distinguish agent and expert behavior, resulting in reward models that produce low reward signal regardless of the input state. In this paper, we connect these two classes of reward learning methods to positive-unlabeled (PU) learning, and we show that by applying a large-scale PU learning algorithm to the reward learning problem, we can address both the reward under- and over-estimation problems simultaneously. Our approach drastically improves both GAIL and supervised reward learning, without any additional assumptions.

研究の動機と目的

  • スパarsな人間のアノテーションに起因する誤差をエージェントが悪用する、教師あり報酬学習における報酬の錯覚問題に対処すること。
  • 高次元の状態空間において、タスク関連の行動ではなく単純な特徴にディスクライマが過学習する、GAILにおけるディスクライマの過学習問題を解決すること。
  • 教師あり報酬学習とGAILを共通のPU学習フレームワークに統合し、共通の改善を可能にすること。
  • デモンストレーションとポリシー環境の間のドメインギャップが存在する状況でも頑健性を向上させること。
  • 大規模なアルゴリズムを用いたPU学習が、模倣学習におけるより良い一般化性能と性能をもたらすことを実証すること。

提案手法

  • GAILにおけるディスクライマの目的関数を、専門家行動とエージェント行動を区別するものから、成功と失敗を分類するものに再定式化し、専門家の軌道を陽性データとして、エージェントのロールアウトを未ラベルデータとして使用する。
  • Kiryoら(2017)が提唱した大規模なPU学習アルゴリズムを適用して、陽性(専門家)および未ラベル(エージェント)データ上で信頼性の高い分類器を学習させ、負例ラベルの必要性を回避する。
  • 訓練されたディスクライマを強化学習における代理報酬関数として使用し、報酬信号が単なる微細な差異ではなく、信頼性の高い成功検出を反映するようにする。
  • 教師あり報酬学習において、報酬モデルの信頼性が保証される状態空間の領域を特定するためのサポートセット推定モジュールを導入し、PU分類器を訓練する。
  • PU学習理論から導出されたリスク最小化目的関数を採用し、推定されたクラス事前確率を用いて、陽性-未ラベルデータの不均衡を是正する。
  • PU学習を教師ありおよび対抗的模倣学習に統合する、微分可能でエンドツーエンドの訓練パイプラインを実装する。

実験結果

リサーチクエスチョン

  • RQ1スパarsなアノテーションが与えられる状況において、PU学習を用いることで、教師あり模倣学習における報酬モデルの信頼性が向上するか?
  • RQ2GAILのディスクライマを成功/失敗分類器に再定式化することで、高次元状態空間における単純な特徴への過学習が軽減されるか?
  • RQ3教師ありおよび対抗的模倣学習を共通のPU学習目的関数で統合することで、一般化性能と性能が向上するか?
  • RQ4専門家のデモンストレーションとエージェントの環境との間にドメインシフトが生じた場合、PURLはどの程度の性能を示すか?
  • RQ5PU学習は、画像GANのような他のGANベースの生成モデルへも拡張可能か?その場合、サンプル品質が向上するか?

主な発見

  • PURLは報酬の過大評価とディスクライマの過学習を軽減することで、GAILおよび教師あり報酬学習の両方において顕著な性能向上を達成する。
  • 追加の仮定やトレーニング中の人間のフィードバックなしに、サンプル効率と最終的なポリシー性能の両方で大きな向上を実現する。
  • nn-PURLは、ドメインギャップが存在する環境において、標準PURLおよびベースライン手法を上回る性能を示し、分布シフトに対して頑健であることを示す。
  • アブレーションスタディの結果、PU学習アルゴリズムの選択および問題をPU学習として定式化する方法が性能に大きく寄与することが確認された。
  • わずかな割合の状態空間しかアノテートされていなくても、信頼性のある報酬モデリングが可能となり、高価な人間の監視に依存する必要が軽減される。
  • 実験的結果から、提案されたリスク推定とクラス事前確率の取り扱いが、より安定的かつ正確な報酬信号をもたらすことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。