Skip to main content
QUICK REVIEW

[論文レビュー] Learning Human Objectives by Evaluating Hypothetical Behavior

Siddharth Reddy, Anca D. Dragan|arXiv (Cornell University)|Dec 5, 2019
Reinforcement Learning in Robotics参考文献 39被引用数 9
ひとこと要約

ReQueST は、複雑で高次元の環境において、軌道最適化を用いて情報的な仮想的エージェント行動を合成することで、人間の報酬関数を効率的に学習する画期的なアクティブラーニング手法である。これらの合成行動についてユーザーにクエリを投げることで、不確実性、報酬の極値、安全性、新規性をターゲットとし、先行手法よりも少ないクエリ数で優れた報酬モデルの一般化と安全性検出を達成する。

ABSTRACT

We seek to align agent behavior with a user's objectives in a reinforcement learning setting with unknown dynamics, an unknown reward function, and unknown unsafe states. The user knows the rewards and unsafe states, but querying the user is expensive. To address this challenge, we propose an algorithm that safely and interactively learns a model of the user's reward function. We start with a generative model of initial states and a forward dynamics model trained on off-policy data. Our method uses these models to synthesize hypothetical behaviors, asks the user to label the behaviors with rewards, and trains a neural network to predict the rewards. The key idea is to actively synthesize the hypothetical behaviors from scratch by maximizing tractable proxies for the value of information, without interacting with the environment. We call this method reward query synthesis via trajectory optimization (ReQueST). We evaluate ReQueST with simulated users on a state-based 2D navigation task and the image-based Car Racing video game. The results show that ReQueST significantly outperforms prior methods in learning reward models that transfer to new environments with different initial state distributions. Moreover, ReQueST safely trains the reward model to detect unsafe states, and corrects reward hacking before deploying the agent.

研究の動機と目的

  • 動的特性、報酬関数、および危険な状態が未知の環境において、直接的なユーザークエリが高コストである状況で、人間の報酬関数を学習する課題に対処すること。
  • 実環境での相互作用を最小限に抑えつつ、仮想的行動に対するユーザーのフィードバックを通じて、報酬モデルを効率的に学習する安全でインタラクティブな手法を開発すること。
  • 特に複雑で連続状態空間を持つ環境において、報酬モデルの一般化と新しい初期状態分布への適合性を向上させること。
  • 実環境でのエージェント実行なしに、リスクを伴うシナリオにエージェントを導入しないまま、報酬ハッキングを早期に検出し、是正できること。
  • 最も情報的な仮想的行動を能動的に選択することで、必要なユーザークエリの数を削減すること。

提案手法

  • ReQueST は、初期状態の生成モデルと、オフポリシーデータ上で訓練された前向きダイナミクスモデルを用いて、仮想的エージェント軌道を合成する。
  • 情報性の高い軌道を生成するために、4つの取得関数(不確実性最大化、報酬最大化、報酬最小化、軌道の新規性最大化)を採用する。
  • 価値の情報(VOI)の正確な計算が困難であるため、計算可能な代理指標を最大化するように軌道最適化を用い、VOIの正確な計算を回避する。
  • これらの合成された行動に対するユーザーのフィードバックを用いてニューラルネットワークベースの報酬モデルを訓練し、収束するまで反復的に改善する。
  • 得られた報酬モデルを用いて、モデルベース強化学習エージェントを最適化し、学習された報酬関数を最適化する。
  • ダイナミクスモデルおよび初期状態モデルを用いた正則化により、クエリの理解可能性と現実性を保証する。

実験結果

リサーチクエスチョン

  • RQ1軌道最適化による仮想的行動の合成は、正確な報酬モデルを学習するために必要なユーザークエリ数を顕著に削減できるか?
  • RQ2ReQueST は、初期状態分布が異なる新しい環境へ移行する際、ベースライン手法と比較してどの程度優れた性能を示すか?
  • RQ3ReQueST は、実環境での相互作用に依存せずに、エージェントのデプロイ前段階で報酬ハッキングを検出し、是正できるか?
  • RQ4ReQueST は、複雑な環境において、危険な状態を安全に学習し、回避する能力をどの程度有しているか?
  • RQ5異なる取得関数(不確実性、報酬最大/最小、新規性)が、さまざまなデータレジームやドメインにおいてモデル性能にどの程度寄与しているか?

主な発見

  • 2DナビゲーションおよびCar Racingのタスクにおいて、ReQueST は、適応されたベースラインと比較して、少なくとも2倍の最終的性能を達成し、優れた一般化能力を示した。
  • 2Dナビゲーションタスクでは、ReQueST は危険な状態を100%正しく危険と分類し、エージェントのデプロイにゼロの失敗を記録したのに対し、ベースラインは75%の失敗を記録した。
  • この手法は、報酬ハッキングを成功裏に検出し、意図しない目的から逸脱する高報酬行動を、デプロイ前段階で同定・是正できた。
  • 不確実性最大化クエリは、ゴール領域およびトラップ領域の境界付近に集約され、これらの領域を定義するモデルの精度が向上した。
  • 報酬最大化クエリは、報酬モデルのバイアスにより初期段階でゴール領域を逸脱して外側に延びたが、高報酬でポリシーに反する行動のユーザーラベル付けにより是正された。
  • 新規性最大化クエリは、マップの隅など代表されていなかった領域を探索し、ゴール領域およびトラップ領域の空間的範囲を学習するのを支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。