Skip to main content
QUICK REVIEW

[論文レビュー] Non-Markovian Reward Modelling from Trajectory Labels via Interpretable Multiple Instance Learning

Joseph Early, Tom Bewley|arXiv (Cornell University)|May 30, 2022
Time Series Analysis and Forecasting被引用数 4
ひとこと要約

本論文は、解釈可能な複数インスタンス学習(MIL)を用いた非マルコフ型報酬モデリングの新しいアプローチを提案する。この手法では、軌道をバッグとし、状態・行動ペアをインスタンスとして扱い、人間のフィードバックにおける時間的依存性をモデル化する。LSTMを用いたMILモデルを用いて、報酬ラベルが付与された軌道から隠れ状態ダイナミクスと報酬関数を再構築し、高い正確性を達成。強化学習(RL)エージェントは、真の報酬にアクセスできない状況でも、性能が同等またはそれ以上の非マルコフ型タスクを解けるようになる。

ABSTRACT

We generalise the problem of reward modelling (RM) for reinforcement learning (RL) to handle non-Markovian rewards. Existing work assumes that human evaluators observe each step in a trajectory independently when providing feedback on agent behaviour. In this work, we remove this assumption, extending RM to capture temporal dependencies in human assessment of trajectories. We show how RM can be approached as a multiple instance learning (MIL) problem, where trajectories are treated as bags with return labels, and steps within the trajectories are instances with unseen reward labels. We go on to develop new MIL models that are able to capture the time dependencies in labelled trajectories. We demonstrate on a range of RL tasks that our novel MIL models can reconstruct reward functions to a high level of accuracy, and can be used to train high-performing agent policies.

研究の動機と目的

  • 人間の軌道評価における時間的依存性を考慮することで、報酬モデリングをマルコフ仮定の枠を超えて一般化すること。
  • 人間フィードバックにおける独立的かつ即時の報酬評価の心理的・実用的限界を解消すること。
  • 報酬ラベルが付与された軌道から、隠れ状態ダイナミクスと報酬関数を再構築する手法を開発すること。
  • 真の報酬や隠れ状態にアクセスできない状況でも、報酬ラベル付きの軌道のみを用いてRLエージェントが高性能なポリシーを学習できるようにすること。
  • 学習された報酬関数や隠れ状態ダイナミクスを検証・理解するための解釈可能性ツールを提供すること。

提案手法

  • 軌道をバッグ、状態・行動ペアをインスタンスとして扱い、非マルコフ型報酬モデリングを複数インスタンス学習(MIL)問題として定式化する。
  • 長短期記憶(LSTM)ネットワークを用いて、複数の軌道にわたる隠れ状態ダイナミクスをモデル化し、インスタンスレベルの報酬予測を推定する。
  • バッグレベルの報酬ラベルから、報酬関数と隠れ状態表現を同時に学習できる、新しいMILモデルアーキテクチャを設計する。
  • 解釈可能性技術を適用し、学習済みモデルの内部表現と意思決定プロセスを分析・検証する。
  • インスタンスレベルのラベルが与えられない状況でも、報酬ラベル付きの軌道からエンドツーエンドにモデルを学習し、報酬と隠れ状態の両方の軌道を推論可能にする。
  • 学習済み報酬モデルをRLトレーニングパイプラインに統合し、非マルコフ型タスクにおけるポリシー性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1複数インスタンス学習は、可視状態では捉えきれない隠れ状態ダイナミクスに依存する非マルコフ型報酬関数を効果的にモデル化できるか?
  • RQ2MILベースのモデルは、報酬ラベルが付与された軌道から、真の隠れ状態と報酬関数をどれほど正確に再構築できるか?
  • RQ3予測された報酬を用いてトレーニングされたRLエージェントは、真の報酬と隠れ状態にアクセスできるエージェントと同等またはそれ以上の性能を達成できるか?
  • RQ4提案されたMILモデルは、軌道データにおけるラベルノイズや分布シフトに対してどれほど頑健か?
  • RQ5解釈可能性分析は、学習済み報酬モデルの内部表現と意思決定プロセスについて、どのような洞察を提供できるか?

主な発見

  • 提案されたMILベースの報酬モデルは、合成的な非マルコフ型環境において、真の報酬関数と隠れ状態軌道を正確に再構築した。
  • モデルは高い報酬ラベル予測精度を達成し、真の隠れ状態にアクセスできるモデルと同等またはそれ以上の性能を示した。
  • MILモデルから得られた予測報酬を用いてトレーニングされたRLエージェントは、真の報酬にアクセスできるエージェントと同等またはそれ以上の性能で非マルコフ型タスクを解消した。
  • 解釈可能性分析の結果、モデルはキーコレクションや宝物領域への進入といった意味のある隠れ状態ダイナミクスを学習しており、人間が推定する軌道の意味論と整合していた。
  • モデルはラベルノイズに対しても頑健であり、報酬ラベルが不正や不一致であっても、強い性能を維持した。
  • 月面着陸機(Lunar Lander)タスクでは、モデルがオラクル報酬関数を上回る実用的改善を学習した。具体的には、エッジから離れた安全なホバーポジションを報酬化するなど、ホバータスクにおける実際の性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。