Skip to main content
QUICK REVIEW

[論文レビュー] Inverse Reinforcement Learning with Multiple Ranked Experts

Pablo Samuel Castro, Shijian Li|arXiv (Cornell University)|Jul 31, 2019
Transportation and Mobility Innovations参考文献 14被引用数 8
ひとこと要約

本稿では、複数の順位付けられた専門家および非専門家を活用して、性能水準間の順序的好みをモデル化することで、より包括的で頑健な報酬関数を回復する、新しい逆強化学習手法を提案する。問題をマージン最大化型順序回帰として定式化することで、最適な行動だけでなく、低順位の示範者から得られる否定的行動まで捉えることができ、都市タクシーのナビゲーションのような複雑な環境において、より正確で一般化可能なポリシーの学習を可能にする。

ABSTRACT

We consider the problem of learning to behave optimally in a Markov Decision Process when a reward function is not specified, but instead we have access to a set of demonstrators of varying performance. We assume the demonstrators are classified into one of k ranks, and use ideas from ordinal regression to find a reward function that maximizes the margin between the different ranks. This approach is based on the idea that agents should not only learn how to behave from experts, but also how not to behave from non-experts. We show there are MDPs where important differences in the reward function would be hidden from existing algorithms by the behaviour of the expert. Our method is particularly useful for problems where we have access to a large set of agent behaviours with varying degrees of expertise (such as through GPS or cellphones). We highlight the differences between our approach and existing methods using a simple grid domain and demonstrate its efficacy on determining passenger-finding strategies for taxi drivers, using a large dataset of GPS trajectories.

研究の動機と目的

  • 従来の逆強化学習手法が専ら専門家の示範に依存しており、真の報酬関数の重要な側面を逃す可能性があるという制限を是正すること。
  • 非専門家の行動フィードバックを統合することでポリシー学習を改善し、エージェントが「何をすべきか」だけでなく「何をすべきでないか」を学習できるようにすること。
  • 性能順位を順序クラスとしてモデル化し、マージン最大化を用いることで、報酬関数回復のための安定的かつ退化しない解を得ること。
  • 実際のGPSトラジェクトリーデータと性能順位を用いて、タクシードライバーの細分化された、データ駆動型の乗客探求戦略を可能にすること。
  • 専門家が特定の地域を避ける環境において、単一専門家IRLの限界を克服し、状態空間の不完全なカバーを防ぐこと。

提案手法

  • 示範者の順位を順序クラスとしてモデル化し、各順位をマージンベースの分類器が区別すべき性能水準として扱う。
  • 報酬関数の回復を、隣接する性能順位間のマージンを最大化する凸最適化問題として定式化し、各示範者の期待特徴ベクトルを用いる。
  • 誤順位付けされた示範者を処理し、ノイズや誤った順位付けに対しても頑健性を確保するために、スラック変数(εおよびζ)を導入する。
  • 解は報酬関数を定義する重みベクトルwであり、これは環境のMDP表現(例えば道路網)上で価値関数を計算するために用いられる。
  • 反復的なMDP解法を必要としないため、各ステップでのポリシー評価を要しない他の手法と比較して、計算が効率的である。
  • スラック値が大きい示範者を特定し、それらを除外するという、増分的またはプルーニングベースの戦略により、示範者の集合を精錬可能である。

実験結果

リサーチクエスチョン

  • RQ1非専門家の行動を統合することで、専門家のみに依存するIRLと比較して、より包括的かつ正確な報酬関数の回復が可能になるか?
  • RQ2マージン最大化を用いて性能順位を順序クラスとしてモデル化することで、従来のIRL手法と比較してより安定的かつ退化しない解が得られるか?
  • RQ3この手法は、専門家のみを観測した場合に見過ごされる報酬関数の隠れた否定的側面を特定できるか?
  • RQ4GPSトラジェクトリーデータと性能順位を用いて、実世界のナビゲーションタスク(例えばタクシードライバーの最適な乗客探求戦略の学習)において、この手法はどの程度有効か?
  • RQ5低順位ドライバーの行動から学習することで、専門家が頻繁に訪れない地域への一般化が可能になるか?

主な発見

  • 専門家がこれらの地域に期待特徴が低かったにもかかわらず、空港、バス停、病院のような高需要の乗客ピックアップゾーンを、本手法は正しく同定した。
  • 専門家が避ける地域である山間部のような低需要地域についても、非専門家の行動に基づき、正しく低収益地域として認識した。
  • アルゴリズムは、価値関数を生成し、市街地部に対して低い値を割り当てた。これは、優れたドライバーが長期的なパフォーマンスを考慮し、高需要・高混雑度地域を避けるという先行研究と整合的である。
  • 非専門家から学習することで、専門家のみに依存するアプローチがしばしば未探索の地域を多く残すのに対し、本手法は都市全体にわたる広範な空間的カバレッジを達成した。
  • スラック変数の使用により、誤順位付けされた示範者の特定が可能となり、それらの外れ値をプルーニングすることで、学習された報酬関数の品質が著しく向上した。
  • 得られたポリシーは、従来のルート探索アルゴリズムよりも細分化された解像度で、タクシードライバーに実行可能なナビゲーション戦略を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。