Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning in Conflicting Environments for Autonomous Vehicles

Dominik Meyer, Johannes Feldmaier|arXiv (Cornell University)|Oct 22, 2016
Reinforcement Learning in Robotics参考文献 7被引用数 12
ひとこと要約

本稿では、自律走行車両や水中ロボットに関連するニューカムの問題と囚人のジレンマの状況において、変更のない強化学習(RL)エージェントの行動様式を調査する。SARSAおよびAVGQアルゴリズムを用い、ε-greedy探索を適用した結果、RLエージェントは期待効用の最大解に収束し、予測された協力確率に応じて行動を適応させるが、予測精度が0.75の閾値に近づくと一貫した学習に失敗することが示された。

ABSTRACT

In this work, we investigate the application of Reinforcement Learning to two well known decision dilemmas, namely Newcomb's Problem and Prisoner's Dilemma. These problems are exemplary for dilemmas that autonomous agents are faced with when interacting with humans. Furthermore, we argue that a Newcomb-like formulation is more adequate in the human-machine interaction case and demonstrate empirically that the unmodified Reinforcement Learning algorithms end up with the well known maximum expected utility solution.

研究の動機と目的

  • 変更のない強化学習エージェントが、人間と機械の相互作用をモデル化するニューカムの問題や囚人のジレンマのような意思決定ジレンマでどのように動作するかを分析すること。
  • 協力が確率的かつ予測に基づく環境において、標準的なRLアルゴリズムが最適行動を学習できるかどうかを評価すること。
  • 個別および共同報酬設定において、SARSAおよびAVGQ RLエージェントのパフォーマンスをベースライン戦略と比較すること。
  • 報酬構造と予測精度が、協力的・競争的ロボットシナリオにおける学習結果にどのように影響するかを調査すること。
  • 水中保守作業や自律走行といった実世界の応用分野における自律的行動計画に、RLを用いる可能性を評価すること。

提案手法

  • 著者らは、二つの漏れが生じる状況における深海修理ロボットを、相手の行動を統計モデルに基づいて予測するというニューカムに類似した意思決定問題としてモデル化した。
  • エージェントが漏れを修復するかしないかの選択を表すために、二腕バンディットの定式化が用いられ、報酬はレグルート(負の報酬)に基づく。
  • SARSAおよびAVGQ(平均Q値)アルゴリズムをε-greedy探索とともに適用し、学習率α=0.1、割引率γ=0.9、ε=0.1を用い、50回の平均を取った10,000反復の実験を実施した。
  • 環境には、相手ロボットの行動をどの程度正確に予測できるかを模擬する予測メカニズムが組み込まれており、エージェントの行動予測能力を再現している。
  • ベースラインとして、常に修復するエージェントと、決して修復しないエージェントの2種類を用い、学習エージェントとのパフォーマンス比較を実施した。
  • 学習結果への影響を評価するために、個別レグルート(I)および総合レグルート(T)の報酬設定を評価した。

実験結果

リサーチクエスチョン

  • RQ1SARSAやAVGQといった標準的な強化学習アルゴリズムは、アルゴリズムの変更なしに、ニューカムに類似した意思決定ジレンマで最適行動を学習できるか?
  • RQ2相手の行動予測精度が、協力的・競争的状況下におけるRLエージェントの学習パフォーマンスと行動選択にどのように影響するか?
  • RQ3報酬構造(個別レグルート対総合レグルート)が、囚人のジレンマ設定下でのRLエージェントの学習結果および収束行動に顕著に影響を与えるか?
  • RQ4RL学習が崩壊する協力確率の閾値はどの程度であり、その理由は何か?
  • RQ5未変更のRLエージェントが、対立的環境において期待効用の最大解にどの程度収束するか?

主な発見

  • SARSAおよびAVGQエージェントは、相手の協力確率が非常に高いか非常に低い場合には、期待効用を最大化する行動を学習し、それに応じて行動を適応させることが確認された。
  • 相手の協力確率が0.75に近づくと、RLエージェントは一貫したパターンを識別できず、ランダムな行動選択に回帰するため、学習の失敗点が特定された。
  • 図1(c)の報酬結果は、エージェントのパフォーマンスが期待効用解に非常に近いことを確認しており、一貫した予測条件下で最適行動が出現していることを示している。
  • 個別レグルート設定では、修復しないことが最適戦略となるが、総合レグルート設定では修復が優位になる。これは、ジレンマの本質がRLシミュレーションでも保持されていることを示している。
  • AVGQは、標準的なSARSAよりも一貫性があり、特に予測精度が高い状況下で期待効用解に近い学習を達成しており、パフォーマンスが優れている。
  • 結果から、報酬構造と学習アルゴリズムの選択がエージェント行動に顕著に影響することが示され、自律意思決定システムにおける報酬形状の重要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。