Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Switch Between Machines and Humans.

Vahid Balazadeh Meresht, Abir De|arXiv (Cornell University)|Feb 11, 2020
Reinforcement Learning in Robotics参考文献 49被引用数 8
ひとこと要約

本稿では、二層構造のマルコフ決定過程を用いて、半自律的システムにおける人間と機械のエージェント間の制御切り替えを学習する強化学習アルゴリズムを提案する。上位互換性境界(UCB)を用いることで、障害物回避シミュレーションにおいて汎用的手法を上回る、非線形のレグルスを達成する。

ABSTRACT

Reinforcement learning agents have been mostly developed and evaluated under the assumption that they will operate in a fully autonomous manner -- they will take all actions. In this work, our goal is to develop algorithms that, by learning to switch control between machine and human agents, allow existing reinforcement learning agents to operate under different automation levels. To this end, we first formally define the problem of learning to switch control among agents in a team via a 2-layer Markov decision process. Then, we develop an online learning algorithm that uses upper confidence bounds on the agents' policies and the environment's transition probabilities to find a sequence of switching policies. We prove that the total regret of our algorithm with respect to the optimal switching policy is sublinear in the number of learning steps. Moreover, we also show that our algorithm can be used to find multiple sequences of switching policies across several independent teams of agents operating in similar environments, where it greatly benefits from maintaining shared confidence bounds for the environments' transition probabilities. Simulation experiments in obstacle avoidance in a semi-autonomous driving scenario illustrate our theoretical findings and demonstrate that, by exploiting the specific structure of the problem, our proposed algorithm is superior to problem-agnostic algorithms.

研究の動機と目的

  • 現実世界のシステムでは人間と機械の協働が求められるにもかかわらず、強化学習の文脈ではエージェントが完全に自律的であると仮定されるというギャップに対処する。
  • 人間エージェントと機械エージェント間の最適な切り替えポリシーを学習するための二層構造のマルコフ決定過程を形式的に定義する。
  • ポリシーと環境ダイナミクスの信頼区間を用いて、切り替えポリシーをオンラインで適応する学習アルゴリズムを開発する。
  • 環境遷移に関する信頼区間を共有することで、複数の独立したエージェントチームにおけるスケーラビリティを実証する。
  • 障害物回避を含む半自律的走行シナリオで本手法を検証し、問題に依存しない手法に比べて優れていることを示す。

提案手法

  • 切り替え制御問題を、上位層が切り替えポリシーを選択し、下位層がエージェントの行動を制御する二層構造のMDPとしてモデル化する。
  • エージェントのポリシーと環境の遷移確率の両方に上位互換性境界(UCB)を用い、探索と活用のバランスを取る。
  • 複数の独立したチーム間で信頼区間を共有することで、サンプル効率を向上させ、計算負荷を低減する。
  • 観測結果と不確実性の推定値に基づいて、動的に切り替えポリシーを更新するオンライン学習アルゴリズムを設計する。
  • 最適な切り替えポリシーに対する理論的非線形レグルスを証明し、長期的な性能収束を保証する。
  • 障害物回避タスクにおいてドメイン固有の構造的仮定を統合することで、学習効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、半自律的システムにおける人間と機械のエージェント間の制御切り替えを学習し、性能を向上させることができるか?
  • RQ2ポリシーと環境遷移の信頼区間をどのように活用することで、動的切り替えシナリオにおけるレグルスを最小化できるか?
  • RQ3複数の独立したエージェントチーム間で信頼区間を共有することは、学習効率と性能にどのような影響を与えるか?
  • RQ4提案手法は、障害物回避のような構造的で現実世界のタスクにおいて、汎用的強化学習手法を上回る性能を示すか?
  • RQ5一般用途のアルゴリズムと比較して、問題の構造を活用することで、学習速度と正確性はどの程度向上するか?

主な発見

  • 提案手法は最適な切り替えポリシーに対する非線形レグルスを達成しており、長期的に近似的に最適な性能に収束することを示している。
  • 半自律的走行環境における障害物回避シミュレーションにおいて、問題に依存しない強化学習ベースラインに比べて、本手法は顕著に優れた性能を示した。
  • 複数の独立したチーム間で信頼区間を共有することで、学習効率が向上し、全体のレグルスが低減した。
  • ポリシーと環境遷移の構造的信頼区間の使用により、複雑なタスクにおける収束速度の向上とより優れた意思決定が可能になった。
  • シミュレーション結果から、ドメイン固有の問題構造を活用することで、一般のRLアプローチを上回るアルゴリズムの性能が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。