Skip to main content
QUICK REVIEW

[論文レビュー] A Learning Based Optimal Human Robot Collaboration with Linear Temporal Logic Constraints

Bo Wu, Bin Hu|arXiv (Cornell University)|May 31, 2017
Robot Manipulation and Learning参考文献 25被引用数 9
ひとこと要約

本稿では、線形時相論理(LTL)制約下における人間-ロボット協調作業のための学習ベース最適タスク割り当てフレームワークを提案する。人間の信頼度と疲労度を、遷移確率が未知のマルコフ決定過程(MDP)としてモデル化する。PAC学習にインspiredされたアルゴリズムを用い、システムモデルを学習し、1タスクサイクルあたりの平均コストを最小化するとともに、LTL仕様を満たす確率を最大化する方策を導出する。性能バウンドにより、真のモデルに基づく最適方策に限りなく近い学習済み方策が得られることを示している。

ABSTRACT

This paper considers an optimal task allocation problem for human robot collaboration in human robot systems with persistent tasks. Such human robot systems consist of human operators and intelligent robots collaborating with each other to accomplish complex tasks that cannot be done by either part alone. The system objective is to maximize the probability of successfully executing persistent tasks that are formulated as linear temporal logic specifications and minimize the average cost between consecutive visits of a particular proposition. This paper proposes to model the human robot collaboration under a framework with the composition of multiple Markov Decision Process (MDP) with possibly unknown transition probabilities, which characterizes how human cognitive states, such as human trust and fatigue, stochastically change with the robot performance. Under the unknown MDP models, an algorithm is developed to learn the model and obtain an optimal task allocation policy that minimizes the expected average cost for each task cycle and maximizes the probability of satisfying linear temporal logic constraints. Moreover, this paper shows that the difference between the optimal policy based on the learned model and that based on the underlying ground truth model can be bounded by arbitrarily small constant and large confidence level with sufficient samples. The case study of an assembly process demonstrates the effectiveness and benefits of our proposed learning based human robot collaboration.

研究の動機と目的

  • 持続的タスクと人間の認知的状態(信頼度、疲労度など)の不確実性を伴う人間-ロボットシステムにおける最適タスク割り当ての課題に対処すること。
  • 1タスクサイクルあたりの平均コストを最小化するとともに、LTL仕様を満たす確率を最大化するフレームワークの開発。
  • 人間の信頼度と疲労度モデルの未知のMDP遷移確率を、効率的かつ保証された精度で学習すること。
  • 真のモデルに基づく最適方策と、学習済みモデルから導出された最適方策との差が、十分なサンプル数のもとで任意に小さくなることを保証すること。
  • 実世界の組立工程における事例研究を通じて、フレームワークの有効性を示すこと。

提案手法

  • タスク、ロボット、人間の疲労度、人間の信頼度モデルを統合したコンポジットMDPとして人間-ロボットシステムをモデル化する。
  • 人間の認知的状態(信頼度、疲労度)を、可能な限り未知の遷移確率を有するMDPとして表現する。
  • PAC学習にインスパイアされたアルゴリズムを用い、高い信頼性と有界な誤差でMDPモデルを学習する。
  • タスク割り当て問題をLTL制約下での最適制御則合成問題として定式化する。
  • 学習済みモデルを用いて、Tサイクルの最適方策をACPC(1サイクルあたりの平均コスト)最小化により計算する。
  • 十分なサンプル数のもとで、学習済み方策と真の最適方策との差が任意に小さくなることを示す理論的バウンドを確立する。

実験結果

リサーチクエスチョン

  • RQ1未知の人間認知的状態ダイナミクスを伴う人間-ロボットシステムにおいて、学習ベースのアプローチが最適タスク割り当て方策を効果的に合成できるか。
  • RQ2線形時相論理(LTL)仕様を確率的で人間-ロボット協調フレームワークに統合し、望ましい長期的行動を保証する方法は何か。
  • RQ3真のモデルに基づく最適方策と、学習済みMDPモデルから導出された最適方策との間の性能ギャップはどの程度か。
  • RQ4未知の遷移確率が存在する状況でも、所望の精度に到達するように学習プロセスを保証する方法は何か。
  • RQ5本稿で提案するフレームワークは、人間の認知的状態の変化を伴う持続的タスク実行において、どの程度のシステム性能を維持できるか。

主な発見

  • 学習アルゴリズムは、812,872サイクルを用い、206秒でMDPモデルを正常に取得し、TサイクルACPCを1.134に達成した。
  • 無限時間ホライゾンにおける最適ACPCは1.128であり、Tサイクル方策が真の最適方策にほぼ同一であることが示された。
  • 十分なサンプル数が得られれば、学習済み方策と真の最適方策との差が、任意に小さな定数で抑えられ、高い信頼性を有することが保証された。
  • フレームワークは、終了状態への無限回の訪問と、故障したロボット状態からの即時回復を要請するLTL仕様を満たすことを保証している。
  • 事例研究により、本手法が現実の組立工程において、コスト最小化とLTL満たしの両立を効果的に実現できることを示した。
  • 本手法は、人間状態のリアルタイム完全観測を仮定しているが、今後の研究で認知的状態センシング技術の進展を活用してこれを緩和することを目的としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。