Skip to main content
QUICK REVIEW

[논문 리뷰] Integrating Task-Motion Planning with Reinforcement Learning for Robust Decision Making in Mobile Robots

Yuqian Jiang, Fangkai Yang|arXiv (Cornell University)|2018. 11. 21.
Robotic Path Planning Algorithms참고 문헌 27인용 수 10
한 줄 요약

이 논문은 불확실하고 동적인 환경에서 운영되는 이동 로봇의 강건하고 적응형 의사결정을 가능하게 하기 위해 작업-운동 계획(TMP)과 강화학습(RL)을 통합한 프레임워크인 TMP-RL을 제안한다. 반복적인 TMP를 통해 저비용의 실행 가능 계획을 확보하고, 모델 자유형 RL을 통해 실제 실행 경험에 기반한 계획 개선을 수행함으로써, 순수한 TMP나 작업 계획과 RL을 결합한 TP-RL에 비해 더 빠른 수렴 속도와 향상된 강건성을 달성하며, 다양한 작업 간에 학습된 지식의 전이를 가능하게 한다.

ABSTRACT

Task-motion planning (TMP) addresses the problem of efficiently generating executable and low-cost task plans in a discrete space such that the (initially unknown) action costs are determined by motion plans in a corresponding continuous space. However, a task-motion plan can be sensitive to unexpected domain uncertainty and changes, leading to suboptimal behaviors or execution failures. In this paper, we propose a novel framework, TMP-RL, which is an integration of TMP and reinforcement learning (RL) from the execution experience, to solve the problem of robust task-motion planning in dynamic and uncertain domains. TMP-RL features two nested planning-learning loops. In the inner TMP loop, the robot generates a low-cost, feasible task-motion plan by iteratively planning in the discrete space and updating relevant action costs evaluated by the motion planner in continuous space. In the outer loop, the plan is executed, and the robot learns from the execution experience via model-free RL, to further improve its task-motion plans. RL in the outer loop is more accurate to the current domain but also more expensive, and using less costly task and motion planning leads to a jump-start for learning in the real world. Our approach is evaluated on a mobile service robot conducting navigation tasks in an office area. Results show that TMP-RL approach significantly improves adaptability and robustness (in comparison to TMP methods) and leads to rapid convergence (in comparison to task planning (TP)-RL methods). We also show that TMP-RL can reuse learned values to smoothly adapt to new scenarios during long-term deployments.

연구 동기 및 목표

  • 로봇 실행 중 도메인의 불확실성과 동적 변화를 다루는 데에 한계가 있는 전통적 작업-운동 계획(TMP)의 문제를 해결하기 위해.
  • 운동 계획을 활용해 초기 계획 품질 평가를 수행함으로써 실세계 로봇 구현에서 순수한 강화학습(RL)의 샘플 복잡도와 위험을 감소시키기 위해.
  • 다른 시작 위치와 시나리오에서 이동 로봇 주행 작업에 대해 학습된 값들을 재사용함으로써 장기적인 적응성을 가능하게 하기 위해.
  • TMP와 RL을 폐쇄형 루프로 통합하여 불확실하고 실세계적인 환경에서의 로봇 의사결정의 강건성과 수렴 속도를 향상시키기 위해.

제안 방법

  • 프레임워크는 두 개의 중첩된 계획-학습 루프를 활용한다: 내부 TMP 루프는 연속 공간에서 행동 비용을 평가하기 위해 운동 계획기 피드백을 반복적으로 활용하여 작업 계획을 정교화한다.
  • 외부 RL 루프는 계획을 실행하고 모델 자유형 강화학습을 사용해 실제 경험에서 학습함으로써 계획 품질을 향상시키고 도메인의 불확실성에 적응한다.
  • 이행 비용은 이산적 작업 공간에서 운동 계획기 평가 기반으로 업데이트되며, 실행 및 학습을 위한 실행 가능하고 저비용의 계획만 제안됨을 보장한다.
  • 시간 제약 내에서 계획 품질을 점진적으로 향상시키기 위해 anytime 알고리즘(PETLON)을 사용하며, 더 나은 계획이 발견되지 않으면 현재까지의 최고 계획을 반환한다.
  • 이전 작업에서 학습된 Q-값을 재사용하여 유사한 새로운 시나리오에서의 학습을 가속화함으로써, 다른 시작 위치 간에 지식 전이를 가능하게 한다.
  • 고수준 작업 계획을 위해 기호적 계획(예: 해답 집합 프로그래밍)을, 연속적인 경로 생성을 위해 운동 계획(예: RRT)을 활용한다.

실험 결과

연구 질문

  • RQ1작업-운동 계획과 강화학습을 통합함으로써 이동 로봇 의사결정의 강건성과 적응성은 도메인 불확실성 하에서 향상될 수 있는가?
  • RQ2제안된 TMP-RL 프레임워크는 순수한 TMP와 TP-RL에 비해 학습 수렴 속도와 실행 안정성 측면에서 어떻게 비교되는가?
  • RQ3한 작업에서 학습된 값이 다른 시작 위치를 가진 새로운 유사 작업에서 학습을 가속화하는 데 얼마나 효과적인가?
  • RQ4운동 계획을 사용해 계획 품질을 사전 평가함으로써 RL 학습 중에 고비용이거나 실패 가능성이 있는 실행 횟수를 줄일 수 있는가?

주요 결과

  • TMP-RL은 예측할 수 없는 환경 변화에 민감한 전통적 TMP 방법에 비해 강건성과 적응성을 크게 향상시켰다.
  • TMP-RL은 운동 계획으로부터 고품질의 실행 가능 계획을 초기 단계에서 확보함으로써 TP-RL보다 더 빠른 수렴 속도를 달성했다.
  • TMP-RL과 TMP에서는 TP-RL보다 실행 보상의 분산이 낮아, 계획 품질의 사전 평가로 인해 더 일관된 성능을 보였다.
  • TP-RL은 초기 계획 품질 필터링이 없어 높은 분산을 보이며 많은 열악한 계획을 탐색함으로써 실세계 구현에서 위험과 비용이 증가했다.
  • 첫 번째 작업을 학습함으로써 이후 작업에서 더 빠르고 분산이 낮은 학습이 가능해졌으며, 이는 다른 시작 위치 간에 학습된 rho-값의 효과적인 전이를 보여주었다.
  • 운동 계획이 시간 제약 내에서 더 나은 계획을 찾지 못하더라도, 기반 솔버의 anytime 성질 덕분에 프레임워크는 높은 성능 유지를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.