Skip to main content
QUICK REVIEW

[논문 리뷰] Trajectory Optimization for Unknown Constrained Systems using Reinforcement Learning

Kei Ota, Devesh K. Jha|arXiv (Cornell University)|2019. 03. 13.
Reinforcement Learning in Robotics참고 문헌 23인용 수 4
한 줄 요약

이 논문은 모델이 알려지지 않은 로봇 시스템의 역학적 제약 조건을 고려해 동적으로 부드럽고 타당한 경로를 가속화하여 학습하는 강화학습(RL) 방법을 제안한다. RRT와 같은 샘플링 기반 플래너로부터 제공되는 기준 경로를 활용함으로써 학습 속도를 향상시키고, 커리큘럼 학습 및 목표 조건화 정책을 통해 목표 위치의 변동에 대한 일반화 능력과 수렴 속도를 향상시킨다. 이는 6-자유도 조작자에서 시뮬레이션 및 실제 실험 모두에서 기준 PID 제어기보다 더 낮은 가속도 프로파일과 향상된 추적 성능을 보이며 슈퍼어리어어지드한다.

ABSTRACT

In this paper, we propose a reinforcement learning-based algorithm for trajectory optimization for constrained dynamical systems. This problem is motivated by the fact that for most robotic systems, the dynamics may not always be known. Generating smooth, dynamically feasible trajectories could be difficult for such systems. Using sampling-based algorithms for motion planning may result in trajectories that are prone to undesirable control jumps. However, they can usually provide a good reference trajectory which a model-free reinforcement learning algorithm can then exploit by limiting the search domain and quickly finding a dynamically smooth trajectory. We use this idea to train a reinforcement learning agent to learn a dynamically smooth trajectory in a curriculum learning setting. Furthermore, for generalization, we parameterize the policies with goal locations, so that the agent can be trained for multiple goals simultaneously. We show result in both simulated environments as well as real experiments, for a $6$-DoF manipulator arm operated in position-controlled mode to validate the proposed idea. We compare the proposed ideas against a PID controller which is used to track a designed trajectory in configuration space. Our experiments show that our RL agent trained with a reference path outperformed a model-free PID controller of the type commonly used on many robotic platforms for trajectory tracking.

연구 동기 및 목표

  • 알 수 없는 동역학과 상태/제어 제약 조건이 존재하는 로봇 시스템에 대해 동적으로 타당하고 부드러운 경로를 생성하는 데 도전하는 것.
  • 사전에 제공된 샘플링 기반 플래너(RRT)로부터의 기준 경로를 활용하여 모델 기반이 아닌 강화학습의 샘플 복잡도를 줄이고 학습 속도를 가속화하는 것.
  • 목표 조건화 정책 파arameterization을 통해 새로운 목표 위치로의 일반화를 가능하게 하는 것.
  • 6-자유도 조작자에서 고정밀 시뮬레이션 및 실제 실험을 통해 방법의 유효성을 검증하는 것.
  • 경로의 부드러움과 수렴 속도 측면에서 전통적인 PID 기반 경로 추적보다 뛰어난 성능을 내는 것.

제안 방법

  • 강화학습 에이전트는 상태-행동 쌍의 Q-값을 추정하는 크리틱 네트워크를 갖춘 목표 조건화 딥 디터민리스틱 정책 그래디언트(DDPG) 알고리즘을 사용하여 학습된다.
  • 커리큘럼 학습 전략이 적용되며, 학습은 더 복잡도가 낮은 작업(예: 짧은 경로, 적은 장애물)에서 시작하여 점차 난이도를 높여 학습 안정성과 수렴 속도를 향상시킨다.
  • 자기 모방(self-imitation)을 통해 과거 성공한 에피소드에서의 고보상 경험을 재사용함으로써 샘플 효율성을 향상시키고, 동적 충돌 페널티로 인한 보상 노이즈를 감소시킨다.
  • RRT로부터 생성된 기준 경로가 지도 데이터로 사용되어 강화학습 에이전트를 안내하며, 탐색 공간을 제한하고 정책 학습 속도를 가속화한다.
  • 액터 및 크리틱 네트워크는 목표 상태에 조건화되어 있어, 정의된 영역 내에서 새로운 목표 위치에 대해 제로샷 일반화가 가능하다.
  • 방법은 시뮬레이션에서 학습된 후 도메인 랜덤라이제이션 또는 튜닝 없이 그대로 실제 6-자유도 조작자에 적용된다.

실험 결과

연구 질문

  • RQ1RRT 플래너로부터의 기준 경로를 유도로 활용할 경우, 모델 기반이 아닌 강화학습 에이전트가 알려지지 않은 제약 조건이 있는 시스템에서 동적으로 부드러운 경로를 효율적으로 학습할 수 있는가?
  • RQ2커리큘럼 학습과 자기 모방이 고차원적이고 제약 조건이 있는 로봇 제어 과제에서 학습 안정성과 수렴 속도를 향상시키는가?
  • RQ3재학습 없이도 국소 영역 내에서 새로운 목표 위치로 일반화가 가능한가?
  • RQ4제안된 방법은 경로의 부드러움과 수렴 시간 측면에서 표준 PID 제어기와 비교해 어떻게 성능이 뛰어나게 되는가?
  • RQ5강화학습 정책이 시뮬레이션에서 실제 6-자유도 조작자에 성공적으로 전이되었는가?

주요 결과

  • 제안된 방법은 커리큘럼 학습 또는 자기 모방 없이 학습하는 것과 비교해 훨씬 더 빠른 수렴 속도와 더 안정적인 학습을 달성했다.
  • 모든 과제에서 기준 PID 제어기 대비 관절 가속도가 크게 감소하여 더 부드러운 제어 입력을 보였다.
  • 모든 과제에서 RL 정책는 목표에 0.22~0.50초 내에 도달했으며, PID 기준은 0.56~1.28초였고, 이는 더 빠른 수렴을 의미한다.
  • 목표 편차에 대한 일반화 성능은 높았으며, 시뮬레이션에서 100×100 mm 목표 영역에서 98% 성공률, 200×200 mm 영역에서 90% 성공률 기록.
  • 실제 실험을 통해 정책이 시뮬레이션에서 실제 로봇으로 성공적으로 전이되었으며, 낮은 가속도와 높은 추적 정확도 유지.
  • RRT 유도, 커리큘럼 학습, 목표 조건화 정책의 조합이 상태 및 제어 제약 조건이 존재하는 복잡한 환경에서 타당한 경로를 학습하는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.