Skip to main content
QUICK REVIEW

[논문 리뷰] Thinking While Moving: Deep Reinforcement Learning with Concurrent Control

Ted Xiao, Eric Jang|arXiv (Cornell University)|2020. 04. 13.
Reinforcement Learning in Robotics참고 문헌 29인용 수 16
한 줄 요약

이 논문은 이전 동작이 아직 실행 중일 때도 행동을 결정해야 하는 동시 제어를 위한 딥 강화학습 프레임워크를 제안한다. 시스템 지연을 고려한 연속시간 벨먼 방정식을 제시하고, 동작 완료까지의 시간과 이전 행동을 관측에 추가함으로써, 블로킹 성능을 유지하면서도 정책 실행 시간을 49% 감소시킨 더 빠르고 부드러운 정책을 가능하게 한다. 실제 잡기 작업에서 검증된 바, 이는 실제 로봇 작업에 적합하다.

ABSTRACT

We study reinforcement learning in settings where sampling an action from the policy must be done concurrently with the time evolution of the controlled system, such as when a robot must decide on the next action while still performing the previous action. Much like a person or an animal, the robot must think and move at the same time, deciding on its next action before the previous one has completed. In order to develop an algorithmic framework for such concurrent control problems, we start with a continuous-time formulation of the Bellman equations, and then discretize them in a way that is aware of system delays. We instantiate this new class of approximate dynamic programming methods via a simple architectural extension to existing value-based deep reinforcement learning algorithms. We evaluate our methods on simulated benchmark tasks and a large-scale robotic grasping task where the robot must "think while moving".

연구 동기 및 목표

  • 표준 DRL 방법이 행동을 독립적으로 계산하고 실행하는 블로킹 환경을 전제로 한다는 한계를 해결하기 위해.
  • 실제 로봇 작업에서 동적인 시간 변화 환경을 요구하는 바, 에이전트가 생각하고 동시에 행동할 수 있도록 학습 프레임워크를 개발하기 위해.
  • Q-학습의 수렴 보장을 유지하기 위해 시스템 지연과 행동 이력 정보를 가치 함수에 통합함으로써 동시 설정에서의 수렴 보장을 확보하기 위해.
  • 행동 차단을 피하고 실행 중 연속적인 계획을 허용함으로써 더 빠르고 인간과 유사한 운동을 가능하게 하기 위해.
  • 동시 제어가 블로킹 기준선과 비교해 유사한 작업 성공률을 달성하면서도 정책 실행 시간을 크게 감소시킬 수 있음을 입증하기 위해.

제안 방법

  • 행동 결정과 실행 사이의 시간 지연을 고려한 동시 MDP를 위한 연속시간 벨먼 연산자를 유도한다.
  • 수렴성을 유지하기 위해 수축 성질을 보존하는 방식으로 연속시간 벨먼 방정식을 이산화하며, 시스템 지연을 명시적으로 모델링한다.
  • 동시 시스템 역학을 포착하기 위해 상태 관측치에 시간-동작완료까지의 시간(tAS)과 이전 행동을 추가한다.
  • 이전 행동의 잔여 실행 시간을 인코딩하는 새로운 표현인 벡터-투-고(VTG)를 도입하여, 강인성과 하이퍼파rameter 민감도를 감소시킨다.
  • 기존의 가치 기반 DRL 알고리즘에 동시 지식을 통합할 수 있도록 아키텍처를 수정함으로써 동시 환경에서의 학습을 가능하게 한다.
  • 추론 실험과 실제 로봇의 잡기 작업을 통해 방법의 성능 및 효율성 향상을 검증한다.

실험 결과

연구 질문

  • RQ1값 기반 딥 강화학습 알고리즘이 행동이 차단되지 않는 동시 제어 환경에서 수렴 보장을 유지할 수 있는가?
  • RQ2시간-동작완료까지의 시간과 이전 행동 정보를 통합할 경우, 동시 환경에서의 학습 성능에 어떤 영향을 미치는가?
  • RQ3tAS, 이전 행동, 또는 VTG 중 어떤 표현이 동시 제어 과제에서 가장 강인하고 효율적인 학습을 이끌어내는가?
  • RQ4동시 제어가 블로킹 기준선과 비교해 유사한 작업 성공률을 달성하면서도 정책 실행 시간을 줄일 수 있는가?
  • RQ5동시 계획이 로봇 조작 과제에서 더 부드럽고 인간과 유사한 궤적을 생성하는가?

주요 결과

  • VTG 표현을 사용한 동시 DRL 프레임워크는 대규모 시뮬레이션된 로봇 잡기 과제에서 93.49%의 잡기 성공률을 기록했으며, 블로킹 기준선과 유사한 성능을 달성했고, 에피소드 지속 시간을 31.3% 감소시켰다.
  • 실제 로봇 잡기 과제에서 동시 모델은 블로킹 기준선의 81.43% 대비 68.60%의 잡기 성공률을 기록했지만, 정책 지속 시간은 49% 감소했다(11.52초 대비 22.60초).
  • VTG 표현은 하이퍼파rameter에 가장 민감도가 낮고, 동시 설정에서 블로킹 성능을 가장 잘 복원하는 데 기여했다.
  • 동시 모델은 블로킹 기준선 대비 더 부드럽고 빠른 궤적을 생성했으며, 영상 재생과 동작 완료 시간 감소를 통해 이를 입증했다.
  • 이론적 분석을 통해 수정된 벨먼 연산자가 여전히 수축성을 유지함을 확인했으며, 이는 동시 실행 조건에서도 Q-학습의 수렴 보장을 유지함을 의미한다.
  • 이 방법은 정지가 불가능한 동적인 로봇 작업에 적합하게, 행동 실행 중 실시간 의사결정을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.