[논문 리뷰] Neural Dynamic Policies for End-to-End Sensorimotor Learning
이 논문은 신경 동적 정책(NDPs)을 소개한다. NDP는 차등 가능하고 두 번째 차수의 동적 시스템—특히 동적 이동 원리(DMPs)—를 사용하여 행동 공간을 재구성함으로써 궤적 분포 공간에서의 엔드 투 엔드 학습을 가능하게 하는 새로운 딥러닝 프레임워크이다. 신경 정책 네트워크에 동적 구조를 통합함으로써, 기존 방법에 비해 연속적이고 고차원적인 로봇 제어 과제에서 이민 학습 및 강화 학습 모두에서 더 뛰어난 샘플 효율성과 성능을 달성한다.
The current dominant paradigm in sensorimotor control, whether imitation or reinforcement learning, is to train policies directly in raw action spaces such as torque, joint angle, or end-effector position. This forces the agent to make decisions individually at each timestep in training, and hence, limits the scalability to continuous, high-dimensional, and long-horizon tasks. In contrast, research in classical robotics has, for a long time, exploited dynamical systems as a policy representation to learn robot behaviors via demonstrations. These techniques, however, lack the flexibility and generalizability provided by deep learning or reinforcement learning and have remained under-explored in such settings. In this work, we begin to close this gap and embed the structure of a dynamical system into deep neural network-based policies by reparameterizing action spaces via second-order differential equations. We propose Neural Dynamic Policies (NDPs) that make predictions in trajectory distribution space as opposed to prior policy learning methods where actions represent the raw control space. The embedded structure allows end-to-end policy learning for both reinforcement and imitation learning setups. We show that NDPs outperform the prior state-of-the-art in terms of either efficiency or performance across several robotic control tasks for both imitation and reinforcement learning setups. Project video and code are available at https://shikharbahl.github.io/neural-dynamic-policies/
연구 동기 및 목표
- 고차원이고 장기적인 로봇 과제에 대해 원시 행동 공간(예: 토크, 관절 각도)에서 직접 정책 학습의 확장성 한계를 해결하기 위해.
- 클래식한 로봇 분야의 동적 시스템(예: DMPs)과 현대 딥러닝을 연결하기 위해, 이를 신경망의 차등 가능 레이어로 통합함으로써.
- 구조화된 궤적 표현을 사용하여 이민 학습 및 강화 학습 설정 모두에서 정책의 엔드 투 엔드 학습을 가능하게 하기 위해.
- 원시 제어 입력 대신 물리적으로 타당한 궤적 분포 공간에서 학습함으로써 일반화 능력과 샘플 효율성을 향상시키기 위해.
제안 방법
- 두 번째 차수 미분 방정식을 사용하여 행동 공간을 재구성하여 궤적 동역학을 모델링하며, 특히 기저 동적 구조로 DMPs를 활용한다.
- 환경 상태에 조건화된 딥 네트워크 특징에서 DMP 매개변수(가중치 및 목표)를 예측함으로써 엔드 투 엔드 역전파를 가능하게 한다.
- 딥 네트워크에 동적 시스템을 차등 가능 레이어로 통합하여 기울기가 시스템을 통해 흐르도록 하여 공동 최적화를 가능하게 한다.
- 실행 시 실시간 피드백 없이도 동작을 생성할 수 있도록 개방 루프 제어기를 사용하여 행동을 생성한다.
- 감독 학습(이민 학습) 또는 강화 학습(보상 기반)을 통해 정책을 엔드 투 엔드로 학습시키며, 구조화된 행동 공간을 활용하여 샘플 효율성을 향상시킨다.
- 고차원 관측에 기반하여 DMPs를 조건화함으로써, 시각 기반 이민 학습 및 딥 강화 학습 설정 모두에 쉽게 통합할 수 있도록 한다.
실험 결과
연구 질문
- RQ1딥 정책에 차등 가능 동적 시스템을 통합하면 연속적 로봇 제어 과제에서 샘플 효율성과 성능이 향상되는가?
- RQ2NDPs를 통해 궤적 분포 공간에서 학습하는 것과 원시 행동 공간에서 직접 학습하는 것 간의 일반화 능력과 확장성 측면에서의 비교는 어떠한가?
- RQ3NDPs는 아키텍처 재설계 없이도 이민 학습 및 강화 학습 설정 양쪽 모두에 효과적으로 적용될 수 있는가?
- RQ4신경 정책에 DMPs를 인덕티브 바이어스로 사용하면 다양한 행동과 과제 간의 일반화 능력이 향상되는가?
주요 결과
- NDPs는 이민 학습 및 강화 학습 설정에서 최신 기술을 초월하여 더 나은 또는 동등한 성능을 달성하면서도 샘플 효율성이 향상된다.
- 이 방법은 궤적 공간에서 사고하는 정책의 엔드 투 엔드 학습을 가능하게 하여 원시 행동 공간에서의 타이밍 별 결정 부담을 줄인다.
- DMP 매개변수를 엔드 투 엔드로 학습함으로써 NDPs는 입력 상태에 따라 동적으로 적응하여 시간과 과제에 걸쳐 다양한 행동 생성이 가능해진다.
- 차등 가능 DMP 레이어 덕분에 기울기가 동적 시스템을 통해 역전파되며, 정책과 궤적 구조의 공동 최적화가 가능해진다.
- 물리적 타당성의 인덕티브 바이어스 덕분에 NDPs는 장기적인 제어 및 고차원 제어 과제를 포함한 다양한 로봇 제어 과제에서 일반화 능력을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.