[논문 리뷰] REvolveR: Continuous Evolutionary Models for Robot-to-robot Policy Transfer
REvolveR는 물리 시뮬레이터 내에서 원천 로봇에서 목표 로봇으로 로봇의 형태 및 운동학을 점진적으로 변화시키는 연속적인 진화 모델을 제안한다. 중간 단계에서 부드럽게 변형된 로봇에서 정책을 훈련시킴으로써 이 방법은 뛰어난 샘플 효율성과 보상이 희박한 환경에서 성공을 이룰 수 있으며, 이는 유사 학습이 실패하는 상황에서도 가능하다.
A popular paradigm in robotic learning is to train a policy from scratch for every new robot. This is not only inefficient but also often impractical for complex robots. In this work, we consider the problem of transferring a policy across two different robots with significantly different parameters such as kinematics and morphology. Existing approaches that train a new policy by matching the action or state transition distribution, including imitation learning methods, fail due to optimal action and/or state distribution being mismatched in different robots. In this paper, we propose a novel method named $REvolveR$ of using continuous evolutionary models for robotic policy transfer implemented in a physics simulator. We interpolate between the source robot and the target robot by finding a continuous evolutionary change of robot parameters. An expert policy on the source robot is transferred through training on a sequence of intermediate robots that gradually evolve into the target robot. Experiments on a physics simulator show that the proposed continuous evolutionary model can effectively transfer the policy across robots and achieve superior sample efficiency on new robots. The proposed method is especially advantageous in sparse reward settings where exploration can be significantly reduced. Code is released at https://github.com/xingyul/revolver.
연구 동기 및 목표
- 기존의 유사 학습이 최적의 동작/상태 분포의 불일치로 실패하는, 형태와 역학적 특성이 크게 다른 로봇 간의 정책 전이 문제를 해결한다.
- 특히 복잡하거나 고차원 환경에서 각 새로운 로봇마다 정책을 다시 훈련하는 데서 기인하는 비효율성과 비현실성을 해결한다.
- 탐색이 어려우며 성공 신호가 희박한 환경에서 정책 전이를 효과적으로 가능하게 한다.
- 어려운 로봇 간 정책 전이 문제를 더 쉽게 풀 수 있는 점진적 정책 보정 작업의 시퀀스로 분해할 수 있는 확장 가능한 프레임워크를 개발한다.
- 지역 랜덤화된 진화 및 진화 보상 설계와 같은 새로운 구성 요소를 통해 훈련의 안정성과 샘플 효율성을 향상시킨다.
제안 방법
- 물리 시뮬레이터 내에서 다리 길이, 질량, 손가락 구성 등 다양한 매개변수를 부드럽게 변화시켜 원천 로봇과 목표 로봇 사이를 연결하는 연속적인 진화 모델을 정의한다.
- 진화가 점진적으로 진행되는 중간 단계의 로봇에서 정책을 훈련시어 변화하는 역학적 특성에 대한 점진적 적응을 가능하게 한다.
- 각 훈련 에포크에서 진화 매개변수의 작은 범위 내에서 랜덤으로 선택된 로봇의 부분 집합을 샘플링하는 지역 랜덤화된 진화 전략을 구현하여 정책의 강건성과 일반화 능력을 향상시킨다.
- 진화 보상 설계를 도입하여 더 진화된 로봇에서 발생하는 전이에 더 높은 보상을 할당함으로써 목표 로봇으로의 빠른 수렴을 유도한다.
- 로봇 매개변수를 연속 공간에서 표현하기 위해 미분 가능한 보간 기법을 사용하여 부드러운 전이와 기울기 기반 최적화를 가능하게 한다.
- 표준 강화 학습 알고리즘(NPG, SAC 등)과 통합하고 적응형 훈련 스케줄링을 적용하여 샘플 효율성을 향상시킨다.
실험 결과
연구 질문
- RQ1원천 로봇에서 훈련된 정책이 형태와 역학적 특성이 크게 다른 목표 로봇으로 연속적인 진화 프레임워크를 통해 효과적으로 전이될 수 있는가?
- RQ2지역 랜덤화된 진화는 진화하는 로봇 간 정책 전이 과정에서 훈련의 안정성과 강건성을 어떻게 향상시키는가?
- RQ3진화 보상 설계는 정책 전이에서 샘플 효율성과 수렴 속도를 어느 정도 향상시키는가?
- RQ4제안된 방법은 표준 유사 학습과 직접 전이가 실패하는 희박한 보상 환경에서도 성공적인 정책 전이를 달성할 수 있는가?
- RQ5샘플 효율성과 최종 성능 측면에서 연속적인 진화 모델은 직접 전이 및 유사 학습 기반 베이스라인과 비교해 어떻게 성능을 냈는가?
주요 결과
- REvolveR는 밀도 높은 보상 환경과 희박한 보상 환경 모두에서 직접 전이 및 유사 학습 기반 베이스라인을 능가하며, 더 높은 샘플 효율성과 더 빠른 수렴을 달성한다.
- 희박한 보상 환경에서 REvolveR는 진화 보상 설계(h=1.0)를 사용해 6,279.35 ± 290.33개의 최적화 단계 내에 90%의 성공률를 기록했으며, 이는 베이스라인이 학습에 실패한 것과 비교해 뚜렷한 승리이다.
- 지역 랜덤화된 진화의 사용은 에피소드 보상의 표준편차를 감소시켜, 결정론적 진화 대비 훈련의 강건성이 향상되었음을 시사한다.
- 희박한 보상 환경에서도 REvolveR는 밀도 높은 보상으로 훈련된 베이스라인보다 더 적은 최적화 단계를 요구했으며, 이는 뛰어난 샘플 효율성을 보여준다.
- 제거 실험을 통해 지역 랜덤화된 진화와 진화 보상 설계 모두가 성능 향상에 독립적으로 기여하며, 두 요소의 조합이 가장 우수한 성능을 내는 것으로 확인되었다.
- 이 방법은 인간의 시연 기반 방법이 완전히 실패한 복잡한 조작 작업(Hammer, Relocate, Door)에서 다섯 손가락 로봇에서 두 손가락 그립퍼로의 정책 전이를 성공적으로 수행했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.