[논문 리뷰] Active Domain Randomization
활성 도메인 랜덤화(ADR)는 가장 정보가 풍부한 환경 변형에 학습 초점을 맞추기 위해 매개변수 샘플링 전략을 학습하여 Uniform Domain Randomization(UDR)보다 일반화와 강건성을 향상시킵니다.
Domain randomization is a popular technique for improving domain transfer, often used in a zero-shot setting when the target domain is unknown or cannot easily be used for training. In this work, we empirically examine the effects of domain randomization on agent generalization. Our experiments show that domain randomization may lead to suboptimal, high-variance policies, which we attribute to the uniform sampling of environment parameters. We propose Active Domain Randomization, a novel algorithm that learns a parameter sampling strategy. Our method looks for the most informative environment variations within the given randomization ranges by leveraging the discrepancies of policy rollouts in randomized and reference environment instances. We find that training more frequently on these instances leads to better overall agent generalization. Our experiments across various physics-based simulated and real-robot tasks show that this enhancement leads to more robust, consistent policies.
연구 동기 및 목표
- 균일한 무작위화가 왜 높은 분산의 비최적 정책으로 이어질 수 있는지 조사합니다.
- 학습 중 정보가 풍부한 환경 변화를 학습하기 위해 ADR을 제안합니다.
- 시뮬레이션 및 실제 로봇 작업과 고차원 매개변수 공간에서 ADR의 효과를 보여줍니다.
제안 방법
- SVPG(Stein Variational Policy Gradient)로 샘플링 정책이 최적화되는 RL 문제로 도메인 랜덤화(DR)로 형식화합니다.
- 참조 환경과 무작위화된 환경 간 궤적의 차이를 측정하기 위해 판별기를 사용하여 학습 신호를 제공합니다.
- 다양하고 정보가 풍부한 무작위 환경을 제시하기 위해 SVPG 입자 앙상을 학습합니다.
- SVPG 입자가 제시한 환경에서 에이전트 정책을 업데이트하고, 샘플링을 안내하기 위해 판별기를 업데이트합니다.
- 여러 환경에 걸쳐 ADR을 적용하고 일반화 및 강건성 향상을 보여줍니다.
실험 결과
연구 질문
- RQ1무작위화 매개변수를 균일하게 샘플링하는 것이 표적 샘플링에 비해 일반화를 저해하는가?
- RQ2ADR가 일반화와 정책 분산을 다양한 작업과 무작위화 공간의 차원에 걸쳐 개선할 수 있는가?
- RQ3샘플링 정책을 정보가 풍부한 환경으로 이끄는 판별자 기반 보상이 효과적인가?
- RQ4ADR로 학습된 정책이 UDR로 학습된 정책보다 실제 로봇으로의 시뮬레이션-실제 전이에서 더 견고하게 전이되는가?
주요 결과
- ADR은 UDR가 실패하는 어려운 설정에서 전문가 수준의 일반화에 근접하거나 이를 따라잡습니다.
- ADR은 환경 전반에서 분산이 더 작고 일관된 성능을 보이는 정책을 생성합니다.
- ADR은 고차원 무작위화 공간에서도 확장되며 대상 도메인 보상이 필요 없이 시뮬레이션-실제 전이를 개선합니다.
- 문제가 되는 환경에서 더 자주 학습하는 것이 균일 샘플링보다 더 나은 전반적 일반화를 얻습니다.
- ADR은 어떤 환경 영역이 어려워 더 많은 학습이 필요한지 하이라이트하여 해석 가능성을 제공합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.