[논문 리뷰] Provably Robust Blackbox Optimization for Reinforcement Learning
이 논문은 강화학습을 위한 증명 가능하게 강건한 비미분 최적화 방법인 RBO(로버스트 블랙박스 최적화)를 소개한다. RBO는 강력한 회귀와 오프-폴리시 기울기 추정을 사용하여 기능 평가의 최대 23%가 임의로 손상된 경우에도 높은 정확도를 달성한다. 이는 기존 방법이 실패하는 노이즈가 많은 환경에서도 효과적인 정책 학습을 가능하게 한다.
Interest in derivative-free optimization (DFO) and "evolutionary strategies" (ES) has recently surged in the Reinforcement Learning (RL) community, with growing evidence that they can match state of the art methods for policy optimization problems in Robotics. However, it is well known that DFO methods suffer from prohibitively high sampling complexity. They can also be very sensitive to noisy rewards and stochastic dynamics. In this paper, we propose a new class of algorithms, called Robust Blackbox Optimization (RBO). Remarkably, even if up to $23\%$ of all the measurements are arbitrarily corrupted, RBO can provably recover gradients to high accuracy. RBO relies on learning gradient flows using robust regression methods to enable off-policy updates. On several MuJoCo robot control tasks, when all other RL approaches collapse in the presence of adversarial noise, RBO is able to train policies effectively. We also show that RBO can be applied to legged locomotion tasks including path tracking for quadruped robots.
연구 동기 및 목표
- 강화학습에서 비미분 최적화(DFO)와 진화 전략(ES)이 겪는 높은 샘플링 복잡도와 노이즈에 대한 민감성 문제를 해결한다.
- 로봇에서 흔한 노이즈가 많은 보상과 확률적 역학적 특성에 의해 취약한 기존 블랙박스 최적화 방법의 취약성을 극복한다.
- 측정치의 상당 부분이 악성으로 손상된 상황에서도 높은 성능을 유지할 수 있는 방법을 개발한다.
- 이전 샘플을 재사용하고 강력한 회귀 기법을 통해 효율적인 오프-폴리시 기울기 추정을 실현한다.
- 제안된 방법이 MuJoCo 벤치마크 작업과 실제 4족 보행 제어 과제에서 효과적임을 입증한다.
제안 방법
- 기울기 필드를 보간하기 위해 가우시안 스무딩과 매트릭스 값 커널을 사용하여 기울기 추정을 정규화된 회귀 문제로 공식화한다.
- 이전 롤아웃을 재사용하여 연속적인 국소 기울기 필드를 추정함으로써 오프-폴리시 학습을 도입하여 샘플링 복잡도를 감소시킨다.
- 함수 평가에서 최대 23%까지 임의로 손상된 경우에도 정확한 기울기 복원을 위해 LP-디코딩을 통한 강력한 회귀를 적용한다.
- 압축 감지와 오류 수정 부호 원리를 활용하여 측정치의 악성 노이즈에 대한 증명 가능한 강건성을 확보한다.
- 노이즈 하에서 추정을 안정화하기 위해 정규화를 적용한 커널 기반의 회귀 프레임워크를 구현한다.
- 강력한 기울기 추정기를 진화 전략 프레임워크에 통합하여 강화학습에서 정책 최적화를 수행한다.
실험 결과
연구 질문
- RQ1강화학습을 위한 비미분 최적화 방법이 기능 평가의 최대 23%가 임의로 손상된 경우에도 높은 성능을 유지할 수 있는가?
- RQ2이전 롤아웃의 오프-폴리시 재사용이 정책 학습을 위한 블랙박스 최적화에서 샘플 효율성을 어떻게 향상시키는가?
- RQ3LP-디코딩과 같은 강력한 회귀 기법이 악성 노이즈 하에서 정확한 기울기 추정을 얼마나 잘 보장할 수 있는가?
- RQ4제안된 방법이 노이즈가 많은 MuJoCo 및 실제 4족 과제에서 최신의 ES와 정책 기울기 알고리즘을 초월하는가?
- RQ5RBO는 본질적으로 노이즈가 많은 보상 신호를 갖는 실제 로봇 응용 분야에서 안정적인 정책 학습을 가능하게 하는가?
주요 결과
- RBO는 20%의 보상이 심각하게 손상된 상황에서도 8개의 MuJoCo 과제 모두에서 정책 학습에 성공했으며, ARS, TRPO, PPO와 같은 다른 방법들은 실패하거나 음수의 보상을 기록했다.
- HalfCheetah (Linear) 과제에서 RBO는 20만 번의 롤아웃 후 중앙값 수익이 4220을 기록했고, ARS는 4205를 기록했으며, TRPO와 PPO는 완전히 실패하여 -Inf로 보고되었다.
- Swimmer 환경에서는 RBO가 중앙값 수익 360을 기록했고, TRPO는 32, PPO는 30에 머물렀으며, ARS는 학습에 실패했다.
- Walker2d 과제에서 RBO는 200만 번의 롤아웃 후 중앙값 수익 2230을 달성했으며, ARS(172), TRPO(996), PPO(312)를 모두 앞섰다.
- Humanoid 과제에서 RBO는 20%의 노이즈 하에서도 중앙값 수익 4865를 기록했고, ARS(2355), TRPO(2028), PPO(2129)를 크게 앞서며 뚜렷한 성능 우위를 보였다.
- Minitaur 과제인 4족 보행 제어에서 RBO는 25%의 노이즈가 있는 측정치 하에서도 강력한 성능을 유지했으며, 전방 보행과 경로 추적 모두에서 ARS를 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.