Skip to main content
QUICK REVIEW

[논문 리뷰] Trust the Model When It Is Confident: Masked Model-based Actor-Critic

Feiyang Pan, Jia He|arXiv (Cornell University)|2020. 10. 10.
Reinforcement Learning in RoboticsComputer Science참고 문헌 21인용 수 19
한 줄 요약

이 논문은 불확실성 기반 마스킹을 사용해 모델이 자신감이 있는 상태-행동 쌍에 대해서만 정책 최적화를 제한함으로써 정확도가 떨어지는 모델 롤아웃에 의존도를 줄이는, 새로운 모델 기반 강화학습 알고리즘인 마스킹 모델 기반 액터-크리틱(M2AC)을 제안한다. M2AC는 장수행 롤아웃을 포함한 노이즈가 많은 환경에서 뛰어난 샘플 효율성과 강건성을 확보하며, 연속 제어 벤치마크에서 최신 기술(MBPO 등)을 능가한다.

ABSTRACT

It is a popular belief that model-based Reinforcement Learning (RL) is more sample efficient than model-free RL, but in practice, it is not always true due to overweighed model errors. In complex and noisy settings, model-based RL tends to have trouble using the model if it does not know when to trust the model. In this work, we find that better model usage can make a huge difference. We show theoretically that if the use of model-generated data is restricted to state-action pairs where the model error is small, the performance gap between model and real rollouts can be reduced. It motivates us to use model rollouts only when the model is confident about its predictions. We propose Masked Model-based Actor-Critic (M2AC), a novel policy optimization algorithm that maximizes a model-based lower-bound of the true value function. M2AC implements a masking mechanism based on the model's uncertainty to decide whether its prediction should be used or not. Consequently, the new algorithm tends to give robust policy improvements. Experiments on continuous control benchmarks demonstrate that M2AC has strong performance even when using long model rollouts in very noisy environments, and it significantly outperforms previous state-of-the-art methods.

연구 동기 및 목표

  • 모델 기반 강화학습의 근본적 과제인, 언제 모델을 신뢰할 수 있는지 결정하는 문제를 해결한다. 특히 노이즈가 많거나 데이터가 적은 환경에서의 신뢰 문제를 다룬다.
  • 누적된 모델 오차로 인해 장수행 롤아웃을 사용할 경우 기존 모델 기반 방법의 성능 저하 문제를 해결한다.
  • 모델가 신뢰할 수 있을 때만 모델 생성 데이터를 선택적으로 사용함으로써 샘플 효율성과 강건성을 향상시킨다.
  • 불확실성 인식 마스킹을 통해 모델 기반 롤아웃과 실제 환경 경험을 균형 있게 조합하는 실용적인 알고리즘을 개발한다.
  • 모델 사용을 낮은 오차 영역으로 제한함으로써 진정한 가치 함수에 대한 더 날카로운 경계를 확보하고 정책 성능을 향상시킬 수 있음을 보여준다.

제안 방법

  • 모델의 불확실성에 기반해 모델이 생성한 전이를 걸러내는 마스킹 메커니즘을 제안하여, 높은 신뢰도 예측만 정책 학습에 사용되도록 한다.
  • 불확실성을 고려한 진정한 가치 함수의 모델 기반 하한을 도입함으로써, 마스킹된 롤아웃을 안전하게 사용한 정책 최적화를 가능하게 한다.
  • 예측 불일치를 측정하고 마스킹 결정을 안내하기 위해, 일대다(OvR) 불확실성 추정을 사용한 모델 앙상블을 활용한다.
  • 롤아웃 깊이가 증가할수록 모델 롤아웃 의존도를 점진적으로 줄이기 위해, 선형 감쇠 마스킹 비율 $ w_h = \frac{H_{\text{max}} - h}{2(H_{\text{max}} + 1)} $ 를 구현한다.
  • 하이브리드 액터-크리틱 프레임워크 내에서 마스킹된 모델 롤아웃과 실제 경험 재생을 결합하여 학습 안정성 향상과 일반화 성능 향상을 도모한다.
  • 탐색과 이용 간 균형을 맞추기 위해 페널티 계수 $ \alpha $ 를 적용하며, 분석 실험에서 $ \alpha = 0.001 $ 이 최적임을 확인했다.

실험 결과

연구 질문

  • RQ1모델 기반 롤아웃을 높은 신뢰도 예측 영역으로 제한할 경우, 모델와 실제 환경의 수익 간 격차를 줄일 수 있는가?
  • RQ2불확실성 기반 마스킹은 노이즈가 많거나 복잡한 환경에서 샘플 효율성과 강건성에 어떤 영향을 미치는가?
  • RQ3연속 제어 과제에서 장수행 롤아웃을 위한 최적의 마스킹 전략(예: 마스킹 비율, 모드)은 무엇인가?
  • RQ4불확실성 추정 방법의 선택(예: OvR 대비 OvA 또는 음의 가능도)이 알고리즘 성능에 어떤 영향을 미치는가?
  • RQ5고동역 노이즈가 있는 환경에서 장수행 롤아웃을 사용해도 모델 기반 강화학습 알고리즘이 강력한 성능을 유지할 수 있는가?

주요 결과

  • M2AC는 MBPO 및 기타 최신 기술보다 HalfCheetah-noisy2 환경에서 뛰어난 성능을 보이며, MBPO가 실패하는 20단계 모델 롤아웃에서도 높은 수익을 달성한다.
  • HalfCheetah 및 Walker2d 과제에서 M2AC는 노이즈 수준과 롤아웃 길이가 변화하더라도 안정적인 성능을 유지하지만, MBPO는 노이즈가 증가할수록 성능이 급격히 떨어진다.
  • 마스킹 비율 $ w = 0.25 $ (선형 감쇠를 통한)는 다양한 환경과 롤아웃 길이에서 강건한 성능을 보이며, 장수행 롤아웃에서 $ w = 0.9 $ 일 경우 약간의 성능 저하만 발생한다.
  • 정지하지 않는 마스킹된 롤아웃 모드가 하드 스톱 모드보다 우수한 성능을 보이며, 더 풍부한 가상 전이 분포로 정책 일반화 성능을 향상시킨다.
  • 저자료 환경에서 OvR 불확실성 추정이 OvA 불일치 및 음의 가능도보다 우수한 성능을 보이며, 모델 간 불일치를 더 잘 포착한다.
  • $ \alpha = 0.001 $ 일 때 M2AC는 탐색과 이용 간 최적의 균형을 확보하여 모델에 과도하게 피팅되지 않으면서도 예측을 효과적으로 활용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.