Skip to main content
QUICK REVIEW

[논문 리뷰] Observational Overfitting in Reinforcement Learning

Xingyou Song, Yiding Jiang|arXiv (Cornell University)|2019. 12. 06.
Reinforcement Learning in Robotics참고 문헌 61인용 수 17
한 줄 요약

이 논문은 강화학습에서 관측 과적합(observation overfitting)을 도입하며, 에이전트가 기본 MDP 동역학이 아닌 관측에서 임의의 특징에 과적합함을 보여준다. 고정된 MDP의 관측 공간만 변경함으로써 선형(LQR)과 비선형(MLP, CNN) 정책 모두에서 암묵적 정규화가 나타남을 실험적으로 입증하며, 과다 매개변수화가 일반화 성능을 향상시킴으로써 기존의 SL 스타일 일반화 경계의 타당성을 도전한다.

ABSTRACT

A major component of overfitting in model-free reinforcement learning (RL) involves the case where the agent may mistakenly correlate reward with certain spurious features from the observations generated by the Markov Decision Process (MDP). We provide a general framework for analyzing this scenario, which we use to design multiple synthetic benchmarks from only modifying the observation space of an MDP. When an agent overfits to different observation spaces even if the underlying MDP dynamics is fixed, we term this observational overfitting. Our experiments expose intriguing properties especially with regards to implicit regularization, and also corroborate results from previous works in RL generalization and supervised learning (SL).

연구 동기 및 목표

  • 강화학습에서 일반화 성능 저하의 원인이 동역학이나 아키텍처의 혼동 요인과 별개로 관측 과적합임을 분리하고 분석하는 것.
  • MDP 동역학은 고정하고 관측 공간만 변화시켜 관측 과적합을 연구할 수 있는 사전적 벤치마크 프레임워크를 개발하는 것.
  • 관측 과적합 상황에서 강화학습에서 암묵적 정규화가 발생하는지, 특히 과다 매개변수화된 정책에서 어떻게 나타나는지 조사하는 것.
  • 기존의 일반화 메트릭(예: 노름, 마진)이 관측 과적합 상황에서 RL의 일반화 성능을 예측하는 데 얼마나 효과적인지 평가하는 것.
  • 관측 과적합 상황에서 기존의 지도학습 일반화 경계가 RL에 적용 가능한지에 대한 의문을 제기하며, 이 경계들이 얼마나 느슨한지를 보여주는 것.

제안 방법

  • 고정된 기본 MDP의 관측 함수만 변경하여 MDP의 가족을 구성함으로써 동역학과 보상 구조를 유지한다.
  • 선형 정책를 사용한 선형 제어기(LQR)를 통해 경사하강법을 이용해 관측 과적합 상황에서의 일반화 성능를 분석적으로 연구한다.
  • 기본적인 Gym 환경들(CartPole, LunarLander 등)에 대해 MLP 및 컨볼루션 정책를 적용하여 비선형 상황을 연구한다.
  • 다양한 관측 분포에서 에이전트를 훈련하고, 미리 보지 않은 관측 변형에서의 제로샷 성능을 평가하여 일반화 성능을 측정한다.
  • 학습 중의 가중치 노름 동역학과 마진 분포를 측정하여 암묵적 정규화를 분석하며, 기존의 SL 스타일 일반화 경계와 비교한다.
  • 일반화 메트릭(예: 스펙트럴-프로비니언, 초기화로부터의 거리)을 개선하고, 관측 과적합 상황에서의 테스트 성능과의 상관관계를 테스트한다.

실험 결과

연구 질문

  • RQ1기본 MDP 동역학은 그대로 유지되지만 관측 분포가 변할 경우, 제로샷 일반화 성능이 떨어지는 관측 과적합이 발생하는가?
  • RQ2특히 과다 매개변수화된 신경망을 사용할 때, 관측 과적합 상황에서 강화학습에서 암묵적 정규화가 어느 정도 나타나는가?
  • RQ3기존의 지도학습에서 사용하는 일반화 메트릭(예: 가중치 노름, 마진 분포)이 관측 과적합 상황에서 RL의 일반화 성능을 예측할 수 있는가?
  • RQ4아키텍처 선택(예: MLP 대 CNN)과 관측 모odal(예: 시각적 강조, 가림)이 관측 과적합 상황에서 일반화에 어떤 영향을 미치는가?
  • RQ5기존의 지도학습 일반화 경계가 관측 과적합 상황에서 RL에 적용될 때 여전히 타당하거나 유용한가?

주요 결과

  • 선형 정책와 경사하강법을 사용한 LQR 설정에서는 관측 과적합 상황에서도 정확한 최적화를 해도 일반화 갭이 반드시 존재함을 입증함.
  • CoinRun 환경에서 과다 매개변수화된 MLP는 MDP 동역학이 레벨마다 다를 경우에도 관측 과적합 상황에서 더 잘 일반화됨을 보여주며, 이는 암묵적 정규화가 일반화를 지원함을 시사함.
  • 소닉 더 히어로 핑거에서 스코어보드를 가리는 것으로 테스트 성능이 10% 향상됨(예: NatureCNN 기준 1052에서 1141로, IMPALA 기준 1130에서 1250으로), 이는 에이전트가 비의도적인 시각적 자극에 과적합함을 보여줌.
  • 원시 가중치 노름은 훈련 내내 단조롭게 증가하며 일반화를 예측하지 못함을 확인하여, 기존의 SL 스타일 노름 기반 경계가 RL에 너무 느슨함을 시사함.
  • 마진 분포는 훈련 후 고정된 형태로 수렴하지만, RL에서의 일반화와의 상관관계는 SL만큼 강하지 않아, RL에는 다른 인덕티브 바이어스가 존재함을 시사함.
  • 스펙트럴-프로비니언과 초기화로부터의 거리 메트릭은 원시 노름보다 일반화와의 상관관계가 더 높지만, 여전히 RL에서의 과다 매개변수화 효과를 완전히 설명하기에는 부족함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.