Skip to main content
QUICK REVIEW

[논문 리뷰] Prioritizing Samples in Reinforcement Learning with Reducible Loss

Shivakanth Sujit, Somjit Nath|arXiv (Cornell University)|2022. 08. 22.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 딥 강화학습에서 경험 재생의 우선순위 지정을 위한 새로운 방법인 감소 가능 손실(ReLo)을 제안한다. 이 방법은 높은 손실만을 기준으로 하지 않고, 손실 감소 잠재력에 기반해 샘플을 선택한다. 온라인 네트워크와 타겟 네트워크 예측 간의 차이를 측정함으로써 ReLo는 학습 가능한 전이를 식별하여 DM Control Suite 및 Atari와 같은 환경에서 TD 오차를 낮추고 샘플 효율성을 향상시킨다. 이는 균일 샘플링과 우선순위 기반 경험 재생(PER)을 모두 능가한다.

ABSTRACT

Most reinforcement learning algorithms take advantage of an experience replay buffer to repeatedly train on samples the agent has observed in the past. Not all samples carry the same amount of significance and simply assigning equal importance to each of the samples is a naïve strategy. In this paper, we propose a method to prioritize samples based on how much we can learn from a sample. We define the learn-ability of a sample as the steady decrease of the training loss associated with this sample over time. We develop an algorithm to prioritize samples with high learn-ability, while assigning lower priority to those that are hard-to-learn, typically caused by noise or stochasticity. We empirically show that our method is more robust than random sampling and also better than just prioritizing with respect to the training loss, i.e. the temporal difference loss, which is used in prioritized experience replay.

연구 동기 및 목표

  • 균일 샘플링과 손실 기반 샘플링의 비효율성을 해결하기 위해, 경험 재생에서 학습 잠재력이 가장 큰 샘플을 식별하는 것.
  • 우선순위 기반 경험 재생(PER)의 한계를 극복하기 위해, 노이즈나 확률적 성격으로 인해 학습이 어려운 고손실 샘플을 반복적으로 선택하는 문제를 방지하는 것.
  • 학습 가능성(학습 손실을 향후에 줄일 잠재력)을 기반으로 하여 단순하고 저비용의 샘플 우선순위 지정 방법을 개발하는 것.
  • 감소 가능 손실 기반 우선순위 지정이 다양한 강화학습 벤치마크에서 더 견고하고 효율적인 학습을 이끌어내는지 입증하는 것.
  • PER에 대한 이론적으로 탄탄하고 경험적으로 검증된 대안을 제공하여 일반화 성능을 향상시키고 검증용 TD 오차를 감소시키는 것.

제안 방법

  • 주어진 전이에 대해 온라인 Q-네트워크 손실과 타겟 네트워크 손실 간의 차이로 감소 가능 손실(ReLo)을 정의함으로써, 손실 감소 잠재력을 캡처한다.
  • 오프-폴리시 Q-학습 알고리즘에서 타겟 네트워크를 보류 모델의 대체로 사용하여, 추가 학습 없이도 ReLo를 계산한다.
  • 손실을 의미 있게 줄일 수 있는 전이(높은 ReLo 값)를 경험 재생 버퍼 샘플링 시 우선순위로 지정한다.
  • DQN 및 SAC와 같은 기존 오프-폴리시 RL 알고리즘에 ReLo를 최소한의 코드 변경으로 통합하여, 샘플당 하나의 추가 전방향 계산만 필요로 한다.
  • 기존 구성 요소(예: 타겟 네트워크)를 재사용하고 추가 모델 파rameter나 복잡한 최적화를 피함으로써 계산 효율성을 유지한다.
  • PER와 함께 또는 대체로 ReLo를 적용하여, 학습 다이내믹스에 크게 영향을 주지 않으면서도 표준 학습 파이프라인에 쉽게 통합할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1학습 가능성(감소 가능 손실로 측정)을 기반으로 샘플을 우선순위 지정할 경우, 딥 강화학습에서 더 빠르고 안정적인 학습이 이루어지는가?
  • RQ2다양한 환경에서 학습 중 임계 차수(TD) 오차 감소 측면에서 ReLo는 균일 샘플링과 PER보다 어떻게 비교되는가?
  • RQ3ReLo로 달성된 낮은 검증용 TD 오차는 더 나은 샘플 효율성과 최종 에이전트 성능과 관련이 있는가?
  • RQ4ReLo는 최소한의 계산 오버헤드로 기존 오프-폴리시 RL 알고리즘에 통합될 수 있는가?
  • RQ5ReLo는 노이즈나 확률적 성격으로 인해 학습이 어려운 고손실 샘플을 반복적으로 선택하는 PER의 단점을 피할 수 있는가?

주요 결과

  • ReLo는 환경 전반에서 학습 중 TD 오차를 지속적으로 감소시키며, 균일 샘플링과 PER 대비 가장 낮은 손실을 기록한다.
  • DM Control Suite에서 CheetahRun에서는 ReLo가 검증용 TD 오차 0.12 ± 0.033을 달성하여 PER의 0.03 ± 0.003보다 유의미하게 낮게 유지함으로써 더 나은 일반화와 학습 효율성을 보였다.
  • QuadrupedRun에서는 ReLo가 검증용 TD 오차를 0.35 ± 0.067로 낮추었고, PER의 2.24 ± 0.127보다 뛰어난 성능을 보여, 복잡한 운동 제어 작업에서의 우수성을 입증했다.
  • Atari에서는 ReLo가 Rainbow 기준선 대비 유사하거나 略으로 향상된 성능을 유지했으며, Jamesbond에서 TD 오차 1.142 ± 0.174를 기록하여 Rainbow의 1.653 ± 0.819보다 우수함을 보여, 이산 제어에서의 견고성을 입증했다.
  • 낮은 검증용 TD 오차와 더 나은 샘플 효율성 간의 상관관계가 확인되어, ReLo가 학습 잠재력의 효과적인 대체 지표임을 뒷받침한다.
  • ReLo는 타겟 네트워크를 통한 추가 전방향 계산 하나만 필요로 하여 계산 비용이 극히 낮아 실세계 RL 구현에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.