[논문 리뷰] Reward Estimation for Variance Reduction in Deep Reinforcement Learning
이 논문은 강화학습에서 샘플된 보상의 노이즈나 손상으로 인한 변동성을 줄이기 위해 예상 보상의 직접 추정기(estimated reward)를 학습하여 훈련 중에 노이즈가 있는 또는 손상된 샘플 보상 대신 사용하는 보상 추정 방법을 제안한다. 이 방법은 다양한 스토케스틱 노이즈 유형 하에서 MuJoCo 및 Atari 환경에서 표본 효율성과 수렴 성능을 향상시키며, 실험적으로 상당한 변동성 감소와 성능 향상을 관찰하였다.
Reinforcement Learning (RL) agents require the specification of a reward signal for learning behaviours. However, introduction of corrupt or stochastic rewards can yield high variance in learning. Such corruption may be a direct result of goal misspecification, randomness in the reward signal, or correlation of the reward with external factors that are not known to the agent. Corruption or stochasticity of the reward signal can be especially problematic in robotics, where goal specification can be particularly difficult for complex tasks. While many variance reduction techniques have been studied to improve the robustness of the RL process, handling such stochastic or corrupted reward structures remains difficult. As an alternative for handling this scenario in model-free RL methods, we suggest using an estimator for both rewards and value functions. We demonstrate that this improves performance under corrupted stochastic rewards in both the tabular and non-linear function approximation settings for a variety of noise types and environments. The use of reward estimation is a robust and easy-to-implement improvement for handling corrupted reward signals in model-free RL.
연구 동기 및 목표
- 로봇 공학에서 목표 사양이 어려운 상황에서 발생하는 스토케스틱 또는 손상된 보상 신호로 인한 강화학습의 높은 변동성을 해결하기 위함.
- 환경의 동역학 모델링이 필요 없이도 실용적이고 모델에 종속되지 않은 방법을 개발하여 학습 안정성과 표본 효율성을 향상시키기 위함.
- 원시로 샘플된 보상 대신 예상 보상을 추정하는 것이 표본 수가 적거나 함수 근사가 이루어지는 환경에서 변동성을 낮추고 성능을 향상시킨다는 것을 입증하기 위함.
- 기존의 변동성 감소 기법들 중에서 보상 손상 문제를 명시적으로 다루지 않는 단순하고 강건하며 쉽게 구현 가능한 대안을 제공하기 위함.
제안 방법
- 방법은 각 상태에서의 국소적 예상 보상 $ \hat{R}(s_t) $ 를 추정하는 모델을 학습하여 샘플된 보상 $ r_t $ 를 대체한다.
- 이력 상태-보상 쌍을 사용하여 진짜 예상 보상에 대해 평균 제곱오차를 최소화하는 방식으로 별도의 신경망 또는 함수 근사기로 $ \hat{R}(s_t) $ 를 예측한다.
- 추정된 보상 $ \hat{R}(s_t) $ 는 변동성 감소를 위해 벨먼 백업 및 정책 그래디언트 업데이트에서 $ r_t $ 대신 사용된다.
- 가치 함수 $ V^\pi(s_t) $ 는 시간 차수 타겟에서 추정 보상 $ \hat{R}(s_t) $ 를 사용하여 업데이트된다: $ Y_t = \hat{R}(s_t) + \gamma V^\pi(s_{t+1}) $.
- 이 방법은 연속 제어(MuJoCo) 및 이산 제어(Atari) 벤치마크에서 타블루러 MDP와 딥 강화학습 알고리즘(PPO, SAC 포함)에 적용된다.
- 이 방법은 동역학 모델링이나 계획을 피하고 보상 신호 교정에만 집중하므로 경량이며 기존의 모델에 종속되지 않은 강화학습 프레임워크와 호환된다.
실험 결과
연구 질문
- RQ1손상된 보상 신호 하에서 깊이 있는 강화학습에서 예상 보상에 대한 직접 추정기를 학습시키는 것이 가치 함수 및 정책 업데이트의 변동성을 줄일 수 있는가?
- RQ2보상 신호가 스토케스틱하거나 희박하거나 노이즈에 의해 손상된 경우, 보상 추정은 표준 강화학습 훈련과 비교해 어떻게 성능을 보이는가?
- RQ3이러한 방법은 하프체타 허리케인과 같은 연속 제어 과제에서 표본 효율성과 최종 성능을 유지하거나 향상시키는가?
- RQ4원시로 샘플된 보상 대비 추정 보상 사용 시, 벨먼 백업 연산자에서 변동성이 얼마나 감소하는가?
- RQ5이 방법은 가우시안, 균일, 희박성 등 다양한 유형의 보상 손상 하에서도 일관되게 성능 향상을 보이는가?
주요 결과
- 40% 희박성 노이즈가 있는 HalfCheetah-v2 환경에서 추정 보상 $ \hat{R} $ 의 분산은 29.989로 감소하였고, 손상된 보상 $ R_{corr} $ 의 경우 163.790이었으며, 이는 상당한 변동성 감소를 의미한다.
- 95% 희박성 노이즈 하에서 Hopper-v2 환경의 $ \hat{R} $ 분산은 4.146으로 감소하였고, $ R_{corr} $ 는 72.268였으며, 극단적인 손상 상황에서도 강건함을 입증하였다.
- 표준편차 $ \sigma = 0.4 $ 인 가우시안 노이즈 하에서 Reacher-v2 환경의 $ \hat{R} $ 분산은 1.481로 측정되었고, $ R_{corr} $ 는 13.629였으며, 일관된 변동성 감소를 보였다.
- $ \hat{R} $ 와 진짜 보상 $ R_{true} $ 간의 평균 제곱오차(MSE)는 $ R_{corr} $ 와 $ R_{true} $ 간의 MSE보다 항상 낮았으며, 이는 추정기의 정확성을 확인한다.
- 모든 환경에서 $ \hat{R} $ 를 사용할 경우 MuJoCo 및 Atari 벤치마크에서 수렴 속도 향상과 더 나은 최종 성능가 관찰되었으며, TD 오차 감소와 더 안정적인 학습 곡선이 나타났다.
- 이 방법은 기반 강화학습 알고리즘의 수정 없이도 뚜렷한 성능 향상을 이룩하였으며, 광범위한 호환성과 실용적 유용성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.