Skip to main content
QUICK REVIEW

[논문 리뷰] Convergent and Efficient Deep Q Network Algorithm

Zhikang T. Wang, Masahito Ueda|arXiv (Cornell University)|2021. 06. 29.
Reinforcement Learning in Robotics참고 문헌 51인용 수 5
한 줄 요약

이 논문은 표적 네트워크 업데이트 중 손실 증가를 제거함으로써 손실 감소가 단조롭게 유지되며, 고할인 인자(약 0.9998) 조건에서도 수렴을 보장하는 수렴성과 효율성을 갖춘 C-DQN이라는 딥 Q-네트워크 알고리즘을 제안한다. 표준 DQN이 실패하는 여러 아케이드 2600 게임을 성공적으로 학습하여 복잡한 환경에서의 강건성과 확장성을 입증한다.

ABSTRACT

Despite the empirical success of the deep Q network (DQN) reinforcement learning algorithm and its variants, DQN is still not well understood and it does not guarantee convergence. In this work, we show that DQN can indeed diverge and cease to operate in realistic settings. Although there exist gradient-based convergent methods, we show that they actually have inherent problems in learning dynamics which cause them to fail even in simple tasks. To overcome these problems, we propose a convergent DQN algorithm (C-DQN) that is guaranteed to converge and can work with large discount factors (0.9998). It learns robustly in difficult settings and can learn several difficult games in the Atari 2600 benchmark that DQN fails to solve. Our codes have been publicly released and can be used to reproduce our results.

연구 동기 및 목표

  • 딥 Q-네트워크(DQN) 알고리즘의 실증적 성공에도 불구하고 이론적 수렴 보장을 부족하게 하는 문제를 해결한다.
  • 기존의 기울기 기반 수렴성 보장 방법이 학습 동역학이 열악하고 단순한 과제에서도 실패하는 이유를 규명한다.
  • 대규모 강화학습 과제에 적합한 효율성과 확장성을 유지하면서도 수렴성을 보장하는 새로운 DQN 변종을 개발한다.
  • 높은 할인 인자(γ ≈ 0.9998)를 사용한 안정적인 학습과 도전적인 아케이드 2600 환경에서의 강건한 성능을 가능하게 한다.

제안 방법

  • 표적 네트워크 업데이트 시 손실이 증가하지 않도록 보장하는 수정된 손실 함수를 제안하여, 단조로운 감소와 수렴을 보장한다.
  • 학습 안정성을 향상시키기 위해 평균 μ와 표준편차 σ를 초기 경험 전이에서 계산한 \hat{Q} = (Q - μ)/σ의 정규화된 Q-함수를 사용한다.
  • Q-값이 동일할 경우 탐욕 정책 행동에 의도하지 않은 변화가 발생하지 않도록 Q-업데이트에 수정된 학습 규칙을 적용한다.
  • 무작위 정책과 학습된 정책 간 보상 역학을 일치시키기 위해 시간 스케일 인식 정규화 전략을 γ₀를 사용해 도입한다.
  • 수식 기반의 벨만 방정식을 수정한 업데이트 규칙을 사용해 손실 증가를 구조적으로 방지하는 표적 네트워크 업데이트 메커니즘을 구현한다.
  • 실험에서는 학습률을 4×10⁻⁵로 설정하고, γ₀ = 0.9998를 사용하며, 정규화는 첫 50,000개의 전이에서 0 보상 에피소드를 제외한 영역에서 계산한다.

실험 결과

연구 질문

  • RQ1효율성과 확장성을 유지하면서도 이론적 수렴 보장을 보장하는 딥 Q-네트워크 알고리즘을 설계할 수 있는가?
  • RQ2기존의 기울기 기반 수렴성 보장 방법은 이론적으로는 수렴 보장이 되지만 실무에서는 왜 실패하는가?
  • RQ3실제 환경에서 DQN이 발산하는 원인은 무엇이며, 이를 어떻게 이론적으로 해결할 수 있는가?
  • RQ4함수 근사가 존재하는 상황에서도 손실 함수가 학습 내내 단조롭게 감소하도록 구성할 수 있는가?
  • RQ5초할인 인자 설정에서 Q-값의 정규화가 학습 안정성과 수렴에 어떤 영향을 미치는가?

주요 결과

  • C-DQN은 학습 내내 손실 함수가 단조롭게 감소함을 보장하여 이론적 수렴을 확보한다.
  • 표준 DQN이 실패하는 몇몇 아케이드 2600 게임—Hero와 Montezuma’s Revenge—을 성공적으로 학습한다.
  • 높은 할인 인자(γ ≈ 0.9998)를 사용한 안정적인 학습을 달성하여 장기적 계획 수행이 효과적으로 가능해진다.
  • 초기 경험 전이에서 계산한 μ와 σ를 사용한 Q-값 정규화는 학습 안정성과 수렴을 향상시킨다.
  • 같은 실험 설정에서 그림 15에 나타나 있듯이, C-DQN은 더블 DQN과 인간 기준선을 초월한다.
  • 개선에도 불구하고, 보상 역학이 랜덤 정책과 학습된 정책 간에 크게 다를 수 있는 고스pill 환경(예: Breakout)에서는 여전히 정규화 전략이 어려움을 겪는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.