Skip to main content
QUICK REVIEW

[논문 리뷰] Average Reward Adjusted Discounted Reinforcement Learning: Near-Blackwell-Optimal Policies for Real-World Applications

Manuel Schneckenreither|arXiv (Cornell University)|2020. 04. 02.
Reinforcement Learning in Robotics참고 문헌 38인용 수 6
한 줄 요약

이 논문은 영구적인 비영점 보상이 존재하는 비에피소딕, 실세계 운영 연구 문제에서 near-Blackwell-최적 정책을 달성하기 위해 평균 보상 추정과 할인 가치 학습을 분리하는 평균 보상 보정 할인 강화학습(ARA-DRL)이라는 새로운 알고리즘을 제안한다. 표준 할인 강화학습과는 달리, ARA-DRL은 할인 가치의 로랑 급수 전개를 사용하여 가치 함수의 불일치를 방지하며, 안정적인 평균 보상을 유지하면서 Q-학습과 표준 RL보다도 M/M/1 도착 제어 문제에서 최적 정책을 일관되게 추론하여 뛰어난 성능을 보인다.

ABSTRACT

Although in recent years reinforcement learning has become very popular the number of successful applications to different kinds of operations research problems is rather scarce. Reinforcement learning is based on the well-studied dynamic programming technique and thus also aims at finding the best stationary policy for a given Markov Decision Process, but in contrast does not require any model knowledge. The policy is assessed solely on consecutive states (or state-action pairs), which are observed while an agent explores the solution space. The contributions of this paper are manifold. First we provide deep theoretical insights to the widely applied standard discounted reinforcement learning framework, which give rise to the understanding of why these algorithms are inappropriate when permanently provided with non-zero rewards, such as costs or profit. Second, we establish a novel near-Blackwell-optimal reinforcement learning algorithm. In contrary to former method it assesses the average reward per step separately and thus prevents the incautious combination of different types of state values. Thereby, the Laurent Series expansion of the discounted state values forms the foundation for this development and also provides the connection between the two approaches. Finally, we prove the viability of our algorithm on a challenging problem set, which includes a well-studied M/M/1 admission control queuing system. In contrast to standard discounted reinforcement learning our algorithm infers the optimal policy on all tested problems. The insights are that in the operations research domain machine learning techniques have to be adapted and advanced to successfully apply these methods in our settings.

연구 동기 및 목표

  • 지속적인 비영점 보상(예: 비용 또는 수익)이 존재하는 실세계 운영 연구 문제에서 표준 할인 강화학습이 실패하는 이유를 규명하는 것.
  • 가치 함수의 불일치를 방지하기 위해 평균 보상과 할인 가치의 분리를 이론적으로 기반으로 한 강화학습 알고리즘을 개발하는 것.
  • 어려운 비에피소딕 결정 문제, 특히 M/M/1 대기열 시스템을 포함한 문제들에 대해 제안된 방법을 경험적으로 검증하는 것.
  • 표준 RL이 실패하는 상황, 특히 비영점 평균 보상 조건 하에서 ARA-DRL이 near-Blackwell-최적 정책을 달성할 수 있음을 보여주는 것.
  • 계층적 공급망 및 생산 계획 시스템에 적용 가능한 이론적으로 타당하고 계산 효율성이 높은 강화학습 프레임워크를 제공하는 것.

제안 방법

  • 평균 보상 추정과 할인 가치 학습을 분리하는 새로운 알고리즘인 평균 보상 보정 할인 강화학습(ARA-DRL)을 도입한다.
  • 할인 상태 가치의 로랑 급수 전개를 사용하여 평균 보상 성분과 일시적 할인 가치 성분을 해석적으로 분리한다.
  • ARA-DRL은 두 개의 별도 학습 프로세스를 유지한다: 하나는 장기적 평균 보상을 추정하기 위한 것이고, 다른 하나는 할인 상태-행동 가치를 업데이트하기 위한 것이다.
  • 알고리즘은 추정된 평균 보상에 기반해 할인 가치 함수를 조정하는 수정된 업데이트 규칙을 적용하여 잘못된 가치 전파를 방지한다.
  • 학습 안정성과 정책 수렴을 향상시키기 위해 감쇠된 학습률과 적응형 엘리프실린드 탐색을 사용한다.
  • 탭류 Q-학습 방식의 업데이트를 구현하고, 알려진 최적 정책이 존재하는 잘 알려진 M/M/1 도착 제어 문제에서 검증한다.

실험 결과

연구 질문

  • RQ1지속적인 비영점 보상(예: 수익 또는 비용 함수)이 존재하는 운영 연구 문제에서 표준 할인 강화학습이 실패하는 이유는 무엇인가?
  • RQ2명시적인 평균 보상 성분 모델링을 통해 near-Blackwell-최적성을 달성할 수 있는 강화학습 알고리즘을 설계할 수 있는가?
  • RQ3평균 보상 추정과 할인 가치 학습을 분리하는 것이 비에피소딕 환경에서 정책 안정성과 수렴성에 어떻게 기여하는가?
  • RQ4실세계 운영 연구 문제에서 ARA-DRL이 표준 Q-학습과 할인 RL보다 보상 누적과 정책 정확성 측면에서 어느 정도 뛰어나게 성능을 발휘할 수 있는가?
  • RQ5평균 보상 추정의 안정성이 ARA-DRL 알고리즘의 수렴성과 성능에 어떤 역할을 하는가?

주요 결과

  • ARA-DRL은 γ₁ = 1.0과 γ₁ = 0.999일 때 M/M/1 도착 제어 시스템에서 3개의 작업을 수용하는 Blackwell-최적 정책을 성공적으로 추론하였으며, 단계당 평균 보상은 각각 29.965와 30.272를 기록하였다.
  • γ₁ = 0.999와 γ₁ = 1.0일 때 ARA-DRL은 최적해와 일치하는 평균 대기열 길이 1.12를 달성하여 정책 최적성의 정당성을 확인하였다.
  • 표준 Q-학습은 γ₁ = 0.99, 0.999, 0.5일 때도 최적에 가까운 정책을 찾지 못했으며, 평균 보상은 33 이하, 평균 대기열 길이는 0.2 이하에 머물렀다.
  • 에피소드 감도가 있는 행동 선택 조차도 Q-학습이 3개의 작업 수용이라는 Blackwell-최적 정책에 도달하지 못했으며, 이는 비영점 평균 보상 환경에서의 그 한계를 드러낸다.
  • ARA-DRL의 하이퍼파라미터 튜닝(예: 학습률 감쇠를 0.8로 증가)은 안정성을 향상시키고, ε ≤ 1 조건에서도 최적 정책 추론을 유지할 수 있도록 하였다.
  • Friedman 검정은 평균 보상과 평균 대기열 길이에 대해 귀무가설을 기각하였으며(p < 3.399e-32 및 p < 2.223e-35), ARA-DRL의 우월성이 통계적으로 유의미하다는 것을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.