Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Asynchronous Policy Iteration for Sequential Zero-Sum Games and Minimax Control

Dimitri P. Bertsekas|arXiv (Cornell University)|2021. 07. 21.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 순차적 제로합 게임과 최소최대 제어 문제를 위한 분산 비동기 정책 반복 프레임워크를 소개한다. 기존 정책 반복에서 발생하는 수렴 문제를 해결하기 위해 교대 플레이어 선택을 사용하는 수축성 벨만 연산자를 사용한다. 이 방법은 균일한 초노름 수축 성질을 통해 전역 수렴을 보장하며, 상태공간 분할과 비동기 업데이트를 통해 확장 가능하고 병렬 실행이 가능한 구현을 가능하게 한다.

ABSTRACT

We introduce a contractive abstract dynamic programming framework and related policy iteration algorithms, specifically designed for sequential zero-sum games and minimax problems with a general structure. Aside from greater generality, the advantage of our algorithms over alternatives is that they resolve some long-standing convergence difficulties of the "natural" policy iteration algorithm, which have been known since the Pollatschek and Avi-Itzhak method [PoA69] for finite-state Markov games. Mathematically, this "natural" algorithm is a form of Newton's method for solving Bellman's equation, but Newton's method, contrary to the case of single-player DP problems, is not globally convergent in the case of a minimax problem, because the Bellman operator may have components that are neither convex nor concave. Our algorithms address this difficulty by introducing alternating player choices, and by using a policy-dependent mapping with a uniform sup-norm contraction property, similar to earlier works by Bertsekas and Yu [BeY10], [BeY12], [YuB13]. Moreover, our algorithms allow a convergent and highly parallelizable implementation, which is based on state space partitioning, and distributed asynchronous policy evaluation and policy improvement operations within each set of the partition. Our framework is also suitable for the use of reinforcement learning methods based on aggregation, which may be useful for large-scale problem instances.

연구 동기 및 목표

  • 비볼록/비볼록 벨만 연산자가 존재하는 최소최대 문제에서 기존 정책 반복의 장기적인 수렴 실패 문제를 해결하기 위해.
  • 순차적 제로합 게임과 최소최대 제어에 적용 가능한 일반적인 추상 동적 프rogramming 프레임워크를 개발하기 위해.
  • 상태공간 분할과 정책 평가/향상 연산을 통해 확장 가능하고 분산적이며 비동기적으로 실행 가능한 구현을 가능하게 하기 위해.
  • 집합 기반 방법을 활용해 대규모 문제를 강화 학습을 통해 처리할 수 있도록 하기 위해.

제안 방법

  • 가중 초노름 수축 조건을 만족하는 벨만 연산자 H(x, u, v, J)를 갖는 수축성 추상 동적 프로그래밍 프레임워크를 도입한다.
  • 교대 플레이어 선택을 사용: 최소화자 u ∈ U(x) 선택, 최대화자 v ∈ V(x) 선택으로, 균일한 수축 모듈러스 α < 1인 Tµ,ν 연산자가 유도된다.
  • 전체 벨만 연산자 T J(x) = infᵤ supᵥ H(x, u, v, J)를 정의하며, 이는 수렴 모듈러스 α를 갖는 수축 매핑으로 증명된다.
  • 상태공간 분할을 통한 분산 비동기 업데이트를 사용한 정책 반복을 구현하여 다수의 프로세서나 에이전트에서 병렬 실행이 가능하다.
  • 균일한 초노름 수축을 갖는 정책 의존 매핑을 적용하여, 기존 뉴턴 유형의 방법이 실패할 경우에도 수렴을 보장한다.
  • 대규모 문제 사례를 위한 집합 기반 방법을 통한 강화 학습 통합을 지원한다.

실험 결과

연구 질문

  • RQ1비볼록/비볼록 성질을 지닌 벨만 연산자가 존재하는 최소최대 문제에서 정책 반복을 전역 수렴 가능하게 만들 수 있는가?
  • RQ2수렴을 잃지 않으면서도 분산적이고 비동기적으로 정책 반복을 어떻게 실행할 수 있는가?
  • RQ3어떤 추상 프레임워크가 순차적 제로합 게임에서 일반성과 수렴 보장을 동시에 확보할 수 있는가?
  • RQ4제안된 방법이 집합 및 강화 학습을 통해 대규모 문제에 어떻게 스케일링 가능한가?
  • RQ5교대 플레이어 선택 메커니즘이 기존 정책 반복에 비해 안정성 향상에 어떻게 기여하는가?

주요 결과

  • 제안된 벨만 연산자 T는 가중 초노름 하에서 수렴 모듈러스 α < 1을 갖는 수축 매핑이며, 이는 유일한 고정점 J*를 보장한다.
  • 이 프레임워크는 비볼록/비볼록 성분으로 인해 전역적으로 실패하는 '자연스러운' 정책 반복 알고리즘의 수렴 문제를 해결한다.
  • 분산 비동기 구현은 가능하며, 상태공간 분할과 각 분할에 대한 독립적 정책 평가/향상으로 인해 수렴 가능하다.
  • 집합 기반 방법을 통해 강화 학습 통합이 가능하여, 대규모 마르코프 게임 및 최소최대 제어 문제에 적합하다.
  • 폴라츠체크와 아비-잇즈하크(1969) 및 호프만과 카프(1966)의 이전 방법보다 일반화되고 향상되었으며, 이들의 방법이 실패할 수 있는 상황에서도 수렴을 보장한다.
  • 균일한 수축 모듈러스 α ∈ (0,1)가 모든 정책 쌍 (µ, ν)에 대해 존재하는 것으로 약한 가정 하에 이론적 수렴이 증명된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.