Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Collaborate in Markov Decision Processes

Goran Radanović, Rati Devidze|arXiv (Cornell University)|2019. 01. 23.
Advanced Bandit Algorithms Research참고 문헌 36인용 수 14
한 줄 요약

이 논문은 한 명의 에이전트(A₁)가 시간이 지남에 따라 정책을 변화시키는 다른 에이전트(A₂)와 협력하는 두 에이전트의 마르코프 결정 과정(MDP)에 대해 새로운 온라인 학습 알고리즘을 제안한다. A₂의 정책 변화 속도가 𝒪(T⁻ᵅ)로 유계일 것이라는 가정 하에, 알고리즘은 𝒪(T^{max{1−(3/7)α, 1/4}})의 하위선형 재해를 달성하며, 이 속도가 계산적으로 필수적임을 입증한다. 이 방법은 비정상적인 전이와 보상을 다루기 위해 최근성 편향과 전문가 학습 기법을 통합하여 부드러운 게임 MDP에서 근사 최적의 공동 수익을 보장한다.

ABSTRACT

We consider a two-agent MDP framework where agents repeatedly solve a task in a collaborative setting. We study the problem of designing a learning algorithm for the first agent (A1) that facilitates a successful collaboration even in cases when the second agent (A2) is adapting its policy in an unknown way. The key challenge in our setting is that the first agent faces non-stationarity in rewards and transitions because of the adaptive behavior of the second agent. We design novel online learning algorithms for agent A1 whose regret decays as $O(T^{\max\{1-\frac{3}{7} \cdot α, \frac{1}{4}\}})$ with $T$ learning episodes provided that the magnitude of agent A2's policy changes between any two consecutive episodes are upper bounded by $O(T^{-α})$. Here, the parameter $α$ is assumed to be strictly greater than $0$, and we show that this assumption is necessary provided that the learning parity with noise problem is computationally hard. We show that sub-linear regret of agent A1 further implies near-optimality of the agents' joint return for MDPs that manifest the properties of a smooth game.

연구 동기 및 목표

  • A₂의 정책 변화가 알려져 있지 않거나 시간이 지남에 따라 변화하는 상황에서도 효과적인 협력을 유지할 수 있도록 A₁을 위한 학습 알고리즘을 설계하는 것.
  • A₂의 행동 변화로 인한 MDP 내 비정상적인 보상과 전이 문제를 다루는 것.
  • 에피소드 수 T에 대해 하위선형으로 감소하는 재해를 가지는 A₁의 이론적 경계를 설정하는 것.
  • 정책 변화 속도가 𝒪(T⁻ᵅ)로 유계일 것이라는 가정이 필요한지, 이를 학습된 파리티 문제로의 환원을 통해 증명하는 것.
  • 게임 이론에서 정의된 부드러운 게임 성질을 만족하는 MDP에서 A₁의 재해가 공동 수익의 근사 최적성과 어떻게 관련되는지 연결하는 것.

제안 방법

  • Rakhlin & Sridharan(2013)과 Syrgkanis 등(2015)의 영감을 받은 최근성 편향 전문가 학습 프레임워크를 사용하여 시간에 민감한 가중치를 적용해 Q-값을 갱신한다.
  • 각 상태를 전문가로 모델링하고, 최근성 편향을 적용한 과거 Q-값의 가중 평균을 사용해 행동에 대한 분포를 유지한다.
  • 각 에피소드 종료 시 A₂의 관측된 행동에 기반해 A₁의 정책를 갱신하며, 비정상성에 대응하기 위해 가중 다수결 방식을 사용한다.
  • α = 0일 경우 하위선형 재해가 계산적으로 불가능해지는 것을 입증하기 위해 학습된 파리티 문제로의 환원을 사용한다.
  • 게임 이론에서 정의한 부드러운 게임 성질을 만족하는 MDP일 경우, 재해 경계가 공동 수익의 근사 최적성으로 이어짐을 보장한다.

실험 결과

연구 질문

  • RQ1두 번째 에이전트의 정책이 시간이 지남에 따라 변화하지만 그 동역학이 알려져 있지 않은 상황에서, 한 에이전트가 효과적으로 협력할 수 있는가?
  • RQ2하위선형 재해를 달성할 수 있는 정책 변화 속도의 최적 비율(𝑇⁻ᵅ)은 무엇인가?
  • RQ3하위선형 재해를 달성하기 위해 𝛼 > 0이라는 가정이 필수적인가? 그리고 이는 계산적 난이도를 통해 증명될 수 있는가?
  • RQ4에이전트 A₁의 재해는 협동 MDP에서 공동 수익의 최적성과 어떻게 관련되는가?
  • RQ5이 프레임워크는 부드러운 게임 MDP 조건 하에서 공동 성능의 근사 최적성을 보장하도록 확장될 수 있는가?

주요 결과

  • A₂의 정책 변화 속도가 𝒪(T⁻ᵅ)이며 𝛼 > 0일 것이라는 가정 하에, T개의 학습 에피소드 동안 제안된 알고리즘이 𝒪(T^{max{1−(3/7)α, 1/4}})의 재해로 제한됨을 입증하였다.
  • 정책 변화 속도의 경계 𝒪(T⁻ᵅ)는 필수적이며, α = 0일 경우 하위선형 재해가 계산적으로 불가능해지며, 학습된 파리티 문제로의 환원을 통해 이를 증명하였다.
  • MDP가 게임 이론에서 정의한 부드러운 게임 성질을 만족할 경우, 하위선형 재해는 공동 수익의 근사 최적성으로 이어진다.
  • 최근성 편향을 전문가 학습 프레임워크에 통합함으로써 비정상적인 전이와 보상을 효과적으로 다룰 수 있었다.
  • 이 방법은 적응형 에이전트를 가진 협동 두 에이전트 MDP에서 이러한 재해 및 공동 성능 보장을 제공하는 최초의 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.