Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Collaborate in Markov Decision Processes

Goran Radanović, Rati Devidze|arXiv (Cornell University)|Jan 23, 2019
Advanced Bandit Algorithms Research参考文献 36被引用数 14
ひとこと要約

本稿では、1つのエージェント(A₁)が時間とともに変化するもう1つのエージェント(A₂)のポリシーに適応しながらも、効果的な協調を学習できる、協調的二エージェントマルコフ決定過程(MDP)のための新しいオンライン学習アルゴリズムを提案する。A₂のポリシー変化率が𝒪(T⁻ᵅ)で有界であるという仮定の下で、この方法は𝒪(T^{max{1−(3/7)α, 1/4}})の非線形レギュレートを達成し、この変化率が計算的に必要不可欠であることを示している。本手法は、非定常な遷移と報酬に対処するため、最近性バイアスとエキスパート学習技術を統合し、滑らかなゲームMDPにおいてほぼ最適な共同報酬を保証する。

ABSTRACT

We consider a two-agent MDP framework where agents repeatedly solve a task in a collaborative setting. We study the problem of designing a learning algorithm for the first agent (A1) that facilitates a successful collaboration even in cases when the second agent (A2) is adapting its policy in an unknown way. The key challenge in our setting is that the first agent faces non-stationarity in rewards and transitions because of the adaptive behavior of the second agent. We design novel online learning algorithms for agent A1 whose regret decays as $O(T^{\max\{1-\frac{3}{7} \cdot α, \frac{1}{4}\}})$ with $T$ learning episodes provided that the magnitude of agent A2's policy changes between any two consecutive episodes are upper bounded by $O(T^{-α})$. Here, the parameter $α$ is assumed to be strictly greater than $0$, and we show that this assumption is necessary provided that the learning parity with noise problem is computationally hard. We show that sub-linear regret of agent A1 further implies near-optimality of the agents' joint return for MDPs that manifest the properties of a smooth game.

研究の動機と目的

  • A₂の未知かつ適応的変化するポリシーに直面しても、効果的な協調を維持できるように、エージェントA₁の学習アルゴリズムを設計すること。
  • A₂の行動の進化に起因するMDPにおける非定常な報酬と遷移の課題に対処すること。
  • エピソード数Tに対して非線形に減少するA₁の理論的レギュレートバウンドを確立すること。
  • ポリシー変化率の仮定(𝒪(T⁻ᵅ))が、計算的難解性を示すために、学習パリティノイズ問題への還元を用いて必要不可欠であることを示すこと。
  • ゲーム理論で定義されるスムージングゲーム性質を満たすMDPにおいて、A₁のレギュレートが共同報酬のほぼ最適性とどのように関連するかを示すこと。

提案手法

  • Rakhlin & Sridharan (2013) や Syrgkanis et al. (2015) にインspiredされた最近性バイアス付きエキスパート学習フレームワークを用い、時間に依存する重み付けを伴うQ値の適応的更新を行う。
  • 各状態をエキスパートとしてモデル化し、過去のQ値を最近性バイアスを用いた重み付き集約により行動分布を維持する。
  • エピソード終了時にA₂の観測された行動に基づき、非定常性に対処するための重み付き多数派アプローチを用いて、A₁のポリシーを更新する。
  • 非線形レギュレートがα = 0のとき計算的に不可能であることを示すために、学習パリティノイズ問題への還元を用いる。
  • MDPがゲーム理論におけるスムージングゲーム性質を満たす場合、レギュレートバウンドが共同報酬のほぼ最適性を示すことを保証する。

実験結果

リサーチクエスチョン

  • RQ1第二のエージェントのポリシーが時間とともに変化するが、そのダイナミクスが未知の場合に、エージェントは二エージェントMDPにおいて効果的に協調学習を行うことができるか?
  • RQ2非線形レギュレートを達成可能な最適なポリシー変化率(T⁻ᵅの観点から)は何か?
  • RQ3非線形レギュレートを達成するためにα > 0の仮定が必要であり、計算的難解性を用いてこれを証明できるか?
  • RQ4エージェントA₁のレギュレートは、協調的MDPにおける共同報酬の最適性とどのように関連するか?
  • RQ5このフレームワークは、スムージングゲームMDP条件の下で、共同パフォーマンスのほぼ最適性を保証するために拡張可能か?

主な発見

  • 提案されたアルゴリズムは、A₂のポリシー変化率が𝒪(T⁻ᵅ)(α > 0)であるという仮定の下で、T回の学習エピソードにおいて𝒪(T^{max{1−(3/7)α, 1/4}})のレギュレートで有界であることを達成する。
  • ポリシー変化率のバウンド(𝒪(T⁻ᵅ))は必要不可欠であり、α = 0のとき非線形レギュレートは計算的に不可能であることが、学習パリティノイズ問題への還元を用いて証明された。
  • スムージングゲーム性質を満たすMDPにおいて、非線形レギュレートは共同報酬のほぼ最適性を示す。
  • 最近性バイアスをエキスパート学習フレームワークに組み込むことで、非定常な遷移と報酬を効果的に処理する。
  • 本手法は、適応的エージェントを有する協調的二エージェントMDPにおいて、このようなレギュレートおよび共同パフォーマンスの保証を初めて提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。