Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Joint Optimization of Multiple Rewards

Mridul Agarwal, Vaneet Aggarwal|arXiv (Cornell University)|Sep 6, 2019
Age of Information Optimization参考文献 57被引用数 4
ひとこと要約

本稿では、公平性指標を含む長期平均報酬の非線形関数を通じて複数の報酬を共同最適化するためのモデルベースおよびモデルフリーモデル強化学習アルゴリズムを提案する。本研究では、$ ilde{O}ig(LKDSig)ig( rac{A}{T}ig)^{1/2}$ のレグレットバウンドを達成し、DQN やヒューリスティックな方策よりも、公平性を重視するスケジューリングタスクで優れた性能を発揮する。

ABSTRACT

Finding optimal policies which maximize long term rewards of Markov Decision Processes requires the use of dynamic programming and backward induction to solve the Bellman optimality equation. However, many real-world problems require optimization of an objective that is non-linear in cumulative rewards for which dynamic programming cannot be applied directly. For example, in a resource allocation problem, one of the objectives is to maximize long-term fairness among the users. We notice that when an agent aim to optimize some function of the sum of rewards is considered, the problem loses its Markov nature. This paper addresses and formalizes the problem of optimizing a non-linear function of the long term average of rewards. We propose model-based and model-free algorithms to learn the policy, where the model-based policy is shown to achieve a regret of $\Tilde{O}\left(LKDS\sqrt{\frac{A}{T}} ight)$ for $K$ objectives combined with a concave $L$-Lipschitz function. Further, using the fairness in cellular base-station scheduling, and queueing system scheduling as examples, the proposed algorithm is shown to significantly outperform the conventional RL approaches.

研究の動機と目的

  • 標準的な動的計画法が報酬の非線形関数最適化においてマルコフ性を失うため、マルコフ決定過程における累積報酬の非線形関数最適化という課題に取り組むこと。
  • 複数の目的を持つ無限時限の逐次意思決定において、新たな平均報酬/ステップの報酬定式化を形式化すること。
  • 凹関数かつリプシッツ連続な共同目的関数を最適化できる確率的方策を学習可能なモデルベースおよびモデルフリーモデル強化学習アルゴリズムを開発すること。
  • 遷移確率が事前に分かっていない状況において、特に比例的公平性や α-公平性といった公平性目的に対して、証明可能なレグレットバウンドを達成すること。
  • 実世界の応用、例えばセルラー基地局スケジューリングやマルチキュー系において、標準的な強化学習手法(例:DQN)やヒューリスティックと比較して優れた性能を示すこと。

提案手法

  • ディリクレ分布を用いた事後分布サンプリングを用いて状態遷移確率を推定し、不確実性下での方策学習を可能にするモデルベースアルゴリズムを提案する。
  • 確率的方策のベルマン誤差解析を用いて、$ ilde{O}ig(LKDSig)ig( rac{A}{T}ig)^{1/2}$ のレグレットバウンドを導出する。
  • 遷移モデルの知識を必要とせず、ニューラルネットワークを用いて確率的方策を最適化するモデルフリーポリシー勾配手法を導入する。
  • 適応的学習率とバッチ学習を用いて、連続的行動空間における方策パラメータを勾配上昇法で更新する。
  • ベルマン誤差に基づく解析を用いて、最適方策からの逸脱度を定量化し、時間枠 T におけるレグレットと関連付ける。
  • 報酬の平均値の凹関数(L-リプシッツ連続)としての目的関数としての定式化を用いて、公平性最適化にフレームワークを適用。α-公平性や重み付き比例的公平性を含む。

実験結果

リサーチクエスチョン

  • RQ1標準的な動的計画法が失敗するマルコフ決定過程において、累積報酬の非線形関数最適化に強化学習を効果的に適用できるか?
  • RQ2マルチエージェントシステムにおける公平性などの共同目的を最適化する際、モデルベースおよびモデルフリーモデル強化学習アルゴリズムが達成できるレグレットバウンドは何か?
  • RQ3提案されたアルゴリズムは、公平性を重視するスケジューリングタスクにおいて、標準的な DQN やヒューリスティックな方策と比較してどのように差をつけるか?
  • RQ4最適方策が本質的に非決定的である場合、ポリシー勾配法を用いて確率的方策を効果的に学習・最適化できるか?
  • RQ5どのような条件下で、共同最適化問題が凸計画または線形計画問題に簡略化されるか?

主な発見

  • モデルベースアルゴリズムは、$ ilde{O}ig(LKDSig)ig( rac{A}{T}ig)^{1/2}$ のレグレットバウンドを達成し、時間枠 T に対してサブ線形かつ、目的数 K や状態数 S と良好にスケーリングする。
  • モデルフリーポリシー勾配アルゴリズムは、キューイングシステムにおける α-公平性と重み付き比例的公平性の最大化において、DQN や LQF ヒューリスティックを著しく上回る性能を発揮する。
  • α-公平性のケースでは、LQF が低負荷条件下で一時的により公平であったにもかかわらず、安定状態性能においては提案アルゴリズムが DQN や LQF を上回る。
  • 低到着率における重み付き比例的公平性では、50回の実行においても提案されたポリシー勾配法が DQN より高い公平性指標を一貫して達成し、中央値と四分位範囲から優れた安定性と性能が示された。
  • フレームワークにより、最大最小および凹関数の共同目的関数の効果的最適化が可能となり、特定の公平性指標では問題が線形計画問題に簡略化される。
  • 結果から、標準的な Q 学習や DQN は非線形報酬関数を捉えることができない一方で、本研究で提案する手法は共同目的関数の直接最適化により成功していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。