Skip to main content
QUICK REVIEW

[論文レビュー] Learning Fair Policies in Multiobjective (Deep) Reinforcement Learning with Average and Discounted Rewards

Umer Siddique, Paul Weng|arXiv (Cornell University)|Aug 18, 2020
Reinforcement Learning in Robotics被引用数 13
ひとこと要約

本稿では、割引報酬と平均報酬の両方において一般化ジニ公平性関数を最適化することで、マルチオブジェクティブ強化学習における公平な方策の学習のための新規フレームワークを提示する。理論的に、割引報酬アルゴリズムが平均報酬の公平な方策を近似するために有効であることを正当化し、PPOおよびA2Cを公平性に適合させ、マルチエージェントおよび連続的制御環境において、GGF正則化付きエージェントが標準RLに比べて顕著に優れた公平性(低いCV、高い最小帯域幅)を達成することを実験的に検証した。

ABSTRACT

As the operations of autonomous systems generally affect simultaneously several users, it is crucial that their designs account for fairness considerations. In contrast to standard (deep) reinforcement learning (RL), we investigate the problem of learning a policy that treats its users equitably. In this paper, we formulate this novel RL problem, in which an objective function, which encodes a notion of fairness that we formally define, is optimized. For this problem, we provide a theoretical discussion where we examine the case of discounted rewards and that of average rewards. During this analysis, we notably derive a new result in the standard RL setting, which is of independent interest: it states a novel bound on the approximation error with respect to the optimal average reward of that of a policy optimal for the discounted reward. Since learning with discounted rewards is generally easier, this discussion further justifies finding a fair policy for the average reward by learning a fair policy for the discounted reward. Thus, we describe how several classic deep RL algorithms can be adapted to our fair optimization problem, and we validate our approach with extensive experiments in three different domains.

研究の動機と目的

  • 複数のユーザーに同時に影響を与える自律システムにおける公平性の重要なニーズに対応する。
  • 一般化ジニ社会的福祉関数を用いて、効率性、中立性、公平性をバランスさせる「強化学習における公平最適化」の新たな問題を形式化する。
  • 割引報酬設定と平均報酬設定の間のギャップを埋めるために、新しい近似誤差境界を導出する。
  • 大規模で連続状態のMDPにおける公平な方策学習のため、深層強化学習アルゴリズム(PPO、A2C)を適応させる。
  • GGF正則化付きエージェントが、3つのドメインにおける公平性指標で標準RLおよび重み付き和ベースラインを上回ることを実証的に検証する。

提案手法

  • 一般化ジニ社会的福祉関数を用いて公平性を形式化し、これにより公平性、効率性、中立性が統合される。
  • 定常マルコフ方策が公平最適性において十分であることを証明し、MDPにおける状態依存の公平性を分析する。
  • 割引報酬最適方策を用いて平均報酬最適方策を近似する際の近似誤差に関する新しい理論的境界を導出する。
  • PPOおよびA2Cといった深層強化学習アルゴリズムを、方策目的関数に一般化ジニ関数を正則化子として組み込むことで適応する。
  • 2段階の訓練プロセスを採用:まず割引報酬で事前学習し、その後GGF目的関数を用いて微調整して公平性を向上させる。
  • 3つのドメインでアプローチを検証する:マルチエージェントリソース割り当て、マルチエージェントナビゲーション、連続的制御(DCドメイン)、GGFスコアおよび帯域幅公平性指標を用いる。

実験結果

リサーチクエスチョン

  • RQ1割引報酬最適方策が平均報酬最適方策の公平性の観点からどれほどよく近似できるか、そしてその近似のタイトネスはどの程度制約されるか?
  • RQ2深層強化学習アルゴリズムは、離散的および連続的MDPの両方で一般化ジニ関数による公平性を最適化するためにどのように適応可能か?
  • RQ3一般化ジニ関数を正則化子として用いることで、標準の重み付き和やマックスミニベースラインに比べて公平性(例:低いCV、高い最小効用)が向上するか?
  • RQ4高割引率(例:γ = 0.99999)においてGGF正則化付き方策の性能がロバストであるか、これは平均報酬公平性への収束を示唆するか?
  • RQ5本フレームワークを用いて、連続状態および連続行動環境でも効果的に公平な方策を学習できるか?

主な発見

  • 提案されたGGF正則化付きPPOおよびA2Cエージェントは、帯域幅割り当てにおける係数変動(CV)が顕著に低く抑えられ、標準RLに比べて公平性が向上していることが示された。
  • DC連続的制御ドメインでは、GGF-PPOが標準PPOおよび固定方策を上回り、GGFスコアで優位であり、CVが30%低減され、最小帯域幅も高くなった。
  • γ = 0.99およびγ = 0.99999の実験では、GGF性能がほとんど同一であり、実用的にはγ = 0.99で十分に平均報酬公平性を近似可能であることが示唆された。
  • 割引報酬最適方策と平均報酬最適方策の間の近似誤差に関する理論的境界は、独立して興味深いものであり、割引報酬RLを用いて公平な方策を学習する根拠を提供する。
  • 一般化ジニ関数正則化訓練は、全体のパフォーマンスを損なわず、一貫して公平性を向上させ、3つのドメインすべてで等重量和ベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。