Skip to main content
QUICK REVIEW

[論文レビュー] f-Divergence constrained policy improvement

Boris Belousov, Jan Peters|TUbilio (Technical University of Darmstadt)|Dec 29, 2017
Regional Development and Policy被引用数 8
ひとこと要約

本稿は、f-発散の制約を用いた強化学習における方策改善の一般化フレームワークを提案する。標準的なKullback-Leibler(KL)発散にとどまらず、f-発散の一般化により、ソフトマックス(KL)やPearson χ²、Hellingerなど、他のα-発散に対応する新しい更新則を導出。それぞれの発散に対して適合する方策評価手法を組み合わせることで、より柔軟で安定した学習が可能になる。

ABSTRACT

To ensure stability of learning, state-of-the-art generalized policy iteration algorithms augment the policy improvement step with a trust region constraint bounding the information loss. The size of the trust region is commonly determined by the Kullback-Leibler (KL) divergence, which not only captures the notion of distance well but also yields closed-form solutions. In this paper, we consider a more general class of f-divergences and derive the corresponding policy update rules. The generic solution is expressed through the derivative of the convex conjugate function to f and includes the KL solution as a special case. Within the class of f-divergences, we further focus on a one-parameter family of $α$-divergences to study effects of the choice of divergence on policy improvement. Previously known as well as new policy updates emerge for different values of $α$. We show that every type of policy update comes with a compatible policy evaluation resulting from the chosen f-divergence. Interestingly, the mean-squared Bellman error minimization is closely related to policy evaluation with the Pearson $χ^2$-divergence penalty, while the KL divergence results in the soft-max policy update and a log-sum-exp critic. We carry out asymptotic analysis of the solutions for different values of $α$ and demonstrate the effects of using different divergence functions on a multi-armed bandit problem and on common standard reinforcement learning problems.

研究の動機と目的

  • 信頼領域の枠組みをKL発散にとどまらず、より広いf-発散のクラスへ一般化すること。
  • f-発散関数の凸共役を用いて、閉形式の更新則を導出すること。
  • 各f-発散と適合する方策評価手法の1対1対応を確立すること。
  • 異なる発散が異なる探索戦略と学習ダイナミクスを引き起こすかを示すこと。
  • REPS や Exp3 といった既存のアルゴリズムを、統一的なf-発散フレームワークに統合し、新たなアルゴリズム変種を明らかにすること。

提案手法

  • 一般的なf-発散を信頼領域として用いた制約付き最適化により、方策改善を導出する。
  • fの凸共役の微分を用いて、更新則を表現し、KL解を一般化する。
  • 連続的な更新則のスケールを探索するため、α-発散族に注目する。
  • 各f-発散を、たとえばα=2では平均二乗微分報酬の最小化といった、特定の方策評価目的と結びつける。
  • 双対目的関数に対する確率的勾配降下法を用い、残留勾配アルゴリズムの有限温度版、連続的一般化を実現する。
  • 実験では温度を段階的に低下(冷却)させ、探索と活用のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1f-発散制約を用いることで、強化学習における標準的なKLに基づく方策改善をどのように一般化できるか?
  • RQ2任意のf-発散に対して閉形式の更新則は得られるか? また、既知のアルゴリズムとどのように関係するか?
  • RQ3f-発散の選択が探索行動と学習安定性にどのように影響を与えるか?
  • RQ4各f-発散に対して適合する方策評価手法をペアリングできるか? これによりアルゴリズム設計にどのような意味が生じるか?
  • RQ5さまざまなα-発散の漸近的および実験的挙動は、バンディットおよび制御タスクにおいてどのように現れるか?

主な発見

  • Exp3 や勾配バンディットアルゴリズムで用いられるソフトマックス方策更新は、KL発散(α=1)に対応する特殊ケースとして回復される。
  • α=2 の場合、方策更新則は平均二乗微分報酬の最小化に対応し、平均二乗ベルマン誤差最小化と密接に関連する。
  • KL発散を用いる際、対応する方策評価手法として自然に対数和指数(log-sum-exp)評価者が現れ、REPSと類似する。
  • Pearson χ²-発散は、高不確実性の行動に重点を置く方策更新則を導出し、探索を促進する。
  • 実験結果から、異なるα値が異なる学習ダイナミクスを示し、マルチアームバンディットおよび標準的なRLタスクにおいてα=2とα=1.5が優れた性能を示す。
  • 本フレームワークにより、有限温度の双対最適化を用いて残留勾配アルゴリズムの連続的一般化が可能となり、離散的と連続的学習の橋渡しを果たす。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。