Skip to main content
QUICK REVIEW

[論文レビュー] Learning Sparse Representations in Reinforcement Learning with Sparse Coding

Lei Le, Raksha Kumaraswamy|arXiv (Cornell University)|Jul 26, 2017
Reinforcement Learning in Robotics参考文献 23被引用数 5
ひとこと要約

本稿では、平均二乗報酬誤差目的関数を用いて、辞書、スパースコード、価値関数重みを同時に最適化することで、強化学習におけるコンパクトで判別性の高い表現を学習する、教師ありスパースコーディング手法SCoPEを提案する。非凸最適化であるが、すべての局所的最小値が大域的最小値であることを保証しており、実験的結果では、マウンテンカー、パドルワールド、アクロボットの各環境において、タイルコーディングおよび非教師ありスパースコーディングを上回る性能を示した。

ABSTRACT

A variety of representation learning approaches have been investigated for reinforcement learning; much less attention, however, has been given to investigating the utility of sparse coding. Outside of reinforcement learning, sparse coding representations have been widely used, with non-convex objectives that result in discriminative representations. In this work, we develop a supervised sparse coding objective for policy evaluation. Despite the non-convexity of this objective, we prove that all local minima are global minima, making the approach amenable to simple optimization strategies. We empirically show that it is key to use a supervised objective, rather than the more straightforward unsupervised sparse coding approach. We compare the learned representations to a canonical fixed sparse representation, called tile-coding, demonstrating that the sparse coding representation outperforms a wide variety of tilecoding representations.

研究の動機と目的

  • 強化学習の表現学習におけるスパースコーディングの研究が不足しているという問題に取り組む。
  • 価値関数近似の予測精度を向上させるための、原理的で教師ありのスパースコーディング目的関数を構築する。
  • 辞書と重みの共同学習のための非凸最適化問題が、大域的最小値のみを有することを証明し、最適化を単純化する。
  • 教師ありスパースコーディングが非教師ありスパースコーディングおよび固定タイルコーディング表現を政策評価タスクで上回ることを実験的に検証する。
  • 教師ありおよび非教師ありの損失を組み合わせることで、より優れた判別性を持つ表現空間を制約する有効性を示す。

提案手法

  • 平均二乗報酬誤差(MSRE)に基づく教師あり目的関数を用いて、辞書、スパースコード、価値関数重みの共同最適化を定式化する。
  • 非凸目的関数を最適化するために、交替的近接勾配法を用い、最近の辞書学習における大域的収束に関する理論的結果を活用する。
  • データ再構成のための非教師ありスパースコーディングと、予測精度のための教師ありMSREを組み合わせたハイブリッド損失を導入し、表現品質を向上させる。
  • 予測のための教師信号として、投影ベルマン誤差を用いるが、本目的関数には不適切なため、代替の手法を採用する。
  • Γ収束を用いて、滑らかな正則化子に限らない理論的保証を拡張し、初期化に注意を払わずに収束を可能にする。
  • 初期評価にはバッチ勾配降下法を用い、今後は逐次的および確率的最適化への拡張を検討する。

実験結果

リサーチクエスチョン

  • RQ1政策評価のための判別性のある辞書と価値関数重みを同時に学習できる教師ありスパースコーディング目的関数を設計できるか?
  • RQ2辞書と重みの共同学習のための非凸最適化フレームワークが、大域的最小値への収束を保証するか?
  • RQ3教師ありスパースコーディングは、非教師ありスパースコーディングおよび固定タイルコーディング表現と比較して、予測精度においてどのように異なるか?
  • RQ4教師ありおよび非教師あり損失を組み合わせることで、学習された表現の質およびスパarsityにどのような影響を与えるか?
  • RQ5マウンテンカー、パドルワールド、アクロボットといった多様な強化学習環境において、コンパクトで学習された表現を用いて一般化できるか?

主な発見

  • 提案されたSCoPE手法は、マウンテンカーおよびアクロボットにおいて、コンパクトな表現でもタイルコーディングを上回る低い最終予測誤差を達成した。
  • SCoPEは、スパースパターンが類似しているにもかかわらず、教師あり目的関数のおかげで、非教師ありスパースコーディングを一貫して上回る予測精度を示した。
  • 教師ありおよび非教師あり損失の組み合わせにより、完全に非教師ありの手法よりも滑らかでより分散されたスパースコードが得られた。
  • MSREのみを最適化した場合、得られる表現は判別性が低くなるため、ハイブリッド損失の必要性が確認された。
  • SCoPEは、タイルコーディングよりもテストデータにおけるMSREが良好であったが、パドルワールドでは一部の大きなタイルコーディング設定には劣っていたため、MSREへの過剰適合の可能性が示唆された。
  • 理論的分析により、最小限の条件下で、目的関数のすべての局所的最小値が大域的最小値であることが確認され、初期化に注意を払わずに頑健な最適化が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。