Skip to main content
QUICK REVIEW

[論文レビュー] Two geometric input transformation methods for fast online reinforcement learning with neural nets

Sina Ghiassian, Huizhen Yu|arXiv (Cornell University)|May 18, 2018
Neuroinflammation and Neurodegeneration Mechanisms参考文献 21被引用数 7
ひとこと要約

本稿では、ReLUニューラルネットワークを用いたオンライン強化学習における深刻な干渉を軽減するための2つの幾何的入力変換手法——タイルコーディングとEmECS——を提案する。入力を局所的一般化を可能にするように変換することで、経験再生を用いずに完全にインクリメンタルな学習が可能となり、標準的なニューラルネットワークや線形関数近似器を用いたタイルコーディングに比べ、より高速かつ高精度な学習が達成される。

ABSTRACT

We apply neural nets with ReLU gates in online reinforcement learning. Our goal is to train these networks in an incremental manner, without the computationally expensive experience replay. By studying how individual neural nodes behave in online training, we recognize that the global nature of ReLU gates can cause undesirable learning interference in each node's learning behavior. We propose reducing such interferences with two efficient input transformation methods that are geometric in nature and match well the geometric property of ReLU gates. The first one is tile coding, a classic binary encoding scheme originally designed for local generalization based on the topological structure of the input space. The second one (EmECS) is a new method we introduce; it is based on geometric properties of convex sets and topological embedding of the input space into the boundary of a convex set. We discuss the behavior of the network when it operates on the transformed inputs. We also compare it experimentally with some neural nets that do not use the same input transformations, and with the classic algorithm of tile coding plus a linear function approximator, and on several online reinforcement learning tasks, we show that the neural net with tile coding or EmECS can achieve not only faster learning but also more accurate approximations. Our results strongly suggest that geometric input transformation of this type can be effective for interference reduction and takes us a step closer to fully incremental reinforcement learning with neural nets.

研究の動機と目的

  • 重みの更新が関数全体を変化させ、過去の知識を忘却する原因となる、ニューラルネットワークを用いたオンライン強化学習における深刻な干渉を解消すること。
  • 経験再生の制限を克服し、ニューラルネットワークを用いた完全にインクリメンタルでオンラインの学習を可能にすること。
  • ReLU活性化関数の幾何的性質に整合する入力変換技術を開発し、局所的一般化を促進し、干渉を低減すること。
  • 幾何的入力変換が、標準的なニューラルネットワークや線形関数近似器を用いた古典的タイルコーディングに比べ、オンラインRL設定で優れた性能を発揮することを実証すること。
  • オフポリシー学習における高次元および現実世界のロボットタスクにまで、幾何的入力手法の適用範囲を拡張すること。

提案手法

  • 入力空間のトポロジー構造を保つ古典的な2値符号化方式であるタイルコーディングを適用し、ReLUニューラルネットワークのためのスパースで局所的に感受性の高い特徴に原始入力を変換する。
  • 入力空間を凸集合の境界に埋め込むことで、ReLUノードに局所的応答を可能にする、新しい幾何的手法であるEmECS(凸集合の極端点埋め込み)を導入する。
  • 変換された入力を、ReLU活性化関数を用いた1層隠れ層を持つニューラルネットワークに入力し、経験再生を用いずにインクリメンタルに学習を実行する。
  • タイルコーディングとEmECSの幾何的性質を活用して、ReLUノードが局所的近傍にのみ反応するように制約し、重み更新時のグローバル干渉を低減する。
  • 学習の安定化とサンプル効率の向上を図るために、選択的トレースを用いた時系列差分学習を用いてネットワークを訓練する。
  • 複数のRLタスクにおいて、標準的なニューラルネットワーク(原始入力)、線形関数近似器を用いたタイルコーディング(TC-Lin)および他のベースラインと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1ReLUニューラルネットワークを用いたオンライン強化学習において、幾何的入力変換が深刻な干渉を軽減できるか?
  • RQ2タイルコーディングとEmECSは、標準的なニューラルネットワークやTC-Linに比べ、オンラインRLにおける学習速度と精度でどのように差をつけるか?
  • RQ3これらの変換により、経験再生を一切用いずに完全にインクリメンタルな学習がどの程度可能になるか?
  • RQ4高次元で現実世界のロボットタスクにおいて、オフポリシーデータを用いた場合、これらの手法はどの程度の性能を示すか?
  • RQ5選択的トレースを幾何的入力変換と組み合わせることで、学習性能がさらに向上するか?

主な発見

  • タイルコーディングを用いたニューラルネットワーク(TC-NN)およびEmECSは、標準的なニューラルネットワークよりも局所的一般化が顕著に向上し、オンライン学習中に深刻な干渉が著しく低減される。
  • 高次元問題において、TC-NNはTC-Linを上回る性能を示し、ニューラルネットワークの非線形性のおかげで優れた関数近似能力を有することが実証された。
  • 150次元のRGB入力を持つKobukiロボットの衝突予測タスクにおいて、TC-NNおよびEmECSはベースライン手法に比べてより高速かつ高精度な学習を達成した。
  • 提案手法に選択的トレースを組み合わせることで、学習速度と精度がさらに向上した。これは、既存のブートストラップ技術と相性が良いことを示唆している。
  • 結果から、幾何的入力変換は、低次元の表形式タスクにとどまらず、複雑で高次元の環境でも有効であることが示された。
  • 線形関数近似器が線形性によって制限を受けるのとは異なり、これらの手法はネットワークの表現能力を制限せずに干渉を低減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。