Skip to main content
QUICK REVIEW

[論文レビュー] Playing Atari with Six Neurons

Giuseppe Cuccu, Julian Togelius|arXiv (Cornell University)|Jun 4, 2018
Reinforcement Learning in Robotics参考文献 30被引用数 15
ひとこと要約

本論文は、深層強化学習における特徴抽出と方策学習を分離する新規手法を提案し、2つの新規アルゴリズム—増大辞書ベクトル量子化(IDVQ)と直接残差スパース符号化(DRSC)—を用いて、原始的なアタリゲームフレームからコンパクトで情報豊富な表現を生成する。わずか6〜18ニューロンの小さなニューラルネットワークが、標準の深層強化学習手法と比較して2桁少ないパラメータ数で、複数のアタリゲームで最先端の性能を達成する。

ABSTRACT

Deep reinforcement learning, applied to vision-based problems like Atari games, maps pixels directly to actions; internally, the deep neural network bears the responsibility of both extracting useful information and making decisions based on it. By separating the image processing from decision-making, one could better understand the complexity of each task, as well as potentially find smaller policy representations that are easier for humans to understand and may generalize better. To this end, we propose a new method for learning policies and compact state representations separately but simultaneously for policy approximation in reinforcement learning. State representations are generated by an encoder based on two novel algorithms: Increasing Dictionary Vector Quantization makes the encoder capable of growing its dictionary size over time, to address new observations as they appear in an open-ended online-learning context; Direct Residuals Sparse Coding encodes observations by disregarding reconstruction error minimization, and aiming instead for highest information inclusion. The encoder autonomously selects observations online to train on, in order to maximize code sparsity. As the dictionary size increases, the encoder produces increasingly larger inputs for the neural network: this is addressed by a variation of the Exponential Natural Evolution Strategies algorithm which adapts its probability distribution dimensionality along the run. We test our system on a selection of Atari games using tiny neural networks of only 6 to 18 neurons (depending on the game's controls). These are still capable of achieving results comparable---and occasionally superior---to state-of-the-art techniques which use two orders of magnitude more neurons.

研究の動機と目的

  • 特徴抽出と意思決定を分離することで、極めて小さなニューラルネットワークを用いてアタリゲームにおける方策学習が可能かどうかを調査すること。
  • エンドツーエンドの深層強化学習における制限、すなわち特徴抽出と方策学習が1つの高容量ネットワークに混在している問題に対処すること。
  • 再構成誤差の最小化に依存せずに、オンラインで、開けた状態でコンパクトでスパースな視覚的観測の表現を学習する方法を開発すること。
  • 効率的で適応的な特徴エンコーダーと組み合わせた小さな方策ネットワークが、競争力のある性能を達成できることを示すこと。
  • 視覚ベースの強化学習タスクにおいて、複雑なエンドツーエンドの深層ネットワークが不可欠であるという一般的な常識に挑戦すること。

提案手法

  • 観測空間における重心の辞書を段階的に拡大することで、環境との相互作用中に出現する新しい視覚的特徴を符号化するオンラインアルゴリズムである増大辞書ベクトル量子化(IDVQ)を導入する。
  • 再構成誤差の最小化ではなく、情報の包含度を最大化することで観測を符号化する直接残差スパース符号化(DRSC)を採用し、関連する重心を示すバイナリコードを生成する。
  • 進化する辞書サイズを用いて、方策ネットワークの入力次元を動的に増加させる。これは、次元が時間とともに変化する多変量ガウス分布を適応的に制御する特殊な変種の指数的自然進化戦略によって処理される。
  • エージェントの環境との相互作用から関連する観測を自動的に選択することで、エンコーダーを自律的に訓練し、新しい視覚パターンへの継続的適応を保証する。
  • 6〜18ニューロンの単層ニューラルネットワーク方策を、コンパクトな符号から行動へのマッピングをニューロエボリューションによって学習する。
  • 現在の符号化からの残差として新しい重心を構築することで、符号のスパarsityと情報の完全性のバランスを保つ。この際、再構成アーチファクトは無視される。

実験結果

リサーチクエスチョン

  • RQ16〜18ニューロンの小さな方策ネットワークが、効率的で独立した特徴エンコーダーと組み合わせることで、アタリゲームで競争力のある性能を達成できるか?
  • RQ2再構成誤差の最小化に依存せずに、コンパクトで有益な視覚的表現を学習可能であり、それが方策性能の向上に寄与するか?
  • RQ3事前に環境の知識を持たない状態で、オンラインかつ開けた状態の特徴学習システムが、強化学習の過程で複雑化する視覚的観測に適応可能か?
  • RQ4特徴学習と方策学習を分離することで、エンドツーエンドの深層学習と比較して、より小さく、解釈可能で、おそらくより一般化可能な方策が可能になるか?
  • RQ5高品質でスパースかつ情報豊富な表現が提供された場合、最小限のニューラルネットワーク方策が、多様なアタリゲームにどれほど一般化できるか?

主な発見

  • 提案手法は、方策ネットワークにたった6〜18ニューロンを用いることで、複数のアタリゲームで最先端の性能を達成する。これは、標準の深層強化学習ベースラインと比較して2桁少ないパラメータ数である。
  • Qbertのような戦略的計画と正確なタイミングが求められる困難なゲームにおいても、本手法はより大きなネットワークを上回るか、同等の性能を発揮する。
  • DRSCとIDVQの使用により、再構成誤差の最小化に依存せずに効果的な特徴抽出が可能であることが実証され、方策学習においては完全な再構成よりも情報の完全性がより重要であることが示された。
  • エンコーダーは学習中に新しい観測を自動的に選択・学習し、オープンエンドかつオンラインの方法で新しい視覚パターンへの適応を可能にする。
  • 指数的自然進化戦略の変種は、次元が時間とともに変化する分布の次元を適応的に制御することで、進化する方策の安定した学習を実現した。
  • 本手法は、大規模なサーバーファームを必要とせず、一般的なハードウェアでも競争力のある結果を達成でき、再現性を確保するためソースコードが公開されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。