Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning with Spiking Q-learning

Ding Chen, Peixi Peng|arXiv (Cornell University)|Jan 21, 2022
Advanced Memory and Neural Computing被引用数 15
ひとこと要約

本論文は、スパikingニューラルネットワーク(SNN)のエンドツーエンド学習を可能にする生物学的にインspiredな強化学習手法であるDeep Spiking Q-Network(DSQN)を提案する。この手法では、非スパイク性のインターニューロンの最大膜電位をQ値として表現することで、SNNを用いた深層強化学習の実現を図っている。DSQNは17個のAtariゲームのうち14個でANNベースのDQNを上回り、学習の安定性と敵対的攻撃に対する耐性が優れている。

ABSTRACT

With the help of special neuromorphic hardware, spiking neural networks (SNNs) are expected to realize artificial intelligence (AI) with less energy consumption. It provides a promising energy-efficient way for realistic control tasks by combining SNNs with deep reinforcement learning (RL). There are only a few existing SNN-based RL methods at present. Most of them either lack generalization ability or employ Artificial Neural Networks (ANNs) to estimate value function in training. The former needs to tune numerous hyper-parameters for each scenario, and the latter limits the application of different types of RL algorithm and ignores the large energy consumption in training. To develop a robust spike-based RL method, we draw inspiration from non-spiking interneurons found in insects and propose the deep spiking Q-network (DSQN), using the membrane voltage of non-spiking neurons as the representation of Q-value, which can directly learn robust policies from high-dimensional sensory inputs using end-to-end RL. Experiments conducted on 17 Atari games demonstrate the DSQN is effective and even outperforms the ANN-based deep Q-network (DQN) in most games. Moreover, the experiments show superior learning stability and robustness to adversarial attacks of DSQN.

研究の動機と目的

  • 価値関数推定に人工ニューラルネットワーク(ANN)に依存しない完全にスパイクベースの強化学習手法の開発。
  • 従来のSNNベースのRL手法の限界、すなわち一般化性能の低さ、ハイパーパrameterへの感受性の高さ、ANN使用に起因するエネルギー非効率性の解消。
  • 生物学的に妥当なメカニズムを用いて、高次元制御タスクにおけるSNNのエンドツーエンド学習を可能にすること。
  • 深層RL環境における敵対的攻撃に対する耐性の向上と学習の安定性の強化。

提案手法

  • 非スパイク性のインターニューロンが膜電位によってQ値を符号化する新しいSNNアーキテクチャを提案。昆虫の感覚運動路にインspired。
  • 最終の膜電位ではなく、全シミュレーション時間にわたる最大膜電位をQ値表現として用いることで、時間的ダイナミクスをよりよく捉える。
  • 環境状態をスパイクトレインとしてスパイキングニューロンで符号化し、非スパイク性インターニューロンで統合してQ値を計算。
  • ハイブリッドなANN-SNNコンponentsを一切使用せず、標準的なディープQ学習とバックプロパゲーションを用いてネットワークをエンドツーエンドで学習。
  • スパイキングニューロンを介したバックプロパゲーションを可能にするため、サーヴィルゲート勾配法を適用。
  • DSQNでは固定されたシミュレーションタイムステップT=8を用い、ANN-SNNベースラインのT=500と比較して、顕著に推論時間を短縮。

実験結果

リサーチクエスチョン

  • RQ1ANNを用いた価値関数推定に依存せずに、SNNをエンドツーエンドで深層強化学習に適用できるか?
  • RQ2時間経過にわたる最大膜電位をQ値表現として用いることで、学習の安定性と性能が向上するか?
  • RQ3完全にスパイクベースのニューラルネットワークを用いたRLエージェントは、Atariゲームのような高次元制御タスクで標準DQNを上回れるか?
  • RQ4提案手法DSQNは、標準DQNと比較して敵対的攻撃(FGSM白ボックス攻撃)に対してどのように性能を示すか?
  • RQ5スパイクベースのQ学習法は、競争力のある性能を達成する一方で、生物学的妥当性を維持できるか?

主な発見

  • DSQNは17個のAtariゲームのうち14個でANNベースのDQNを上回り、Video Pinball(441,615.2 vs. 276,040.2)やRoad Runner(23,206.7 vs. 2,530.0)で顕著な向上を示した。
  • 滑らかな学習曲線とQ値予測の過大評価の低減により、DSQNが優れた学習安定性を示した。
  • FGSM白ボックス敵対的攻撃に対しても強く、Video Pinballでは0.01%、Star Gunnerでは0.16%の低下率を示し、性能低下が最小限に抑えられた。
  • 時間ステップにわたる最大膜電位の使用は、4つのゲームで他のデコーディング戦略と比較して顕著に性能向上をもたらした。
  • DSQNはわずか8ステップのシミュレーション時間で競争力のある結果を達成したのに対し、ANN-SNNベースラインは500ステップを要したため、推論効率が著しく高い。
  • 非スパイク性インターニューロンをQ値キャリアとしてモデル化することで、神経生物学的感覚運動路に整合し、高い生物学的妥当性を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。