[論文レビュー] Reinforcement co-Learning of Deep and Spiking Neural Networks for Energy-Efficient Mapless Navigation with Neuromorphic Hardware
本論文は、スパikingアクターネットワーク(SAN)とディープクリティックネットワークの共同学習により、エネルギ効率的でマップレスなナビゲーションを実現するハイブリッド強化学習フレームワーク、Spiking DDPG(SDDPG)を提案する。IntelのLoihiニューロモルフィックチップに実装されたSDDPGは、Jetson TX2のエネルギー効率モードで実行されるDDPGと比較して、1インスタンスあたりの推論における消費エネルギーを75倍低減した一方で、ナビゲーション成功確率を1%〜4.2%向上させ、SNNとDNNのコンponents間の包括的で協調的な学習により、エネルギ効率と性能の両面で優れた性能を示した。
Energy-efficient mapless navigation is crucial for mobile robots as they explore unknown environments with limited on-board resources. Although the recent deep reinforcement learning (DRL) approaches have been successfully applied to navigation, their high energy consumption limits their use in several robotic applications. Here, we propose a neuromorphic approach that combines the energy-efficiency of spiking neural networks with the optimality of DRL and benchmark it in learning control policies for mapless navigation. Our hybrid framework, spiking deep deterministic policy gradient (SDDPG), consists of a spiking actor network (SAN) and a deep critic network, where the two networks were trained jointly using gradient descent. The co-learning enabled synergistic information exchange between the two networks, allowing them to overcome each other's limitations through a shared representation learning. To evaluate our approach, we deployed the trained SAN on Intel's Loihi neuromorphic processor. When validated on simulated and real-world complex environments, our method on Loihi consumed 75 times less energy per inference as compared to DDPG on Jetson TX2, and also exhibited a higher rate of successful navigation to the goal, which ranged from 1% to 4.2% and depended on the forward-propagation timestep size. These results reinforce our ongoing efforts to design brain-inspired algorithms for controlling autonomous robots with neuromorphic hardware.
研究の動機と目的
- 限られたオンボードリソース下で、モバイルロボットナビゲーションにおけるディープ強化学習(DRL)の高いエネルギー消費を是正すること。
- 複雑な環境下で、高精度な行動価値表現が困難で、災難的忘却に脆弱であるなどの制限を抱える純粋なスパイクニューラルネットワーク(SNN)の限界を克服すること。
- SNNのエネルギー効率とDRLのポリシー最適化能力を活用したハイブリッドフレームワークを構築し、リアルタイムでマップレスなナビゲーションを実現すること。
- SNNを勾配降下法で直接学習させることで、IntelのLoihiのようなニューロモルフィックハードウェアへの効率的な強化学習ポリシーのデプロイを可能にすること。
- エッジデバイス上での最先端のDRL手法と比較して、より高いナビゲーション成功確率と顕著に低いエネルギー消費を両立すること。
提案手法
- スパイクアクターネットワーク(SAN)を用いた行動選択と、行動価値評価のためのディープクリティックネットワークを備えたハイブリッドSNN/DNNフレームワーク、Spiking DDPG(SDDPG)を提案する。
- SNNのエンドツーエンド勾配ベースの学習を可能にするために、変更を加えた空間的・時間的逆誤差伝搬(STBP)アルゴリズムを採用する。
- SANとディープクリティカルネットワークの勾配降下法による共同学習を実施し、共有表現学習と相互改善を実現する。
- 訓練済みSANをIntelのLoihiニューロモルフィックプロセッサにデプロイし、イベント駆動型で非同期的に計算されることで低消費電力推論を実現する。
- 推論エネルギーを最適化するため、時間ステップ数(T)を低く(T=5〜50)に設定してSNNを学習し、性能を損なわせずに遅延と消費電力を最小限に抑える。
- 記憶再現を組み合わせた報酬変調型学習ルールを採用し、災難的忘却を緩和する。生物学的妥当性とDRLのロバスト性を統合する。
実験結果
リサーチクエスチョン
- RQ1共同訓練されたハイブリッドSNN/DNNフレームワークは、マップレスロボット制御におけるエネルギー効率とナビゲーション精度において、単独のDRLまたはSNN手法を上回ることができるか?
- RQ2勾配降下法で学習されたSNNは、深層ニューラルネットワークと同等の高精度な行動価値表現を達成できるか、その程度はどの程度か?
- RQ3ニューロモルフィックハードウェア上で共同訓練されたSNNの推論エネルギー消費は、従来のエッジデバイス上でのDNNと比較して、実世界のナビゲーションタスクにおいてどの程度低いのか?
- RQ4SNNの空間的・時間的表現に内在するノイズが、学習中に局所的最適解から脱出するのを助けることで、ポリシー最適化のロバスト性を向上させるか?
- RQ5STBPによるSNNの直接学習は、DNNからSNNへの変換手法とは異なり、性能を維持したまま低い時間ステップ数(T)での推論を可能にするか?
主な発見
- IntelのLoihiニューロモルフィックプロセッサにデプロイされたSDDPGは、Jetson TX2のエネルギー効率モードで実行されるDDPGと比較して、1インスタンスあたりの推論における消費エネルギーを75倍低減した。
- SDDPGは、前方伝搬時間ステップ数(T)に応じて、DDPGと比較して1%〜4.2%の高いナビゲーション成功確率を達成した。
- T=5でSDDPGを実行した場合、Loihi上での推論エネルギーは15.53 mJであったが、同等の性能を達成するためのDNNからSNNへの変換手法では、エネルギー消費が4.5倍多く、時間ステップ数も5倍多く必要だった。
- ハイブリッドな共同学習アプローチにより、SNNが高精度な行動価値表現の制限を克服し、単独のSNNと比較してより優れたポリシー最適化が実現された。
- SNNのノイズを含む空間的・時間的入力表現が、局所的最適解からの脱出を助け、学習のロバスト性を向上させた。
- SDDPGは、最先端の手法と比較して優れた性能とエネルギー効率を示し、ロボットナビゲーションタスクにおいて、エネルギー効率の良いニューロモルフィック手法が、現在のSOTAを上回る精度を達成した最初の例の一つである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。