Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement co-Learning of Deep and Spiking Neural Networks for Energy-Efficient Mapless Navigation with Neuromorphic Hardware

Guangzhi Tang, Neelesh Kumar|arXiv (Cornell University)|2020. 03. 02.
Advanced Memory and Neural Computing참고 문헌 27인용 수 13
한 줄 요약

이 논문은 에너지 효율적인 지도 없는 내비게이션을 위한 하이브리드 강화학습 프레임워크인 스파iking DDPG(SDDPG)를 제안한다. SDDPG는 스파이킹 액터 네트워크(SAN)와 딥 크리틱 네트워크를 공동으로 학습시켜, 인텔의 로이히 뉴로모르픽 칩에 구현된다. SDDPG는 제트슨 TX2에서 DDPG보다 인퍼런스당 에너지 소비를 75배 줄였고, 내비게이션 성공률을 1%~4.2% 향상시켰다. 이는 SNN과 DNN 요소 간의 상호보완적 공학학습을 통해 뛰어난 에너지 효율성과 성능을 달성했음을 보여준다.

ABSTRACT

Energy-efficient mapless navigation is crucial for mobile robots as they explore unknown environments with limited on-board resources. Although the recent deep reinforcement learning (DRL) approaches have been successfully applied to navigation, their high energy consumption limits their use in several robotic applications. Here, we propose a neuromorphic approach that combines the energy-efficiency of spiking neural networks with the optimality of DRL and benchmark it in learning control policies for mapless navigation. Our hybrid framework, spiking deep deterministic policy gradient (SDDPG), consists of a spiking actor network (SAN) and a deep critic network, where the two networks were trained jointly using gradient descent. The co-learning enabled synergistic information exchange between the two networks, allowing them to overcome each other's limitations through a shared representation learning. To evaluate our approach, we deployed the trained SAN on Intel's Loihi neuromorphic processor. When validated on simulated and real-world complex environments, our method on Loihi consumed 75 times less energy per inference as compared to DDPG on Jetson TX2, and also exhibited a higher rate of successful navigation to the goal, which ranged from 1% to 4.2% and depended on the forward-propagation timestep size. These results reinforce our ongoing efforts to design brain-inspired algorithms for controlling autonomous robots with neuromorphic hardware.

연구 동기 및 목표

  • 제한된 차량 내 자원 조건에서 모바일 로봇 내비게이션에 사용되는 딥 강화학습(DRL)의 높은 에너지 소비 문제를 해결하기 위해.
  • 복잡한 환경에서 높은 정밀도의 액션-밸류 표현이 어려우며, 치명적인 기억 상실에 취약한 순수 스파이킹 신경망(SNN)의 한계를 극복하기 위해.
  • SNN의 에너지 효율성과 DRL의 정책 최적화 능력을 융합한 하이브리드 프레임워크를 개발하여 실시간 지도 없는 내비게이션을 가능하게 하기 위해.
  • 스파이킹 신경망을 직접 기울기 하강법으로 학습시켜 인텔의 로이히와 같은 뉴로모르픽 하드웨어에 강화학습 정책을 효율적으로 구현하기 위해.
  • 에지 디바이스에서 최신 DRL 기법보다 높은 내비게이션 성공률과 현저히 낮은 에너지 소비를 동시에 달성하기 위해.

제안 방법

  • 스파이킹 액터 네트워크(SAN)를 통한 액션 선택과 딥 크리틱 네트워크를 통한 액션-밸류 평가를 위한 하이브리드 SNN/DNN 프레임워크인 스파이킹 DDPG(SDDPG)를 제안한다.
  • 스파이킹 액터 네트워크의 엔드 투 엔드 기울기 기반 학습을 가능하게 하기 위해 수정된 시공간 역전파(STBP) 알고리즘을 적용한다.
  • 기울기 하강법을 통한 SAN과 딥 크리틱 네트워크의 공동 학습을 통해 공유 표현 학습과 상호 개선을 가능하게 한다.
  • 학습된 SAN을 인텔의 로이히 뉴로모르픽 프로세서에 구현하여 이벤트 기반 비동기 계산을 활용해 저전력 인퍼런스를 실현한다.
  • 저시간스텝 값(T=5에서 50)으로 SNN을 학습시켜 인퍼런스 에너지를 최적화하고, 성능을 유지하면서 지연과 전력 소비를 최소화한다.
  • 기억 상실을 완화하기 위해 보상 조절 학습 규칙과 메모리 리플레이를 결합하여 생물학적 타당성과 DRL의 강건성을 동시에 확보한다.

실험 결과

연구 질문

  • RQ1공동 학습된 하이브리드 SNN/DNN 프레임워크가 지도 없는 로봇 제어에서 단독 DRL 또는 SNN 방법보다 에너지 효율성과 내비게이션 정확도 측면에서 뛰어나게 성능을 발휘할 수 있는가?
  • RQ2기울기 하강법으로 학습된 스파이킹 신경망이 딥 신경망 수준의 높은 정밀도 액션-밸류 표현을 얼마나 잘 달성할 수 있는가?
  • RQ3실세계 내비게이션 작업에서 뉴로모르픽 하드웨어에 공훈련된 SNN의 인퍼런스 에너지 소비는 기존의 에지 디바이스에 구동되는 DNN와 비교해 어떻게 되는가?
  • RQ4SNN의 시공간 표현에서 발생하는 본질적 노이즈가 학습 중 열악한 국소 최적점에서 벗어나 정책 최적화를 향상시키는 데 기여하는가?
  • RQ5STBP를 통한 SNN 직접 학습이 DNN에서 SNN로의 변환 방법과 달리 낮은 시간스텝 인퍼런스(T)를 유지하면서도 성능을 유지를 할 수 있는가?

주요 결과

  • 인텔의 로이히 뉴로모르픽 프로세서에 배포된 SDDPG는 제트슨 TX2에서 에너지 효율 모드로 실행되는 DDPG 대비 인퍼런스당 에너지 소비를 75배 줄였다.
  • SDDPG는 전파 단계 시간스텝 크기(T)에 따라 DDPG 대비 1%~4.2% 높은 목표지점 도달 성공률을 기록했다.
  • T=5일 때 SDDPG는 로이히에서 인퍼런스당 15.53 mJ의 에너지를 소비했고, 동일한 성능을 내기 위해 DNN에서 SNN로의 변환을 사용할 경우 4.5배 더 많은 에너지와 5배 더 많은 시간스텝이 필요했다.
  • 하이브리드 공훈련 접근법 덕분에 SNN이 높은 정밀도 액션-밸류 표현의 한계를 극복해 단독 SNN보다 더 나은 정책 최적화를 달성했다.
  • SNN의 노이즈가 있는 시공간 입력 표현이 열악한 국소 최적점에서 벗어나 정책 최적화의 강건성을 향상시키는 데 기여했다.
  • SDDPG는 최신 기술 대비 뛰어난 성능과 에너지 효율성을 보였으며, 에너지 효율적인 뉴로모르픽 방법이 로봇 내비게이션 과제에서 정확도 측면에서 현재의 최고 성능(SOTA)을 능가한 첫 사례 중 하나로 평가된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.