Skip to main content
QUICK REVIEW

[논문 리뷰] FPGA-Based Low-Power Speech Recognition with Recurrent Neural Networks

Minjae Lee, Kyuyeon Hwang|arXiv (Cornell University)|2016. 09. 30.
Speech Recognition and Synthesis참고 문헌 23인용 수 5
한 줄 요약

이 논문은 두 개의 장기 단기 기억(기억장기) 순환 신경망(RNN)을 사용하는 FPGA 기반 저전력 실시간 음성 인식 시스템을 제시한다: 하나는 음향 모델링을 위해, 다른 하나는 문자 수준 언어 모델링을 위해 사용되며, 통계적 단어 수준 언어 모델과 결합된다. 시스템은 온칩 FPGA 메모리에 완전히 저장된 6비트 정수형 가중치를 사용하여 고속 처리를 실현하고 DRAM 액세스를 최소화하며, 전력 소비 9.24 W로 4.12× 실시간 성능을 달성한다. 이는 GPU 기반 시스템 대비 에너지 효율성에서 10배 향상된 결과이다.

ABSTRACT

In this paper, a neural network based real-time speech recognition (SR) system is developed using an FPGA for very low-power operation. The implemented system employs two recurrent neural networks (RNNs); one is a speech-to-character RNN for acoustic modeling (AM) and the other is for character-level language modeling (LM). The system also employs a statistical word-level LM to improve the recognition accuracy. The results of the AM, the character-level LM, and the word-level LM are combined using a fairly simple N-best search algorithm instead of the hidden Markov model (HMM) based network. The RNNs are implemented using massively parallel processing elements (PEs) for low latency and high throughput. The weights are quantized to 6 bits to store all of them in the on-chip memory of an FPGA. The proposed algorithm is implemented on a Xilinx XC7Z045, and the system can operate much faster than real-time.

연구 동기 및 목표

  • 임베디드 및 모바일 응용 프로그램에 적합한 저전력 실시간 음성 인식 시스템을 개발하기 위해.
  • 가중치 양자화를 통해 모든 RNN 가중치를 온칩 FPGA 메모리에 저장하여 외부 DRAM 의존도를 줄이기 위해.
  • 복잡한 HMM 기반 디코딩을 대체하기 위해 RNN 기반 음향 모델 및 언어 모델을 사용하는 경량 N-best 비트 서치를 도입하기 위해.
  • 어휘에 의존하지 않는 종단 간 음성 인식을 실현하기 위해 문자 수준 RNN과 통계적 단어 수준 언어 모델을 조합하기 위해.
  • FPGA에 존재하는 다량의 병렬 처리 요소(PE)를 활용하여 고처리량 및 저지연을 달성하기 위해.

제안 방법

  • 음향 모델링(AM)을 위한 단방향 RNN과 문자 수준 언어 모델링(LM)을 위한 별도의 RNN을 사용하며, 양자화된 연결 기반 시간 분류(CTC)로 학습한다.
  • 비트 너비 128인 트리 구조 N-best 비트 서치가 AM, 문자 수준 LM, 통계적 단어 수준 LM의 출력을 통합하여 HMM 또는 WFST 네트워크가 필요 없도록 한다.
  • 모든 RNN 가중치는 재학습 기반 최적화를 통해 6비트 고정소수점 정밀도로 양자화되어 메모리 점유율을 약 1.1 MB로 줄이며, Xilinx XC7Z045 FPGA의 온칩 저장소에 완전히 수용된다.
  • RNN은 고속 행렬-벡터 곱셈을 지원하고 고처리량 추론을 실현하기 위해 다량의 병렬 처리 요소(PE)로 구현된다.
  • 시스템은 단어 수준 언어 모델만 외부 DRAM에 오프로드하여 에너지 소모가 큰 메모리 액세스를 최소화한다.
  • FPGA는 100 MHz에서 동작하며, CPU는 800 MHz에서 N-best 서치를 처리하여 WSJ eval92 데이터셋에서 4.12× 실시간 성능을 달성한다.

실험 결과

연구 질문

  • RQ1외부 메모리 액세스를 최소화하면서도 FPGA에 효율적으로 구현 가능한 완전히 RNN 기반의 음성 인식 시스템은 가능한가?
  • RQ26비트 가중치 양자화는 모든 모델 파rameter를 온칩 저장 가능하게 하면서도 정확도를 유지하는 데 얼마나 효과적인가?
  • RQ3경량 N-best 비트 서치는 HMM 또는 WFST 디코딩을 대체할 수 있으며, 정확도 손실 없이 작동하는가?
  • RQ4GPU 기반 구현 대비 FPGA 기반 RNN 시스템의 실시간 성능과 에너지 효율성은 어느 정도인가?
  • RQ5문자 수준 RNN과 단어 수준 언어 모델이 종단 간 어휘에 의존하지 않는 환경에서 정확도 향상에 얼마나 기여하는가?

주요 결과

  • FPGA 기반 시스템은 100-MHz 클럭을 사용하여 WSJ eval92 데이터셋에서 4.12× 실시간 성능을 달성하였으며, 단위 전력 대비 속도에서 GPU 기반 시스템을 크게 능가하였다.
  • 평가 보드에서 시스템은 DRAM 및 주변 장치를 포함해 총 9.24 W의 전력 소비를 기록하였으며, 비교 대상으로 사용된 고성능 GPU(NVIDIA Titan X) 대비 10배 높은 에너지 효율성을 확보하였다.
  • 6비트 양자화된 가중치를 사용함으로써 모델 크기를 약 1.1 MB로 줄였으며, 이는 Xilinx XC7Z045 FPGA의 2.18 MB 온칩 메모리에 완전히 수용되어 RNN 가중치에 대한 DRAM 액세스가 불필요해졌다.
  • 단어 수준 언어 모델은 정확도 향상에 기여하였으며, 고정소수점 가중치를 사용하더라도 재평가(re-scoring)를 통해 성능 향상이 가능했다.
  • 6비트 양자화를 사용할 경우 전체 정밀도 모델 대비 단어 오류율(WER) 증가가 약 1.5%에 그쳐 정확도와 효율성 사이의 효과적인 트레이드오프를 입증하였다.
  • N-best 비트 서치에 필요한 데이터 구조는 단지 197 KB에 불과하여 기존 HMM 기반 WFST 네트워크가 요구하는 수백 MB와 비교해 극적으로 감소하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.