Skip to main content
QUICK REVIEW

[논문 리뷰] Low-Power Audio Keyword Spotting using Tsetlin Machines

Jie Lei, Tousif Rahman|arXiv (Cornell University)|2021. 01. 27.
Music and Audio Processing참고 문헌 43인용 수 4
한 줄 요약

이 논문은 Tsetlin Machines(TMs)를 사용한 저전력 키워드 스로잉(KWS) 시스템을 제안한다. TMs는 신경망의 산술 연산을 대체하는 부울 논리 기반 기계학습 모델로, 더 빠른 수렴, 적은 파라미터 수, 낮은 에너지 소비를 가능하게 한다. TM 기반 KWS 파이프라인은 복잡성과 하드웨어 면적을 크게 줄였음에도 불구하고 DNNs와 유사한 정확도를 달성하여 엣지 AI 장치에서 칩 내 구현 가능성을 높게 보여준다.

ABSTRACT

The emergence of Artificial Intelligence (AI) driven Keyword Spotting (KWS) technologies has revolutionized human to machine interaction. Yet, the challenge of end-to-end energy efficiency, memory footprint and system complexity of current Neural Network (NN) powered AI-KWS pipelines has remained ever present. This paper evaluates KWS utilizing a learning automata powered machine learning algorithm called the Tsetlin Machine (TM). Through significant reduction in parameter requirements and choosing logic over arithmetic based processing, the TM offers new opportunities for low-power KWS while maintaining high learning efficacy. In this paper we explore a TM based keyword spotting (KWS) pipeline to demonstrate low complexity with faster rate of convergence compared to NNs. Further, we investigate the scalability with increasing keywords and explore the potential for enabling low-power on-chip KWS.

연구 동기 및 목표

  • 엣지 장치에서 신경망 기반 키워드 스로잉(KWS)의 높은 에너지 소비와 계산 복잡도 문제를 해결하기 위해.
  • Tsetlin Machines(TMs)가 KWS 파이프라인에서 깊이 신경망(DNNs)의 저전력 대안으로 사용 가능한지 탐색하기 위해.
  • 다양한 초모수와 키워드 수에 따라 TM 기반 KWS 시스템의 확장성과 에너지 효율성을 평가하기 위해.
  • 산술 계산 대신 논리 기반 처리를 사용해 KWS 파이프라인의 하드웨어 가속 가능성을 입증하기 위해.
  • TM 전용 최적화를 통해 모델 크기와 시스템 지연을 최소화하여 실시간 칩 내 KWS를 가능하게 하기 위해.

제안 방법

  • KWS 파이프라인은 멜 주파수 케스트럼 계수(MFCCs)를 입력 특징으로 사용하며, 이는 분위수 분할을 통해 부울 형식으로 이산화된다.
  • Tsetlin Machine은 이러한 부울 특징을 문장 기반 논리 아키텍처를 통해 처리하며, 기울기 기반 역전파 대신 피드백 기반 학습 자동기계를 사용한다.
  • 클라우즈 수, 클라우즈 크기, 임계값 등의 초모수를 조정하여 정확도, 에너지 효율성, 수렴 속도 간 균형을 맞춘다.
  • 실시간 성능와 에너지 소비를 평가하기 위해 라즈베리 파이에 시스템을 구현한다.
  • TensorFlow 음성 명령 데이터셋을 사용해 표준 DNN 및 양자화된 CNN 모델과 파이프라인을 비교한다.
  • 신호 처리 최적화로는 성능 손실를 최소화하면서 MFCC 차원을 줄이기 위한 윈도우 함수 조정이 포함된다.

실험 결과

연구 질문

  • RQ1Tsetlin Machine 기반 KWS 파이프라인은 훨씬 적은 파라미터를 사용하면서도 깊이 신경망(DNNs)과 유사한 정확도를 달성할 수 있는가?
  • RQ2클라우즈 수와 피드백 초모수는 TM 기반 KWS 시스템의 수렴 속도와 에너지 효율성에 어떤 영향을 미치는가?
  • RQ3MFCC 이산화를 단순화(예: 특징당 하나의 부울 값)할 경우 성능 저하 없이 얼마나 단순화할 수 있는가?
  • RQ4키워드 수가 증가함에 따라 TM 기반 KWS 파이프라인의 정확도와 자원 사용량은 어떻게 변화하는가?
  • RQ5TM 기반 시스템은 저전력 마이크로컨트롤러에 효과적으로 구현되어 칩 내 실시간 키워드 스로잉을 가능하게 할 수 있는가?

주요 결과

  • Tsetlin Machine 기반 KWS 파이프라인은 DNNs 및 양자화된 CNNs와 유사한 정확도를 달성하면서도 파라미터 수와 클라우즈 수를 수개의 주기수로 줄였다.
  • 기울기 하강법과 산술 연산이 없는 덕분에 기존 신경망보다 훨씬 더 빠른 수렴을 보였다.
  • MFCC 특징을 각 계수당 하나의 부울 값으로 줄이는 데 성능 저하가 거의 없었으며, 이는 모델 크기와 계산 부담을 크게 줄일 수 있었다.
  • 클라우즈 수를 줄이고 임계값 초모수를 조정함으로써 정확도를 유지하면서도 에너지 효율성과 지연 시간을 향상시켰다.
  • 논리 기반 계산이므로 부동소수점 산술보다 본질적으로 더 에너지 효율적이므로 하드웨어 가속 가능성이 매우 높았다.
  • 라즈베리 파이에서 성공적으로 평가되어 엣지 AI 응용 분야에서 저전력 칩 내 구현 가능성이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.