Skip to main content
QUICK REVIEW

[논문 리뷰] An efficient and perceptually motivated auditory neural encoding and decoding algorithm for spiking neural networks

Zihan Pan, Yansong Chua|arXiv (Cornell University)|2019. 09. 03.
Hearing Loss and Rehabilitation참고 문헌 61인용 수 5
한 줄 요약

이 논문은 인간 청각 인지 방식을 모방하여 음성 신호를 희박하고 효율적인 스파iking 패턴으로 변환하기 위한 생물학적으로 타당한 청각 인코딩(BAE) 기법을 제안한다. 고막 필터링, 청각 마스킹, 인간 생리학에 영감을 받은 스파이크 인코딩을 통합함으로써 BAE는 고해상도 음성 복원과 SNN 기반 음성 인식에서 뛰어난 성능을 달성하며, 이로 인해 두 가지 공개 스파이크 기반 데이터셋인 Spike-TIDIGITS와 Spike-TIMIT를 구축하였다.

ABSTRACT

Auditory front-end is an integral part of a spiking neural network (SNN) when performing auditory cognitive tasks. It encodes the temporal dynamic stimulus, such as speech and audio, into an efficient, effective and reconstructable spike pattern to facilitate the subsequent processing. However, most of the auditory front-ends in current studies have not made use of recent findings in psychoacoustics and physiology concerning human listening. In this paper, we propose a neural encoding and decoding scheme that is optimized for speech processing. The neural encoding scheme, that we call Biologically plausible Auditory Encoding (BAE), emulates the functions of the perceptual components of the human auditory system, that include the cochlear filter bank, the inner hair cells, auditory masking effects from psychoacoustic models, and the spike neural encoding by the auditory nerve. We evaluate the perceptual quality of the BAE scheme using PESQ; the performance of the BAE based on speech recognition experiments. Finally, we also built and published two spike-version of speech datasets: the Spike-TIDIGITS and the Spike-TIMIT, for researchers to use and benchmarking of future SNN research.

연구 동기 및 목표

  • 최근 인간 심리청각 및 청각 생리학 분야의 발견을 활용하여 SNN용 청각 프론트엔드를 개발하기 위해.
  • 음성 신호로부터 희박하고 효율적이며 재구성 가능한 스파이크 패턴을 생성하여 SNN의 계산 부담을 줄이기 위해.
  • 더 생물학적으로 현실적인 인코딩 방식을 통해 SNN의 음성 인식 작업 성능을 향상시키기 위해.
  • 표준화된 스파이크 기반 음성 데이터셋인 Spike-TIDIGITS와 Spike-TIMIT를 제작하고 공개하여 향후 SNN 연구의 기준이 되도록 하기 위해.

제안 방법

  • BAE 기법은 감마톤 필터 백을 사용하여 고막 주파수 필터링을 모의함으로써 인간 청각 시스템을 모델링한다.
  • MPEG-1 Layer III 표준에서 유도된 심리청각적 청각 마스킹 효과를 통합하여 인지적으로 불필요한 성분을 억제한다.
  • 15개의 균일하게 분포된 임계값을 기반으로 한 임계값 초월 이벤트를 통해 시간적 스파이크 패턴을 생성한다.
  • 내부 고리세포 전도 및 청각 신경 스파이크 인코딩을 통합하여 레이트 코딩 스파이크 출력을 생성한다.
  • 이 방법은 여전히 인지적으로 중요한 다이내믹스를 유지하면서도 불필요한 스파이크를 최소화하여 계산 효율성을 향상시킨다.
  • 결과적으로 생성된 스파이크 패턴은 음성 인식 작업에서 SNN을 훈련 및 평가하는 데 사용된다.

실험 결과

연구 질문

  • RQ1생물학적으로 영감을 받은 청각 인코딩 기법은 SNN 기반 음성 처리의 효율성과 효과성에 기여할 수 있는가?
  • RQ2스파이크 인코딩에 청각 마스킹을 통합할 경우, 인지적 품질과 인식 성능는 어느 정도 유지되는가?
  • RQ3BAE로 생성된 스파이크 패턴은 기존의 표현 방식과 비교해 복원 가능성과 SNN 분류 정확도 측면에서 어떻게 다른가?
  • RQ4제안된 인코딩 방법은 TIMIT와 같은 연속 음성 데이터셋에서 고성능 SNN을 가능하게 하는가?
  • RQ5스파이크 패턴의 희박성과 시간적 구조는 SNN 학습 및 추론에 어떤 영향을 미치는가?

주요 결과

  • BAE 인코딩은 높은 인지적 품질을 달성하였으며, 거의 투명한 음성 복원 정밀도를 나타내는 PESQ 점수를 기록하였다.
  • BAE로 인코딩된 데이터로 훈련된 SNN은 음성 인식 작업에서 뛰어난 성능을 보이며, 인코딩 기법의 효과성을 입증하였다.
  • 청각 마스킹 덕분에 스파이크 수가 크게 감소하였지만, 신경 세포의 반응 다이내믹스는 유지되었으며, 마스킹 유무에 관계없이 동일한 막전위 궤적과 스파이크 출력을 기록하였다.
  • BAE로 생성된 스파이크 패턴은 낮은 스파이크 레이트에서도 정확한 분류에 필요한 핵심적인 시간적 및 주파수적 특징을 유지하였다.
  • 제안된 Spike-TIDIGITS 및 Spike-TIMIT 데이터셋은 성공적으로 제작되어 SNN 연구를 위한 공개 기준 데이터로 제공되었다.
  • 결과적으로 BAE는 계산 부담을 줄이면서도 정확도를 유지하는 효율적이고 인지적으로 동기화된 인코딩을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.