Skip to main content
QUICK REVIEW

[논문 리뷰] Speech Recognition with no speech or with noisy speech

Gautam Krishna, Co Tran|arXiv (Cornell University)|2019. 03. 02.
EEG and Brain-Computer Interfaces참고 문헌 21인용 수 5
한 줄 요약

이 논문은 청각적 신호가 없거나 소음이 있는 조건에서도 높은 정확도로 단어 및 모음 인식을 달성하기 위해 뇌전도도(EEG) 특징을 활용하는 딥러닝 기반 자동음성인식(ASR) 시스템을 제안한다. 게이트드 순환단위(GRUs)와 지식 정착 기법, EEG 특징 융합을 통해 모델은 소음 환경에서 단어 인식에 대해 99.38%의 테스트 정확도를 달성했으며, 이는 청각 성능이 떨어지는 상황에서 EEG가 이를 보완할 수 있음을 보여준다.

ABSTRACT

The performance of automatic speech recognition systems(ASR) degrades in the presence of noisy speech. This paper demonstrates that using electroencephalography (EEG) can help automatic speech recognition systems overcome performance loss in the presence of noise. The paper also shows that distillation training of automatic speech recognition systems using EEG features will increase their performance. Finally, we demonstrate the ability to recognize words from EEG with no speech signal on a limited English vocabulary with high accuracy.

연구 동기 및 목표

  • 기존 청각 모델이 실패하는 소음이 많은 음성 환경에서도 높은 정확도를 유지하는 ASR 시스템을 개발하는 것.
  • 말소리 입력이 전혀 없을 때 EEG 신호만으로도 정확한 단어 및 모음 인식이 가능한지 조사하는 것.
  • 지식 정착을 통한 EEG 특징 융합이 ASR 성능 향상에 얼마나 효과적인지 평가하는 것.
  • 열악한 청각 조건에서 강건한 음성 인식을 위해 최적의 EEG 특징과 모델 아키텍처를 규명하는 것.

제안 방법

  • 딥러닝 기반 GRU 모델을 3가지 입력 모odal(청각 특징(MFCCs), EEG 특징, 그들의 연결)을 사용해 훈련시켰다.
  • EEG 특징은 31개의 두피 전극에서 추출되었으며, 다항식 핵심 함수를 사용한 커널 주성분 분석(KPCA)을 통해 155차원에서 117차원으로 감소되었다.
  • 117차원의 KPCA 출력에서 델타 및 델타-델타 특징을 계산하여 시간적 동역학을 향상시켰고, 결과적으로 117차원의 EEG 특징을 확보하였다.
  • 지식 정착은 온도 스케일링 값 2와 람다 값 0.2를 사용하여 적용되었으며, 교사 모델에서 학생 모델로 지식을 전달하였다.
  • 학생 모델은 교사 모델의 소프트 레이블을 모방하도록 훈련되어 일반화 능력과 강건성이 향상되었으며, 특히 소음 조건에서 두드러진 성능 향상을 보였다.
  • EEG 전용 인식을 위해 4채널 서브셋(T7, T8, Fc5, P7)을 사용하여 소음이 없는 조건에서 모음 인식 정확도가 93%에 도달했으며, 이는 최소한의 채널 수로도 충분함을 보여주었다.

실험 결과

연구 질문

  • RQ1EEG 신호만으로도 청각 입력이 전혀 없을 때 정확한 단어 수준의 음성 인식이 가능한가?
  • RQ2배경 소음 조건에서 EEG 특징이 ASR 성능 저하를 얼마나 효과적으로 보완할 수 있는가?
  • RQ3EEG 강화 모델을 활용한 지식 정착이 ASR 시스템의 정확도와 강건성을 향상시키는가?
  • RQ4어떤 EEG 특징과 특징 감소 기법이 음성 인식 작업에 가장 효과적인 표현을 제공하는가?

주요 결과

  • 제안된 EEG 전용 ASR 모델은 배경 소음이 존재하는 조건에서 네 단어('yes', 'no', 'left', 'right')를 인식하는 데 테스트 정확도 99.38%를 달성했다.
  • 소음 조건에서 EEG 전용 모델은 MFCC 전용 모델보다 뛰어난 성능을 보였으며, 단어 인식 정확도는 98.39%로, MFCC 전용 모델의 94.53%보다 높았고, 모음 인식 정확도는 92.00%로 MFCC 전용 모델의 73.33%를 상회했다.
  • 온도 2와 람다 0.2를 사용한 지식 정착을 통해 학생 모델의 테스트 정확도는 소음이 없는 조건에서 단어 인식에 대해 98.61%로 향상되었고, 소음이 있는 조건에서는 97.62%를 기록했다.
  • 다항식 핵심 함수를 사용한 KPCA를 통해 155차원에서 117차원으로 감소된 EEG 특징 세트가 모든 데이터셋에서 최고의 성능을 보였다.
  • T7, T8, Fc5, P7 채널이 인식 정확도에 가장 크게 기여하여, 이들이 말소리 관련 신경 패턴을 효과적으로 캡처하고 있음을 시사했다.
  • 훈련, 검증, 테스트 정확도가 모든 구성에서 유사하게 유지되어 과적합 현상이 뚜렷하지 않음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.