Skip to main content
QUICK REVIEW

[논문 리뷰] Frequency Domain Multi-channel Acoustic Modeling for Distant Speech Recognition

Minhua Wu, Kenichi Kumatani|arXiv (Cornell University)|2019. 03. 13.
Speech and Audio Processing참고 문헌 33인용 수 5
한 줄 요약

이 논문은 ASR 기준을 사용하여 공간 필터링, 특징 추출, 그리고 LSTM 분류를 동시에 최적화하는 완전히 학습 가능한 다중채널(MC) 음향 모델링 프레임워크를 제안한다. 비드포머 계수로 네트워크를 초기화하고 주파수 도메인 MC 입력을 사용함으로써, 단일채널 LFBE 시스템 대비 16.5% 상대적 WER 감소와 기존 7마이크로폰 비드포머링 시스템 대비 9.5% 상대적 WER 향상을 달성하였다.

ABSTRACT

Conventional far-field automatic speech recognition (ASR) systems typically employ microphone array techniques for speech enhancement in order to improve robustness against noise or reverberation. However, such speech enhancement techniques do not always yield ASR accuracy improvement because the optimization criterion for speech enhancement is not directly relevant to the ASR objective. In this work, we develop new acoustic modeling techniques that optimize spatial filtering and long short-term memory (LSTM) layers from multi-channel (MC) input based on an ASR criterion directly. In contrast to conventional methods, we incorporate array processing knowledge into the acoustic model. Moreover, we initialize the network with beamformers' coefficients. We investigate effects of such MC neural networks through ASR experiments on the real-world far-field data where users are interacting with an ASR system in uncontrolled acoustic environments. We show that our MC acoustic model can reduce a word error rate (WER) by~16.5\% compared to a single channel ASR system with the traditional log-mel filter bank energy (LFBE) feature on average. Our result also shows that our network with the spatial filtering layer on two-channel input achieves a relative WER reduction of~9.5\% compared to conventional beamforming with seven microphones.

연구 동기 및 목표

  • 음성 강화와 음향 모델링을 별도로 최적화하는 전통적인 ASR 시스템의 한계를 극복하기 위해.
  • 공간 필터링, 특징 추출, 분류를 ASR 목적함수를 통해 동시에 최적화하는 통합형 엔드 투 엔드 학습 가능한 다중채널 음향 모델을 개발하기 위해.
  • 딥 뉴럴 네트워크 아키텍처에 배열 신호 처리 지식을 통합하면 실제의 반향이 있는, 소음이 많은 원거리 환경에서의 강인성이 향상되는지 조사하기 위해.
  • 비드포머 계수와 멜 필터 베이스 파rameters로 네트워크 초기화가 인식 정확도에 미치는 영향을 평가하기 위해.

제안 방법

  • 계산 효율성을 향상시키고 주파수별 처리를 가능하게 하기 위해 주파수 도메인 다중채널 입력(127개 DFT 계수)을 사용한다.
  • 세 가지 MC 네트워크 아키텍처를 제안한다: 복소 affine 변환(CAT), 최대 풀링을 적용한 결정적 공간 필터링(DSF), 주파수에 독립적인 가중치로 공간 필터를 선형 조합하는 탄성 공간 필터링(ESF).
  • 공간 필터링 레이어는 알려진 소스 방향에서 유도된 비드포머 계수로 초기화되어, 배열 처리 지식이 네트워크에 통합된다.
  • 특징 추출 및 분류 구성 요소는 768개 유닛을 가진 5층 LSTM으로 구현되며, 음향 단위 분류를 위한 소프트맥스 레이어로 이어진다.
  • 모든 네트워크는 Adam 옵티마이저를 사용한 교차 엔트로피 손실을 통해 엔드 투 엔드로 학습되며, 첫 번째 레이어는 무작위 가중치 또는 비드포머 계수로 초기화된다.
  • 시스템은 다양한 SNR 조건의 실제 원거리 데이터를 대상으로 평가되며, 주요 평가 지표로 상대적 WER 감소율을 사용한다.

실험 결과

연구 질문

  • RQ1딥 뉴럴 네트워크에서 공간 필터링, 특징 추출, 음향 분류를 동시에 최적화하면 기존 파이프라인 시스템 대비 ASR 성능 향상이 이루어지는가?
  • RQ2공간 필터링 레이어를 비드포머 계수로 초기화하면 다중채널 ASR에서 수렴성과 인식 정확도 향상이 이루어지는가?
  • RQ3CAT, DSF, ESF와 같은 다중채널 네트워크 아키텍처의 선택이 실제 원거리 조건에서의 인식 성능에 어떤 영향을 미치는가?
  • RQ4학습 가능한 필터 베이스가 비드포머 입력과 함께 사용될 경우 인식 정확도에 어떤 영향을 미치는가?
  • RQ5입력 마이크 수의 변화가 인식 성능에 미치는 영향은 어떠하며, 성능가 포화점이 존재하는가?

주요 결과

  • 제안된 탄성 공간 필터링(ESF) 네트워크가 가장 우수한 성능을 보였으며, 주파수에 독립적인 공간 필터 조합의 유연성 덕분에 CAT 및 DSF 아키텍처를 모두 능가했다.
  • 완전히 학습 가능한 MC 음향 모델은 실제 원거리 데이터에서 단일채널 LFBE 시스템 대비 16.5% 상대적 WER 감소를 달성했다.
  • 이중채널 입력을 사용한 모델은 기존 7마이크로폰 비드포머링 대비 9.5% 상대적 WER 감소를 기록하여 훨씬 뛰어난 강인성을 입증했다.
  • 첫 번째 레이어를 비드포머 계수로 초기화한 결과, 무작위 초기화보다 인식 정확도가 유의미하게 향상되었으며, 이는 사전 신호 처리 지식의 가치를 확인시켰다.
  • 인식 성능는 약 네 개의 마이크에서 포화 상태에 도달했으며, 두 채널을 초과해 추가 센서를 도입해도 성능 향상이 거의 없었고, 이는 추가 센서에 대한 수익 감소 현상을 시사했다.
  • 비드포머 데이터에서 학습된 학습 가능한 필터 베이스는 성능 향상에 기여했으며, 이는 심지어 특징 추출 단계에서도 엔드 투 엔드 최적화의 이점이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.