Skip to main content
QUICK REVIEW

[논문 리뷰] Meeting Transcription Using Virtual Microphone Arrays

Takuya Yoshioka, Zhuo Chen|arXiv (Cornell University)|2019. 05. 03.
Speech and Audio Processing참고 문헌 30인용 수 15
한 줄 요약

이 논문은 비동기적이고 분산된 마이크(예: 노트북, 스마트폰)를 사용하여 가상 마이크 어레이를 구성하는 실시간 회의 음성 전사 시스템을 제시한다. 음성 스트림 정렬, 블라인드 빔포밍, 음성 인식, 화자 다이아라이제이션, 시스템 조합(포함: 하나를 제외한 빔포밍 및 점진적 ROVER)을 통합함으로써, 시스템은 22.3%의 단어 오류율(WER)과 26.7%의 화자 할당된 WER를 달성하였으며, 겹치지 않는 음성에서 근접 마이크 성능에 비해 3% 이내의 성능을 기록한다.

ABSTRACT

We describe a system that generates speaker-annotated transcripts of meetings by using a virtual microphone array, a set of spatially distributed asynchronous recording devices such as laptops and mobile phones. The system is composed of continuous audio stream alignment, blind beamforming, speech recognition, speaker diarization using prior speaker information, and system combination. When utilizing seven input audio streams, our system achieves a word error rate (WER) of 22.3% and comes within 3% of the close-talking microphone WER on the non-overlapping speech segments. The speaker-attributed WER (SAWER) is 26.7%. The relative gains in SAWER over the single-device system are 14.8%, 20.3%, and 22.4% for three, five, and seven microphones, respectively. The presented system achieves a 13.6% diarization error rate when 10% of the speech duration contains more than one speaker. The contribution of each component to the overall performance is also investigated, and we validate the system with experiments on the NIST RT-07 conference meeting test set.

연구 동기 및 목표

  • 비동기적이고 먼 마이크를 사용한 자연스러운 회의 환경에서 정확한 화자 할당 음성 인식 문제를 해결한다.
  • 실제 회의 환경에서 단일 마이크 시스템과 동기화된 어레이 설정의 한계를 극복한다.
  • 전처리 빔포밍과 후처리 시스템 조합을 통합한 저지연, 실시간 시스템을 개발하여 전사 품질을 향상시킨다.
  • 비동기 다중 마이크 환경에서 하나를 제외한 빔포밍과 다양성 유지 전략의 융합 전략의 효과성을 조사한다.
  • NIST RT-07 회의 데이터를 실제 환경에서 평가하여 WER, SAWER, 다이아라이제이션 오류율(DER)에 중점을 둔다.

제안 방법

  • 처리 이전에 입력을 동기화하기 위해 시간 지연 추정과 신호 보정을 사용하여 다중 비동기 음성 스트림을 정렬한다.
  • 공간 공분산 행렬을 사용하여 빔포밍을 적용하여 음질을 향상시키고, 마이크 간 일관된 신호 조합을 가능하게 한다.
  • 다양한 빔포밍 신호를 생성하기 위해 하나를 제외한 빔포밍을 적용하여 내성과 효과적인 시스템 조합을 가능하게 한다.
  • 모든 빔포밍 신호를 기반으로 공동 자동 음성 인식(ASR)을 수행하여 단어 수준 타임스탬프가 포함된 n개의 최선의 가설을 생성한다.
  • ASR 이후에 화자 임bedding과 단어 수준 타임마크를 사용하여 전사된 세그먼트에 화자 레이블을 할당한다.
  • 지연을 최소화하기 위해 실시간으로 단어 가설과 화자 레이블을 융합하는 점진적 ROVER 기반 시스템 조합을 구현한다.

실험 결과

연구 질문

  • RQ1하나를 제외한 빔포밍과 시스템 조합을 통한 시스템 조합이 비동기 다중 마이크 회의 전사에서 단어 정확도와 화자 할당 정확도를 어떻게 향상시키는가?
  • RQ2마이크 수를 늘일 경우 빔포밍과 시스템 조합이 적용되었을 때 WER와 SAWER에 어떤 영향을 미치는가?
  • RQ3블라인드 빔포밍과 음향 모델 융합이 원거리 음성 인식에서 단어 오류와 다이아라이제이션 오류를 얼마나 줄일 수 있는가?
  • RQ4실시간 화자 할당 전사에서 높은 정확도를 달성하면서도 저지연을 유지하는 방법은 무엇인가?
  • RQ5비동기 분산 마이크와 근접 마이크 간의 성능 격차는 겹치지 않는 음성 세그먼트에서 얼마나 되는가?

주요 결과

  • 일곱 개의 입력 마이크를 사용할 경우, 시스템은 22.3%의 단어 오류율(WER)을 기록하였으며, 겹치지 않는 음성에서 근접 마이크 성능보다 3.0% 절대 오차 이내였다.
  • 화자 할당된 WER(SAWER)는 26.7%였으며, 세 개, 다섯 개, 일곱 개 마이크의 경우 각각 단일 장치 시스템 대비 14.8%, 20.3%, 22.4%의 상대적 향상이 있었다.
  • 하나를 제외한 빔포밍과 시스템 조합을 조합한 결과, CNC 단독 대비 WER가 5.8% 상대적으로 감소하였으며, 표준 빔포밍 및 단일 장치 기반 시스템을 모두 초월하였다.
  • NIST RT-07 테스트 세트에서 시스템은 13.6%의 다이아라이제이션 오류율(DER)을 기록하였으며, 음성의 10%가 겹치는 음성으로 인해 대부분의 누락 세그먼트가 발생하였다.
  • 마이크 간 녹음 품질의 다양성을 고려할 때, 빔포밍은 입력 신호 품질을 균일하게 만들어 시스템 조합 성능을 크게 향상시켰다.
  • 점진적 ROVER 처리와 ASR 후 다이아라이제이션을 통해 저지연 운영을 유지하여 실시간 화자 할당 전사가 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.