Skip to main content
QUICK REVIEW

[논문 리뷰] M2MeT: The ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge

Fan Yu, Shiliang Zhang|arXiv (Cornell University)|2021. 10. 14.
Speech Recognition and Synthesis인용 수 11
한 줄 요약

이 논문은 120시간의 원거리(8채널 어레이) 및 근거리(헤드셋) 기록을 포함한 대규모 중국어 다중채널, 다중참가자 회의 음성 전사 데이터셋(AliMeeting)을 포함하는 M2MeT 챌린지를 소개한다. 이 데이터셋은 말하기자 추적 및 다중화자 음성인식(ASR) 두 가지 트랙을 제공하며, ESPnet 툴킷과 conformer 기반의 SOT(순차적 출력 훈련) 모델을 사용하여 원거리 테스트 세트에서 29.7%의 CER를 달성한다. 비용 기반 보정 기법과 외부 데이터를 활용함으로써 뚜렷한 성능 향상을 보였다.

ABSTRACT

Recent development of speech processing, such as speech recognition, speaker diarization, etc., has inspired numerous applications of speech technologies. The meeting scenario is one of the most valuable and, at the same time, most challenging scenarios for the deployment of speech technologies. Specifically, two typical tasks, speaker diarization and multi-speaker automatic speech recognition have attracted much attention recently. However, the lack of large public meeting data has been a major obstacle for the advancement of the field. Therefore, we make available the AliMeeting corpus, which consists of 120 hours of recorded Mandarin meeting data, including far-field data collected by 8-channel microphone array as well as near-field data collected by headset microphone. Each meeting session is composed of 2-4 speakers with different speaker overlap ratio, recorded in rooms with different size. Along with the dataset, we launch the ICASSP 2022 Multi-channel Multi-party Meeting Transcription Challenge (M2MeT) with two tracks, namely speaker diarization and multi-speaker ASR, aiming to provide a common testbed for meeting rich transcription and promote reproducible research in this field. In this paper we provide a detailed introduction of the AliMeeting dateset, challenge rules, evaluation methods and baseline systems.

연구 동기 및 목표

  • 다중화자 음성 처리를 위한 대규모 공개 중국어 회의 코퍼스의 부족을 보완하기 위해.
  • ICASSP 2022 챌린지를 통해 다중채널, 다중참가자 회의 전사의 공통 평가 플랫폼을 구축하기 위해.
  • 다양하고 실제적인 회의 데이터셋을 공개함으로써 재현 가능한 연구를 촉진하기 위해.
  • 실제 회의 데이터를 사용하여 말하기자 추적 및 다중화자 ASR 분야의 최첨단 성능을 평가하기 위해.
  • 어려운 음향 환경에서 모델 일반화 능력에 미치는 데이터 증강 및 외부 데이터의 영향을 탐구하기 위해.

제안 방법

  • AliMeeting 데이터셋은 8채널 방향성 어레이 및 헤드셋 마이크로 기록된 120시간의 중국어 회의로 구성되며, 2~4명의 화자와 다양한 겹침 비율을 포함한다.
  • 챌린지는 말하기자 추적 및 다중화자 음성인식(ASR) 두 트랙으로 구성되며, 표준화된 평가 프로토콜과 지표를 제공한다.
  • 다중화자 ASR의 경우 SOT(순차적 출력 훈련) 방법을 사용하며, 서로 다른 화자로부터의 발화가 <sc> 토큰을 통해 연결되어 화자 전환을 모델링한다.
  • 모델은 12층의 conformer 인코더와 4헤드 어텐션 구조를 사용하며, 메르 필터뱅크 특징(71차원, 25ms 프레임 길이, 10ms 이격)을 기반으로 훈련된다.
  • 일반화 능력을 향상시키기 위해 외부 데이터(Aishell-1, AIDataTang, ST-CMD)를 활용하며, 최종 모델에서는 근거리 데이터에 대해 소음 및 리버버브를 시뮬레이션한다.
  • 모든 기준 시스템은 ESPnet 툴킷을 사용해 구현 및 훈련되며, 100 에포크 동안 훈련하고 첫 25,000 반복 동안 웜업 전략을 적용한다.
Fig. 1 : An example of recording venue and the topology of microphone array.
Fig. 1 : An example of recording venue and the topology of microphone array.

실험 결과

연구 질문

  • RQ1근거리 및 원거리 데이터의 포함 여부가 실제 회의 상황에서의 다중화자 ASR 성능에 미치는 영향은 어떠한가?
  • RQ2외부, 도메인 외부 데이터가 원거리 회의 전사에서 일반화 능력에 얼마나 기여하는가?
  • RQ3비용 기반 보정 및 데이터 증강(예: 시뮬레이션된 소음/리버버브)이 실제 원거리 데이터에서 모델의 강인성 향상에 얼마나 효과적인가?
  • RQ4겹침이 있는 음성 조건에서 SOT 기반 다중화자 ASR 모델이 단일화자 기준 모델 대비 성능 향상은 어느 정도인가?
  • RQ5변동하는 화자 수를 고려할 때 SOT 방법이 순열 기반 훈련 대비 CER 및 확장성 측면에서 어떻게 비교되는가?

주요 결과

  • SOT 기반 다중화자 ASR 모델은 근거리 데이터와 비용 기반 보정을 통해 미세조정한 결과, 원거리 테스트 세트에서 29.7%의 CER를 달성하였으며, 단일화자 기준 모델을 크게 능가하였다.
  • 외부 근거리 데이터에 대해 시뮬레이션된 소음과 리버버브를 적용한 ConformerD 모델은 원거리 데이터의 CER를 35.0%에서 33.3%로 감소시켜 강력한 일반화 효과를 입증하였다.
  • Aishell-1, AIDataTang, ST-CMD 데이터를 훈련 세트에 추가함으로써 단일화자 설정에서 원거리 세트의 CER는 37.5%에서 24.7%로 감소하였다.
  • 비용 기반 보정을 적용한 SOT 모델(SOTB_bf)은 Ali-far-bf 세트에서 29.7%의 CER를 기록하여 최첨단 기준 모델(41.2%)을 능가하였으며, 리버버브 조건에서도 강인성을 보였다.
  • SOT의 FIFO 기반 훈련 전략은 전체 순열 기반 PIT보다 더 낮은 계산 비용으로 더 낮은 CER 성능을 달성하여 우수한 성능을 보였다.
  • AliMeeting 데이터셋과 M2MeT 챌린지를 결합함으로써, 여러 연구 팀 간 재현 가능한 평가를 가능하게 하는 표준화된 기준이 제공되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.