Skip to main content
QUICK REVIEW

[論文レビュー] CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings

Shinji Watanabe, Michael Mandel|arXiv (Cornell University)|Apr 20, 2020
Speech Recognition and Synthesis参考文献 49被引用数 97
ひとこと要約

本論文は CHiME-6 を、セグメント化多話者ASRのトラック1とセグメントなし多話者ASRと diarization のトラック2の2トラックで導入し、エンドツーエンドの多話者処理のためのオープンソース Kaldi ベースラインを提供します。

ABSTRACT

Following the success of the 1st, 2nd, 3rd, 4th and 5th CHiME challenges we organize the 6th CHiME Speech Separation and Recognition Challenge (CHiME-6). The new challenge revisits the previous CHiME-5 challenge and further considers the problem of distant multi-microphone conversational speech diarization and recognition in everyday home environments. Speech material is the same as the previous CHiME-5 recordings except for accurate array synchronization. The material was elicited using a dinner party scenario with efforts taken to capture data that is representative of natural conversational speech. This paper provides a baseline description of the CHiME-6 challenge for both segmented multispeaker speech recognition (Track 1) and unsegmented multispeaker speech recognition (Track 2). Of note, Track 2 is the first challenge activity in the community to tackle an unsegmented multispeaker speech recognition scenario with a complete set of reproducible open source baselines providing speech enhancement, speaker diarization, and speech recognition modules.

研究の動機と目的

  • 実在の自宅環境で遠距離マイクロフォン多話者ASRをリアルな環境で2つのトラック(セグメント化とセグメントなし)で前進させる。
  • 再現性のあるベースラインを提供します。音声強化、ディアライゼーション、および Kaldi に統合された ASR コンポーネントを含む。
  • 現実的でディアライゼーション機能を備えた設定でディアライゼーションエラーが認識性能に与える影響を定量化する。
  • 未セグメントの多話者ASRに取り組む研究者の参入障壁を下げるオープンソースレシピを提供する。

提案手法

  • 2つのチャレンジトラック: Track 1 (グラウンドトゥルースディアライゼーション付きASR) と Track 2 (ディアライゼーション + ASR)。
  • 複数の商用 4 チャネルのマイクロフォンアレイを整列させるアレイ同期ベースライン。
  • ガイド付き源分離(GSS) および BeamformIt に基づく前端、任意の WPE デレバーベーションを含む。
  • MFCC 特徴量、GMM-HMM および chain TDNN-F 音響モデルを含む Kaldi ベースの ASR パイプライン。
  • データ拡張、データ準備、および 2 段階の i-vector/ビームフォーミング強化デコーディングを用いたデコード。
  • Track 2 のディアライゼーション・パイプラインは x-vectors (TDNN) と PLDA スコアリング、AHC、および RTTM ベースの評価を使用。

実験結果

リサーチクエスチョン

  • RQ1セグメント化されていない多話者録音におけるディアライゼーションは ASR 性能にどのような影響を与えるのか?
  • RQ2再現性のあるオープンソースのベースライン(同期、強化、ディアライゼーション、ASR の統合)は CHiME-6 風のタスクへの参入を簡易化できるか?
  • RQ3現実的な家庭環境におけるセグメントされた ASR と未セグメントの多話者 ASR のベースライン性能ギャップはどれくらいか?

主な発見

  • Track 1 baseline ASR WER: Dev 51.8%、Eval 51.3%。
  • Track 2 baseline SAD results (Annotation RTTM): DEV DER 61.6%、JER 69.8%; EVAL DER 62.0%、JER 71.4%。
  • Track 2 baseline SAD results (Alignment RTTM): DEV DER 63.4%、JER 70.8%; EVAL DER 68.2%、JER 72.5%。
  • Track 1 enhancement with BeamformIt: WER 69.8% (DEV) and 61.2% (EVAL)。
  • Track 1 enhancement with GSS: WER 51.8% (DEV) and 51.3% (EVAL)。
  • Track 2 enhancement with BeamformIt: WER 84.3% (DEV) and 77.9% (EVAL)。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。