Skip to main content
QUICK REVIEW

[論文レビュー] Continuous speech separation: dataset and analysis

Zhuo Chen, Takuya Yoshioka|arXiv (Cornell University)|Jan 30, 2020
Speech and Audio Processing参考文献 36被引用数 11
ひとこと要約

本稿では、会議における連続的で重複する会話のシナリオを模倣した実世界のマルチチャネルデータセット『LibriCSS』を紹介し、連続的音声分離(CSS)のためのKaldiベースのASR評価プロトコルを確立する。実験から、高比率の重複や限られたマイク数の下でも、最先端のCSS手法ですら性能が著しく低下することを示し、研究室環境のベンチマークと実運用環境との間のギャップが顕著であることが明らかになった。

ABSTRACT

This paper describes a dataset and protocols for evaluating continuous speech separation algorithms. Most prior studies on speech separation use pre-segmented signals of artificially mixed speech utterances which are mostly \emph{fully} overlapped, and the algorithms are evaluated based on signal-to-distortion ratio or similar performance metrics. However, in natural conversations, a speech signal is continuous, containing both overlapped and overlap-free components. In addition, the signal-based metrics have very weak correlations with automatic speech recognition (ASR) accuracy. We think that not only does this make it hard to assess the practical relevance of the tested algorithms, it also hinders researchers from developing systems that can be readily applied to real scenarios. In this paper, we define continuous speech separation (CSS) as a task of generating a set of non-overlapped speech signals from a extit{continuous} audio stream that contains multiple utterances that are \emph{partially} overlapped by a varying degree. A new real recorded dataset, called LibriCSS, is derived from LibriSpeech by concatenating the corpus utterances to simulate a conversation and capturing the audio replays with far-field microphones. A Kaldi-based ASR evaluation protocol is also established by using a well-trained multi-conditional acoustic model. By using this dataset, several aspects of a recently proposed speaker-independent CSS algorithm are investigated. The dataset and evaluation scripts are available to facilitate the research in this direction.

研究の動機と目的

  • 会話が連続的で部分的に重複する実世界の応用状況と、研究室ベースの音声分離ベンチマークとの乖離を是正すること。
  • 分離済みのセグメント化済みデータセットや信号ベースの指標(例:SDR、SISNR)では、ASR精度と相関が低いため、その限界を克服すること。
  • 重複検出、話者ダイアライゼーション、エンドツーエンドのASR性能を含む、連続的音声分離(CSS)の現実的評価フレームワークを構築すること。
  • 実記録ベースのデータセットを用いて、マイク構成とレイテンシのCSS性能への影響を調査すること。
  • 音声分離研究と実運用のギャップを埋めるために、変動する重複率を持つ連続音声ストリーム上でシステムを評価すること。

提案手法

  • LibriSpeechの発話文を連結して会議風の連続音声にし、実際の部屋で遠方マイクを用いて録音することで、LibriCSSを構築する。
  • パーミュテーション不変訓練(PIT)に基づく話者に依存しない音声分離モデルを用い、連続混合音声から非重複音声ストリームを生成する。
  • 連続入力に対して語彙誤り率(WER)を用いて分離性能を評価するため、マルチ条件アコースティックモデルを搭載したKaldiベースのASRパイプラインを実装する。
  • 重複率(0%〜40%)とマイク構成(1ch〜7ch)を変化させ、空間的配置(線形、三角形、円形)を含めた評価を実施する。
  • 前方参照(lookahead)を用いたチャンク化推論(N_L, N_C, N_R)を適用し、リアルタイム処理を模擬し、内在的レイテンシを測定する。
  • MVDRビームフォーミングをベースラインとし、マスクベース分離および分離なしの条件と比較することで、CSSが下流ASRに与える影響を明確に分離する。
Fig. 1 : Example recording setup (left) and microphone array geometry (right).
Fig. 1 : Example recording setup (left) and microphone array geometry (right).

実験結果

リサーチクエスチョン

  • RQ1実世界に近い音声ストリームにおいて、重複率が上昇するにつれて連続的音声分離の性能はどのように変化するか?
  • RQ2マイク数と空間的配置が、連続的音声分離を用いた際の下流ASRのWERにどの程度の影響を与えるか?
  • RQ3話者に依存しないCSSシステムは、重複なしセグメントにおいてもASR性能を維持または向上させることができるか?また、歪みを導入するか?
  • RQ4前方参照とチャンク化に起因する内在的レイテンシが、連続入力環境下でのASR性能にどのように影響するか?
  • RQ5発話間ギャップを3秒から0.5秒以下に短縮した場合、音声分離のWERに与える相対的影響はどの程度か?

主な発見

  • 発話間ギャップを3秒(0L)から0.5秒以下(0S)に短縮した際、分離なしベースラインではWERが33.9%相対的に増加した。これは、沈黙のないターンチェンジがASRに悪影響を及えることを示している。
  • CSSシステムにより、短いギャップに起因するWERの相対的増加は22.7%にまで低減された。これは、分離が隣接発話に起因する性能劣化を緩和できることを示している。
  • 7マイク構成では、重複率40%において、分離なしのWER 43.3%をCSSシステムが21.9%にまで低下させ、高比率重複下での顕著な改善が確認された。
  • 1マイクおよび3マイクシステムでは、重複なしセグメントでWERが悪化する傾向にあり、これは不要なビームフォーミングや分離が歪みを引き起こす可能性を示している。
  • 前方参照(例:1.2-0.8-0.4)を有するシステムは、無し(例:1.6-0.8-0.0)のシステムを上回る性能を示し、将来の文脈情報が分離品質を向上させることを示した。
  • 3マイクの線形配置では重複率40%でWER 30.1%を達成したが、三角形配置では36.0%にとどまり、空間的配置が性能に顕著な影響を与えることが明らかになった。
Fig. 2 : Generating TF masks in a streaming fashion by using a sliding window. Output orders for each pair of neighboring chunks are aligned by using the frames that the two chunks share.
Fig. 2 : Generating TF masks in a streaming fashion by using a sliding window. Output orders for each pair of neighboring chunks are aligned by using the frames that the two chunks share.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。