Skip to main content
QUICK REVIEW

[論文レビュー] INTERSPEECH 2021 ConferencingSpeech Challenge: Towards Far-field Multi-Channel Speech Enhancement for Video Conferencing

Wei Rao, Yihui Fu|arXiv (Cornell University)|Apr 2, 2021
Speech and Audio Processing参考文献 30被引用数 7
ひとこと要約

本論文は、実際のビデオ会議環境を想定した遠方マルチチャネル音声強調のための、INTERSPEECH 2021 ConferencingSpeech チャレンジを提示する。本チャレンジでは、12の実際の会議室で新たに記録されたデータセットを用いて、単一マイクアレイを用いたリアルタイム強調と、複数の分散マイクアレイを用いた非リアルタイム強調の2つのタスクを実施する。ベースラインシステムは、チャネル間位相差と3層LSTMを用いた複素比マスク(CRM)に基づくディープラーニングモデルであり、リアルタイム要因は0.0425に達し、主観的MOS評価により音声品質の向上が明確に示された。

ABSTRACT

The ConferencingSpeech 2021 challenge is proposed to stimulate research on far-field multi-channel speech enhancement for video conferencing. The challenge consists of two separate tasks: 1) Task 1 is multi-channel speech enhancement with single microphone array and focusing on practical application with real-time requirement and 2) Task 2 is multi-channel speech enhancement with multiple distributed microphone arrays, which is a non-real-time track and does not have any constraints so that participants could explore any algorithms to obtain high speech quality. Targeting the real video conferencing room application, the challenge database was recorded from real speakers and all recording facilities were located by following the real setup of conferencing room. In this challenge, we open-sourced the list of open source clean speech and noise datasets, simulation scripts, and a baseline system for participants to develop their own system. The final ranking of the challenge will be decided by the subjective evaluation which is performed using Absolute Category Ratings (ACR) to estimate Mean Opinion Score (MOS), speech MOS (S-MOS), and noise MOS (N-MOS). This paper describes the challenge, tasks, datasets, and subjective evaluation. The baseline system which is a complex ratio mask based neural network and its experimental results are also presented.

研究の動機と目的

  • 複雑な音響条件を伴う現実のビデオ会議環境における遠方マルチチャネル音声強調に関する研究を促進すること。
  • 実際の会議室における混响、背景ノイズ、およびマイクと話者との距離の変動といった課題に取り組むこと。
  • 実用的導入に適した低遅延で将来のフレームに依存しないリアルタイム音声強調システムの開発を促進すること。
  • 高度なアルゴリズム的手法を用いて、複数の分散マイクアレイを用いた非リアルタイムでの音声品質の向上を可能にすること。
  • 主観的評価(絶対カテゴリー評価:ACR)を用いて、平均意見スコア(MOS)、音声MOS(S-MOS)、ノイズMOS(N-MOS)を測定するベンチマークを確立すること。

提案手法

  • 本チャレンジは、サイズ・素材・ノイズタイプが異なる12の異なる会議室で記録された実世界のデータセットを用い、3種類の幾何的配置を持つ複数のマイクアレイを含む。
  • タスク1では、Intel Core i5プロセッサ上でリアルタイム要因 ≤1.0 かつ最大フレーム長40msの制限のもとでリアルタイム処理が義務付けられる。
  • タスク2では、非リアルタイム処理により、複数の分散マイクアレイを用いたアルゴリズムの完全な探索が可能となる。
  • ベースラインシステムは、複素比マスク(CRM)に基づくニューラルネットワークであり、最初のマイクの振幅と位相に加え、4つのマイクペアからのチャネル間位相差(IPD)を入力とする。
  • 入力特徴量は周波数軸に沿って連結され、6F×Tのテンソルに変換され、3層の実数値LSTMを経て、全結合層でCRMの実部と虚部を予測する。
  • 強調された音声は、予測されたCRMを用いて逆STFTにより再構成される:Y_r = M_r * X_0r - M_i * X_0i および Y_i = M_r * X_0i + M_i * X_0r。

実験結果

リサーチクエスチョン

  • RQ1複素比マスクに基づくディープラーニングシステムは、実際のビデオ会議環境下における遠方マルチチャネル音声強調において、どの程度有効であるか?
  • RQ2単一マイクアレイを用いた低遅延のリアルタイム処理は、高い知覚的音声品質を維持しつつ実現可能か?
  • RQ3複数の分散マイクアレイを用いることで、単一アレイと比較して、音声強調性能はどの程度向上するか?
  • RQ4チャネル間位相差(IPD)の使用は、混ぜた環境下でのマルチチャネル音声強調のロバスト性をどのように向上させるか?
  • RQ5SNR(0–30 dB)を変化させたシミュレーテッドデータでの学習が、実世界のテスト環境への一般化に与える影響は何か?

主な発見

  • ベースラインシステムはIntel Xeonプロセッサ上でリアルタイム要因0.0425を達成し、実用的導入に適した優れたリアルタイム性能を示した。
  • 開発用シミュレーションセットにおいて、ノイズ混在音声が効果的に強調されたことが、音声品質指標の向上により裏付けられた。
  • 複数のマイクアレイでは、3つの単一アレイモデル(円形、線形均等、線形非均等)の出力をSNRに基づいて選択する手法が、単一モデルを用いる場合よりもわずかに優れた性能を示した。
  • 4つの戦略的に選択されたマイクペアからのチャネル間位相差(IPD)の使用により、空間的ヒントの推定能力が向上し、より優れた強調が可能になった。
  • 本チャレンジには17チームから21件の提出があり、5チームが両タスクに参加した。これは、分野における強い研究関心と活発な関与を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。