Skip to main content
QUICK REVIEW

[論文レビュー] ICASSP 2021 Acoustic Echo Cancellation Challenge: Datasets and Testing Framework.

Kusha Sridhar, Ross Cutler|arXiv (Cornell University)|Sep 10, 2020
Speech and Audio Processing被引用数 11
ひとこと要約

本論文は、ICASSP 2021 語り込みキャンセレーションチャレンジを紹介し、シングルトークおよびダブルトークのシナリオにおけるAECモデルの学習を目的として、多様な環境下で収録された2,500件を超える実機デバイスの記録を公開する。主観的評価のためのオープンソースのオンラインテストフレームワークをITU-T P.808に基づいて提供し、条件をまたいで平均MOS(Mean Opinion Score)に基づいて優勝者を決定する。

ABSTRACT

The ICASSP 2021 Acoustic Echo Cancellation Challenge is intended to stimulate research in the area of acoustic echo cancellation (AEC), which is an important part of speech enhancement and still a top issue in audio communication and conferencing systems. Many recent AEC studies report reasonable performance on synthetic datasets where the train and test samples come from the same underlying distribution. However, the AEC performance often degrades significantly on real recordings. Also, most of the conventional objective metrics such as echo return loss enhancement (ERLE) and perceptual evaluation of speech quality (PESQ) do not correlate well with subjective speech quality tests in the presence of background noise and reverberation found in realistic environments. In this challenge, we open source two large datasets to train AEC models under both single talk and double talk scenarios. These datasets consist of recordings from more than 2,500 real audio devices and human speakers in real environments, as well as a synthetic dataset. We open source an online subjective test framework based on ITU-T P.808 for researchers to quickly test their results. The winners of this challenge will be selected based on the average P.808 Mean Opinion Score (MOS) achieved across all different single talk and double talk scenarios.

研究の動機と目的

  • 合成データセットと実世界の記録との間のAEC性能のギャップを解消する。モデルはしばしば著しく性能を低下させる。
  • 従来の指標(ERLE や PESQ など)に代わり、ノイズやリバーブ下での実際の音声品質をよりよく反映する主観的評価を導入することで、評価の信頼性を向上させる。
  • 2,500台を超える実際のオーディオデバイスと人間の話者の自然な環境下での大規模かつ現実的な学習データを提供する。
  • 公開可能なオンライン主観的テストフレームワークを用いて、シングルトークおよびダブルトークの両シナリオにおける標準化されたベンチマークを実現する。
  • ITU-T P.808を用いた主観的品質を主評価指標とすることで、耐障害性に優れたAEC分野の研究を促進する。

提案手法

  • 実環境における2,500台を超える実機オーディオデバイスと人間話者の実記録を含む大規模データセットと、学習用の合成データセットの2つを公開する。
  • ITU-T P.808準拠のオンラインテストフレームワークを設計し、AEC性能に関する主観的評価テストを実施する。
  • 複数のシングルトークおよびダブルトークのシナリオにおいて、人間の聴取者から得た平均MOS(Mean Opinion Score)を収集し、知覚的品質を評価する。
  • 全テスト条件における平均MOSを、優勝者をランク付けおよび選定する主な指標として使用する。
  • テストインfraストラクチャとデータセットを公開することで、再現性と公平性を確保する。
  • 背景ノイズや部屋のリバーブを含む実世界の状況に焦点を当て、実用的導入の課題を反映した評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1分布が同一の合成データセットと比較して、実世界の記録におけるAECモデルの性能はどのように異なるか?
  • RQ2ノイズやリバーブ環境下において、従来の客観的指標(ERLE や PESQ など)と主観的音声品質の相関度はどの程度か?
  • RQ3大規模な実世界データセットを用いることで、厳しい音響条件下におけるAECモデルの耐障害性は向上するか?
  • RQ4ITU-T P.808に基づくオンライン主観的テストフレームワークは、多様なシナリオにおけるAECシステムのベンチマークにどの程度効果的か?
  • RQ5主観的品質スコアによる評価において、ダブルトークシナリオがAEC性能に与える影響は何か?

主な発見

  • チャレンジ用データセットには、実環境で記録された2,500台を超える実機オーディオデバイスと人間話者が含まれ、現実的なAEC学習を可能にする。
  • ITU-T P.808に基づくオープンソースのオンラインテストフレームワークにより、研究者が標準化されスケーラブルなAEC性能の主観的評価を実施できる。
  • チャレンジの優勝者は、全シングルトークおよびダブルトークシナリオにおける平均MOS(Mean Opinion Score)に基づいて選定される。
  • 主観的MOSスコアは、実世界の状況下での知覚的品質を反映するうえで、従来の指標(ERLE や PESQ など)よりも信頼性が高いことが示された。
  • 実データセットと合成データセットの両方を含むことで、多様な音響条件下での学習と評価が可能になる。
  • フレームワークにより、ノイズやリバーブを含む現実的で複雑な音響環境下でのAECモデルの直接比較が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。