Skip to main content
QUICK REVIEW

[論文レビュー] A scalable noisy speech dataset and online subjective test framework

Chandan K. Reddy, Ebrahim Beyrami|arXiv (Cornell University)|Sep 17, 2019
Speech and Audio Processing参考文献 11被引用数 16
ひとこと要約

本稿では、スケーラブルなノイジィースピーチデータセットであるMS-SNSDと、音声強調アルゴリズムの評価を目的としたオンライン・クラウドソーシング主観評価フレームワークを紹介する。大規模な主観MOS評価を可能にすることで、著者らはデータセットサイズの増大がノイズ抑制性能の向上をもたらすことを実証し、PESQ や POLQA といった客観的指標とは対照的に、主観的MOSが依然として不可欠であることを示している。

ABSTRACT

Background noise is a major source of quality impairments in Voice over Internet Protocol (VoIP) and Public Switched Telephone Network (PSTN) calls. Recent work shows the efficacy of deep learning for noise suppression, but the datasets have been relatively small compared to those used in other domains (e.g., ImageNet) and the associated evaluations have been more focused. In order to better facilitate deep learning research in Speech Enhancement, we present a noisy speech dataset (MS-SNSD) that can scale to arbitrary sizes depending on the number of speakers, noise types, and Speech to Noise Ratio (SNR) levels desired. We show that increasing dataset sizes increases noise suppression performance as expected. In addition, we provide an open-source evaluation methodology to evaluate the results subjectively at scale using crowdsourcing, with a reference algorithm to normalize the results. To demonstrate the dataset and evaluation framework we apply it to several noise suppressors and compare the subjective Mean Opinion Score (MOS) with objective quality measures such as SNR, PESQ, POLQA, and VISQOL and show why MOS is still required. Our subjective MOS evaluation is the first large scale evaluation of Speech Enhancement algorithms that we are aware of.

研究の動機と目的

  • 音声強調分野におけるディープラーニングのための、大規模かつ多様なノイジィースピーチデータセットの不足に対処する。
  • 従来の主観評価手法に見られる、時間のかかりすぎる・スケーラブルでないという制限を克服する。
  • 大規模かつクラウドソーシングによる主観評価のための再現可能でオープンソースのフレームワークを構築する。
  • SNR、PESQ、POLQA、VISQOLといった客観的指標と比較することで、主観的平均意見スコア(MOS)の重要性を示す。
  • さまざまなノイズタイプ、SNRレベル、話者集団に対して、標準化・正規化された評価を可能にする。

提案手法

  • 任意の話者、ノイズタイプ、SNRレベルの組み合わせをサポートするモジュラーよりも拡張性の高いデータセット生成パイプラインを設計する。
  • 合成データ生成アプローチを用いて、学習および評価に適した大規模で多様かつスケーラブルなノイジィースピーチデータセット(MS-SNSD)を生成する。
  • Amazon Mechanical Turkを活用したオンライン・クラウドソーシング主観評価フレームワークを実装し、大規模な平均意見スコア(MOS)収集を実現する。
  • レーティング者やセッション間で一貫性を保つために、リファレンスアルゴリズムに基づくスコア補正技術を導入する。
  • 主観的MOSと併せて、SNR、PESQ、POLQA、VISQOLといった客観的品質指標を統合し、比較分析を実施する。
  • オープンソースライセンスの下でデータセットと評価フレームワークを公開することで、再現性とオープンアクセスを確保する。

実験結果

リサーチクエスチョン

  • RQ1ノイジィースピーチデータセットのサイズを増加させることで、ディープラーニングベースのノイズ抑制モデルの性能にどのような影響を与えるか?
  • RQ2スケーラブルでクラウドソーシング可能なフレームワークは、音声強調のための一貫性があり妥当な主観的平均意見スコア(MOS)を信頼性を持って得られるか?
  • RQ3実際のノイズ環境下で、客観的音声品質指標(例:PESQ、POLQA、VISQOL)と主観的MOSの相関関係はどの程度か?
  • RQ4既存の客観的指標が、主観的聴取テストで顕在する知覚的品質向上をどれほど正しく捉えていないか、その程度はどの程度か?
  • RQ5標準化されたオープンソース評価フレームワークは、音声強調研究における再現性と公平性を向上させることができるか?

主な発見

  • MS-SNSDデータセットのサイズを拡大することで、ノイズ抑制性能に顕著な向上が得られ、ディープラーニングにおけるデータスケールの利点が裏付けられた。
  • 提案されたオンライン主観評価フレームワークにより、複数のレーティング者や状況において一貫性のある結果を得られる大規模な信頼性の高いMOS収集が可能になった。
  • 主観的MOSは依然として必要な評価指標であり、PESQ や SNR といった客観的指標では完全に反映されない知覚的品質向上を捉えている。
  • 客観的指標とMOSの相関は、最低限の水準に留まり、自動測定に依存するだけでは不十分であることが示された。
  • リファレンスアルゴリズムを用いたスコア正規化により、異なるモデルやテスト条件間での公平な比較が可能になった。
  • 本研究は、クラウドソーシングを用いた大規模でオープンかつ再現可能な音声強調アルゴリズムの主観的評価の初の試みを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。