Skip to main content
QUICK REVIEW

[論文レビュー] InQSS: a speech intelligibility assessment model using a multi-task learning network.

Yu‐Wen Chen, Yu Tsao|arXiv (Cornell University)|Nov 4, 2021
Speech and Audio Processing参考文献 27被引用数 4
ひとこと要約

InQSS は、スペクトログ램および散乱係数を入力特徴として用いるマルチタスク学習型音声理解度評価モデルであり、理解度と品質スコアを同時に予測する。実験結果は、散乱係数と品質スコアが理解度予測を顕著に向上させることを示しており、中国語音声評価のための新規 TMHINT-QI データセットが公開された。

ABSTRACT

Speech intelligibility assessment models are essential tools for researchers to evaluate and improve speech processing models. In this study, we propose InQSS, a speech intelligibility assessment model that uses both spectrogram and scattering coefficients as input features. In addition, InQSS uses a multi-task learning network in which quality scores can guide the training of the speech intelligibility assessment. The resulting model can predict not only the intelligibility scores but also the quality scores of a speech. The experimental results confirm that the scattering coefficients and quality scores are informative for intelligibility. Moreover, we released TMHINT-QI, which is a Chinese speech dataset that records the quality and intelligibility scores of clean, noisy, and enhanced speech.

研究の動機と目的

  • 複数の信号表現を統合することで予測精度を向上させる、頑健な音声理解度評価モデルの開発。
  • 散乱係数が音声理解度モデリングに有用な特徴として有効であるかの検証。
  • 理解度と品質スコアを同時に学習するマルチタスク学習の利点の探求。
  • クリア、ノイズあり、強化済み音声を含む多様な音声状態を備えた、品質スコアおよび理解度スコアがアノテーションされた新規中国語音声データセット(TMHINT-QI)の作成および公開。
  • 音声信号から理解度と品質スコアを同時に予測する統合フレームワークの提供。

提案手法

  • InQSS は、時間周波数特性と不変信号特性を両方捉えるために、スペクトログラムと散乱係数を二重入力特徴として採用。
  • 共有ブランチとタスク固有ブランチを備えたマルチタスク学習アーキテクチャを採用し、理解度と品質スコアを同時に予測。
  • 散乱係数はウェーブレットに基づく変換を用いて計算され、音声劣化に敏感な安定した低レベル特徴を抽出。
  • マルチタスク損失関数は、理解度と品質スコアの予測損失を組み合わせ、両目的を同時に最適化。
  • 新規に公開された TMHINT-QI データセット上でエンドツーエンドでモデルを学習。
  • 最終予測ヘッドの前段で特徴レベルの統合を適用し、タスク間の特徴相互作用を可能に。

実験結果

リサーチクエスチョン

  • RQ1スペクトログラムのみを用いるモデルと比較して、散乱係数が音声理解度評価モデルの性能向上に寄与するか。
  • RQ2マルチタスク学習フレームワークにおいて、品質スコアが理解度予測にどの程度寄与するか。
  • RQ3理解度と品質スコアの共同学習が、モデルの一般化性能を向上させるか。
  • RQ4異なる入力特徴(スペクトログラム対散乱係数)が最終的な理解度予測に果たす寄与度はいかほどか。
  • RQ5提案モデルがクリア、ノイズあり、強化済み音声状態のあらゆる条件下でどの程度一般化できるか。

主な発見

  • スペクトログラムのみを用いるモデルと比較して、散乱係数の統合が理解度予測性能を顕著に向上させた。
  • 品質スコアを併用した共同学習により、多様な音声劣化タイプにわたるモデルの一般化能力が向上した。
  • マルチタスク学習フレームワークにより、理解度と品質スコアの両方の予測がより安定的かつ正確になった。
  • 実験結果は、散乱係数と品質スコアが理解度評価に有用な特徴であることを確認した。
  • 公開された TMHINT-QI データセットは、中国語音声処理における理解度と品質の評価のための貴重なベンチマークを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。