Skip to main content
QUICK REVIEW

[論文レビュー] Single-Channel Multi-talker Speech Recognition with Permutation Invariant Training

Yanmin Qian, Xuankai Chang|arXiv (Cornell University)|Jul 19, 2017
Speech Recognition and Synthesis被引用数 3
ひとこと要約

本稿では、単一チャネルの複数話者音声認識のための置換不変訓練(PIT)に基づくアプローチを提案する。この手法は、統合的なエンドツーエンドフレームワーク内で、話者分離と認識を直接最適化する。前処理の特徴量分離(MSEを用いて)および後処理のASR(交差エントロピーを用いて)の両方にPITを適用することで、ラベルの置換問題を効果的に解消し、2話者と3話者の混合音声において、それぞれ45.0%および25.0%の相対的WER低減を達成。話者数の変動に対しても優れた汎化性能を示した。

ABSTRACT

Although great progresses have been made in automatic speech recognition (ASR), significant performance degradation is still observed when recognizing multi-talker mixed speech. In this paper, we propose and evaluate several architectures to address this problem under the assumption that only a single channel of mixed signal is available. Our technique extends permutation invariant training (PIT) by introducing the front-end feature separation module with the minimum mean square error (MSE) criterion and the back-end recognition module with the minimum cross entropy (CE) criterion. More specifically, during training we compute the average MSE or CE over the whole utterance for each possible utterance-level output-target assignment, pick the one with the minimum MSE or CE, and optimize for that assignment. This strategy elegantly solves the label permutation problem observed in the deep learning based multi-talker mixed speech separation and recognition systems. The proposed architectures are evaluated and compared on an artificially mixed AMI dataset with both two- and three-talker mixed speech. The experimental results indicate that our proposed architectures can cut the word error rate (WER) by 45.0% and 25.0% relatively against the state-of-the-art single-talker speech recognition system across all speakers when their energies are comparable, for two- and three-talker mixed speech, respectively. To our knowledge, this is the first work on the multi-talker mixed speech recognition on the challenging speaker-independent spontaneous large vocabulary continuous speech task.

研究の動機と目的

  • 単一チャネル入力からの複数話者混合音声の認識に課題を提起し、話者識別が曖昧である状況を扱う。
  • 深層学習ベースの複数話者ASRシステムにおけるラベルの置換問題を克服し、信頼性の高い学習と推論を可能にする。
  • 明示的な分離段階を含まない、統合的エンドツーエンドアーキテクチャを構築し、特徴量分離と音声認識を同時に最適化する。
  • 現実的な条件下で、話者独立型、自然な大語彙連続音声タスクに対してモデルを評価する。
  • 訓練時とは異なる話者数の混合音声に適用した場合の汎化能力を示す。特に、3話者モデルを用いて2話者混合音声を認識する能力を検証する。

提案手法

  • 前処理の特徴量分離と後処理のASRの両方に、置換不変訓練(PIT)を適用し、それぞれ最小二乗誤差(MSE)および最小交差エントロピー(CE)基準を用いる。
  • 各発話に対して、すべての可能な出力-ターゲット話者割り当ての損失を計算し、最適化のために最小誤差を持つ割り当てを選択する。
  • 直接的なPIT-CE-ASRモデルを導入し、明示的な音声分離を回避して、各話者のセンオン後退確率を直接予測する。
  • 統一された学習目的の下で、前処理分離と後処理認識を統合的に最適化するアーキテクチャを採用する。
  • 単一チャネルの混合音声入力を用い、事前の話者情報なしに深層ニューラルネットワークを用いて話者固有の表現をモデル化する。
  • 話者エネルギーの違いや性別コンビネーションの変動を加味した、人工的に混合されたAMIデータセットを用い、2話者および3話者シナリオで評価する。

実験結果

リサーチクエスチョン

  • RQ1置換不変訓練(PIT)を音声分離からエンドツーエンド複数話者音声認識へ効果的に拡張可能か?
  • RQ2PITによる特徴量分離とASRの統合的最適化は、分離段階を別々に学習する場合と比較して認識性能を向上させるか?
  • RQ3本手法が、訓練時とは異なる話者数の混合音声に適用された場合、どのように汎化するか?
  • RQ4本手法は、困難な複数話者状況下で、最先端の単一話者ASRシステムに対して、どの程度の性能向上を示すか?
  • RQ5異なる話者エネルギーと性別コンビネーションの下でも、モデルは頑健性を維持するか?

主な発見

  • 提案された直接的PIT-CE-ASRモデルは、2話者混合音声(同じエネルギー条件)において、最先端の単一話者ASRシステムと比較して45.0%の相対的語誤り率(WER)低減を達成した。
  • 3話者混合音声においては、同じエネルギー条件下で全話者に対して25.0%の相対的WER低減を達成した。
  • 3話者PIT-CE-ASRモデルは2話者混合音声にも良好に汎化し、専用の2話者モデルとほぼ同等のWERを達成した。これは、話者数の変動に強い性能を示している。
  • 異なる性別の混合音声(例:64.80% WER)では、同じ性別の混合音声(例:69.78% WER)よりも性能が優れており、性別多様性が認識を支援することが示唆された。
  • 低SNR条件下でも強固な性能を維持し、3話者混合音声において15dBと20dB SNRのそれぞれで、WERが72.88%および81.63%にとどまった。
  • 著者らの知る限り、これは単一チャネル入力で、話者独立型、自然な大語彙連続音声タスクを対象とした、初めての成功したエンドツーエンド認識システムである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。