Skip to main content
QUICK REVIEW

[論文レビュー] Recognizing Multi-talker Speech with Permutation Invariant Training

Dong Yu, Xuankai Chang|arXiv (Cornell University)|Mar 22, 2017
Speech Recognition and Synthesis参考文献 31被引用数 12
ひとこと要約

この論文は、事前の分離なしに単一チャネル混合音声から複数の音声ストリームを直接認識するエンドツーエンドマルチスケイカー音声認識のための順列不変訓練(PIT-ASR)を提案する。すべての可能なスケイカー出力割り当てに関する交差エントロピーを最小化し、最適な順列を選択することで、ラベル順列の問題とスケイカー追跡を統合的に解決する。0dB SNRで相対的に40%のWER低減を達成し、20dB SNRでは単一スケイカー性能に近づく。

ABSTRACT

In this paper, we propose a novel technique for direct recognition of multiple speech streams given the single channel of mixed speech, without first separating them. Our technique is based on permutation invariant training (PIT) for automatic speech recognition (ASR). In PIT-ASR, we compute the average cross entropy (CE) over all frames in the whole utterance for each possible output-target assignment, pick the one with the minimum CE, and optimize for that assignment. PIT-ASR forces all the frames of the same speaker to be aligned with the same output layer. This strategy elegantly solves the label permutation problem and speaker tracing problem in one shot. Our experiments on artificially mixed AMI data showed that the proposed approach is very promising.

研究の動機と目的

  • 事前の分離なしに単一チャネル混合音声信号からの複数の重なり合う音声ストリームを認識する課題に対処すること。
  • 統一されたトレーニングフレームワークを用いて、マルチスケイカーASRに内在するラベル順列とスケイカー追跡の問題を解決すること。
  • 順列不変損失を用いたエンドツーエンドトレーニングが、低SNR条件下でも強力な認識を達成できることを示すこと。
  • 人工的に混合されたAMIデータ上でPIT-ASRの有効性を評価し、さまざまな信号対雑音比(SNR)における性能を比較すること。

提案手法

  • モデルは4層、1層あたり768ユニットの深層双方向LSTMアーキテクチャを用い、40次元のログフィルタバンク特徴を処理する。
  • 交差エントロピー(CE)を真のセンオン後確率と予測されたセンオン後確率の間で順列不変訓練(PIT)を適用する。再構成損失ではなくCEを用いる。
  • 各発話について、すべての可能なスケイカーから出力への割り当てを評価し、CEが最小となる順列をバックプロパゲーションに使用する。
  • トレーニングはバッチサイズ8で行い、勾配クリッピング(しきい値0.0003)を適用して安定性を確保する。
  • 推論時、両方の出力を独立してデコードし、ペairワイズスコアリングにより各発話ごとにより良いWERを選択する。
  • 2人のスケイカーのセンオンアラインメントは、単一スケイカーベースラインからプールされ、短い発話はサイレント状態でパディングされる。

実験結果

リサーチクエスチョン

  • RQ1順列不変訓練は、明示的な音声分離なしにエンドツーエンドマルチスケイカー音声認識に効果的に適応可能か?
  • RQ2PIT-ASRは、混合マルチスケイカー音声に直接適用された場合、従来の単一スケイカーモデルを上回るか?
  • RQ3信号対雑音比(SNR)が低下するに従って、高エネルギーおよび低エネルギーのスケイカーにおけるPIT-ASRの性能はどのように変化するか?
  • RQ4PIT-ASRは、同時に複数のスケイカーを認識する過程で、暗黙的(implicit)に音声分離を実行できるか?

主な発見

  • 0dB SNRでは、高エネルギーのスケイカーで49.74%、低エネルギーのスケイカーで56.88%のWERを達成し、ベースラインと比較して相対的に40%のWER低減を実現した。
  • 20dB SNRでは、高エネルギーのスケイカーのWER(29.68%)が単一スケイカーベースライン(26.6%)に近く、高い耐障害性を示した。
  • 低エネルギーのスケイカーは顕著な改善を示し、SNRが20dBに達するまでにWERが118.7%(ベースライン)から80.83%に低下したが、依然として性能は限定的であった。
  • 可視化から、低SNRでも両スケイカーの正しい単語認識が確認され、モデルが暗黙的音声分離を実行していることが裏付けられた。
  • SNRが低下するに従い、高エネルギーのスケイカーでは性能低下が徐々に進行したが、低エネルギーのスケイカーでは著しく深刻な低下が見られた。これは、弱い信号の追跡が困難であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。