Skip to main content
QUICK REVIEW

[論文レビュー] Distilling Knowledge Using Parallel Data for Far-field Speech Recognition

Jiangyan Yi, Jianhua Tao|arXiv (Cornell University)|Feb 20, 2018
Speech Recognition and Synthesis参考文献 30被引用数 4
ひとこと要約

本論文では、AMIコーパス上で4.7%の絶対的WER低減を達成するため、高品質な近距離(教師)モデルから低品質な遠距離(生徒)モデルへの知識蒸留を、同時録音された並列音声データを用いて提案する。生徒モデルと教師モデルの出力分布間のKLダイバージェンスを最小化することで、従来の学習法を著しく上回る性能向上を実現した。

ABSTRACT

In order to improve the performance for far-field speech recognition, this paper proposes to distill knowledge from the close-talking model to the far-field model using parallel data. The close-talking model is called the teacher model. The far-field model is called the student model. The student model is trained to imitate the output distributions of the teacher model. This constraint can be realized by minimizing the Kullback-Leibler (KL) divergence between the output distribution of the student model and the teacher model. Experimental results on AMI corpus show that the best student model achieves up to 4.7% absolute word error rate (WER) reduction when compared with the conventionally-trained baseline models.

研究の動機と目的

  • 騒音や混浊の影響を受ける遠距離音声認識の性能を向上させること。
  • 限られた遠距離データの課題に対処するため、並列の近距離および遠距離録音データを活用すること。
  • 高品質な近距離データから得られる耐障害性を、遠距離モデルに転送する知識蒸留の手法を検討すること。
  • 良好に性能を発揮する教師モデルから生徒モデルへ知識を転送することで、遠距離ASRの語誤り率(WER)を低減すること。
  • 同じ話者から同時に録音された並列データを用いた蒸留の有効性を実証すること。

提案手法

  • 高品質な近距離音声データを用いて、近距離(教師)モデルを学習する。
  • 同じ発話内容の並列遠距離録音データを用いて、生徒モデルを学習する。
  • 生徒モデルの出力分布と教師モデルの出力分布の間のカルバック・ライブラー(KL)ダイバージェンスを最小化する。
  • 訓練中に知識蒸留を適用し、生徒モデルが教師のソフトラベル分布を模倣するように学習させる。
  • 標準的なASRと同一の訓練目的を用いるが、教師の出力と一致させるために蒸留損失を追加する。
  • 正解ラベルに対する交差エントロピー損失と、教師からのKLダイバージェンス損失の両方を組み合わせて、生徒モデルを最適化する。

実験結果

リサーチクエスチョン

  • RQ1近距離教師モデルからの知識蒸留は、遠距離ASRの性能向上に寄与するか?
  • RQ2非並列データと比較して、並列の近距離および遠距離データを用いることで、蒸留の効果が向上するか?
  • RQ3蒸留は、遠距離音声認識における語誤り率(WER)をどの程度低減できるか?
  • RQ4同じ遠距離データで学習された両モデルを比較した場合、蒸留は従来の訓練法よりも優れているか?
  • RQ5教師モデルのソフトラベルを用いることで、騒音や混浊環境下での生徒モデルの一般化性能にどのような影響があるか?

主な発見

  • 最良の生徒モデルは、AMIコーパスにおいて従来の訓練法を用いたベースラインモデルと比較して、語誤り率(WER)を4.7%絶対的に低減した。
  • 並列データを用いた知識蒸留により、生徒モデルの遠距離環境下での耐障害性が著しく向上した。
  • 高品質な近距離教師モデルから、遠距離生徒モデルへ知識が効果的に転送された。
  • 生徒モデルと教師モデルの出力分布間のKLダイバージェンス損失が、一般化性能の向上に重要な要因であった。
  • 並列データの使用により、教師と生徒モデルが同一の発話内容で一致できるようになり、より正確な蒸留が可能になった。
  • 結果として、追加の遠距離データを必要とせずに、並列データを用いた蒸留が遠距離ASRの性能向上に極めて効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。