Skip to main content
QUICK REVIEW

[論文レビュー] Learning acoustic word embeddings with phonetically associated triplet network

Hyungjun Lim, Younggwan Kim|arXiv (Cornell University)|Nov 7, 2018
Speech Recognition and Synthesis参考文献 25被引用数 4
ひとこと要約

本論文では、音声語彙埋め込みの判別性能を向上させるために、双方向LSTMアーキテクチャ内でトリプレット損失とフレームレベルの交差エントロピー損失を共同で最適化する階層的マルチタスク学習フレームワーク、発音的関連トリプレットネットワーク(PATN)を提案する。この手法は、目覚しされる語検出において、1時間あたり1.0件の誤警報における再現率で20%以上の相対的改善を達成し、ドメイン外データに対しても優れた一般化性能を示す。

ABSTRACT

Previous researches on acoustic word embeddings used in query-by-example spoken term detection have shown remarkable performance improvements when using a triplet network. However, the triplet network is trained using only a limited information about acoustic similarity between words. In this paper, we propose a novel architecture, phonetically associated triplet network (PATN), which aims at increasing discriminative power of acoustic word embeddings by utilizing phonetic information as well as word identity. The proposed model is learned to minimize a combined loss function that was made by introducing a cross entropy loss to the lower layer of LSTM-based triplet network. We observed that the proposed method performs significantly better than the baseline triplet network on a word discrimination task with the WSJ dataset resulting in over 20% relative improvement in recall rate at 1.0 false alarm per hour. Finally, we examined the generalization ability by conducting the out-of-domain test on the RM dataset.

研究の動機と目的

  • クエリ・バイ・エクサムプル音声語項検出のための音声語彙埋め込みの判別性能を向上させること。
  • トリプレットネットワークが発音情報を無視し、単に語レベルの類似性に依存するという限界を是正すること。
  • 特に目覚しされる語検出において、ドメイン外データへの一般化性能を向上させること。
  • 階層的マルチタスク学習を用いて、発音レベルの監視をトリプレットネットワークに統合すること。

提案手法

  • 共有の双方向LSTMアーキテクチャ内でトリプレット損失とフレームレベルの交差エントロピー損失を組み合わせた発音的関連トリプレットネットワーク(PATN)を提案する。
  • 連合損失関数を導入:$\mathcal{L}_{PT} = (1-\lambda)\mathcal{L}_T + \lambda\mathcal{L}_{CE}$、ここで$\lambda$は語レベル学習とフレームレベル学習の間のトレードオフを制御する。
  • 下位のLSTM層で交差エントロピー損失を適用して発音の変異をモデル化し、上位の層でトリプレット損失を用いてクラス間およびクラス内埋め込みの分離を強制する。
  • コサイン類似度計算のための最終的な音声語彙埋め込みとして、双方向LSTMの隠れ状態の連結を用いる。
  • t-SNE可視化を用いて、埋め込みのクラスタリングおよび分離性を定性的に評価する。
  • WSJデータセットで学習を行い、インドメイン(WSJ)およびドメイン外(RM)の両方のテストセットで評価する。

実験結果

リサーチクエスチョン

  • RQ1発音的および語レベルの基準を共同で学習することで、音声語彙埋め込みの判別品質が向上するか?
  • RQ2フレームレベルの発音的監視を組み込むことで、ドメイン外の目覚しされる語検出への一般化性能が向上するか?
  • RQ3提案されたPATNモデルは、標準のトリプレットネットワークと比較して、再現率および誤警報率の観点でどのように異なるか?
  • RQ4モデルサイズを増加させずに、性能向上を維持できるか?

主な発見

  • 提案されたPATNは、インドメインのWSJデータセットにおいて、1時間あたり1.0件の誤警報における再現率が0.714に達し、ベースラインのトリプレットネットワークと比較して20%以上の相対的改善を示した。
  • ドメイン外のRMデータセットでは、PATNの再現率は0.582に達し、ベースラインの0.463と比較して顕著な改善を示し、強力な一般化性能を確認した。
  • t-SNE可視化では、特に発音的に類似する語(例:'give' vs. 'get'、'have' vs. 'how')において、PATNがより分離されやすく、混同されにくい語のクラスタを生成していることが示された。
  • 2層のBLSTMと$\lambda=0.1$を用いたモデルが最良の性能を達成し、トリプレット損失と交差エントロピー損失の最適なトレードオフが実現された。
  • モデルサイズの増加なしに改善が達成されたことから、連合学習戦略の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。