[論文レビュー] Introducing ECAPA-TDNN and Wav2Vec2.0 Embeddings to Stuttering Detection
本稿では、大規模音声データセットで事前学習されたモデルを活用して、限られたステッタリングデータを補うために、ECAPA-TDNNおよびWav2Vec2.0埋め込みを用いたステッタリング検出手法を提案する。ECAPA-TDNNのスフィア埋め込みとWav2Vec2.0の文脈的表現を統合することで、特に多層連結とスコア統合により、ベースライン比で16.74%の相対的精度向上を達成した。
The adoption of advanced deep learning (DL) architecture in stuttering detection (SD) tasks is challenging due to the limited size of the available datasets. To this end, this work introduces the application of speech embeddings extracted with pre-trained deep models trained on massive audio datasets for different tasks. In particular, we explore audio representations obtained using emphasized channel attention, propagation, and aggregation-time-delay neural network (ECAPA-TDNN) and Wav2Vec2.0 model trained on VoxCeleb and LibriSpeech datasets respectively. After extracting the embeddings, we benchmark with several traditional classifiers, such as a k-nearest neighbor, Gaussian naive Bayes, and neural network, for the stuttering detection tasks. In comparison to the standard SD system trained only on the limited SEP-28k dataset, we obtain a relative improvement of 16.74% in terms of overall accuracy over baseline. Finally, we have shown that combining two embeddings and concatenating multiple layers of Wav2Vec2.0 can further improve SD performance up to 1% and 2.64% respectively.
研究の動機と目的
- ステッタリング検出のための深層学習モデルを訓練する際の、限られた偏りのあるステッタリングデータセットの課題に対処すること。
- 特にECAPA-TDNNおよびWav2Vec2.0を含む事前学習済み音声埋め込みの、ステッタリング検出への転送可能性を調査すること。
- スコア統合および埋め込み統合によるECAPA-TDNNとWav2Vec2.0埋め込みの統合が、検出性能に与える影響を調査すること。
- Wav2Vec2.0の異なる隠れ層の寄与とその連結が、不順応な発話パターンを捉えるのに与える影響を分析すること。
- 事前学習モデルからの文脈的表現とスフィアレベル表現が、まれなステッタリングタイプの検出を顕著に向上させることを示すこと。
提案手法
- VoxCelebでスフィア認識のため微調整されたECAPA-TDNNの全結合層から192次元のスフィア埋め込みを抽出する。
- LibriSpeechで事前学習されたWav2Vec2.0モデルの複数層(L1, L7, L11)から、ローカルエンコーダーと文脈ブロックを用いて文脈的発話表現を取得する。
- 下流分類のためのクラス分離性向上を目的として、Wav2Vec2.0埋め込みの次元削減に線形判別分析(LDA)を適用する。
- 抽出された埋め込み上で、k-近傍法(KNN)、ナイーブベイズ(NBC)、多層パーセプトロン(MLP)の複数の分類器を訓練および評価する。
- 最適化された重みパrameter α=0.9 を用いて、ECAPA-TDNNおよびWav2Vec2.0モデルの予測確率を統合するスコア統合を実装する。
- ECAPA-TDNNとWav2Vec2.0埋め込みを連結して分類器に入力することで、補完的情報を活用する埋め込み統合を実施する。
実験結果
リサーチクエスチョン
- RQ1ECAPA-TDNNおよびWav2Vec2.0の事前学習済み埋め込みは、SEP-28kのような小規模データセットでもステッタリング検出性能を向上させることができるか?
- RQ2Wav2Vec2.0の層選択(L1, L7, L11)が検出性能に与える影響は何か?また、複数層の連結はさらなる性能向上をもたらすか?
- RQ3ECAPA-TDNNとWav2Vec2.0埋め込みのスコア統合は、個々のモデルに比べて検出精度をどの程度向上させるか?
- RQ4埋め込みレベルの統合によりECAPA-TDNNとWav2Vec2.0埋め込みを統合すると、スコア統合に比べてより高い性能が得られるか?
- RQ5異なるステッタリングタイプ(ブロック、繰り返し、延長、挿入語、フラuent)における埋め込みの性能は?特にマイノリティクラスでの性能は?
主な発見
- Wav2Vec2.0埋め込みをニューラルネットワーク分類器に適用することで、SEP-28kでのみ学習されたベースラインシステムに比べ、全体的な精度が16.74%相対的に向上した。
- スコア統合によるECAPA-TDNNとWav2Vec2.0埋め込みの統合により、ニューラルネットワークを用いた全体精度が67.26%に向上し、個々のモデルを上回った。
- Wav2Vec2.0のL1, L7, L11層の表現を連結することで、ベースラインに比べ2.64%の性能向上が達成され、特にブロックや延長といったマイノリティクラスの認識が向上した。
- Wav2Vec2.0埋め込みにLDAを適用することで、全体で7.28%の性能向上が得られ、ブロック(49.88%)と延長(14.77%)で最も大きな向上が見られた。
- ECAPA-TDNN埋め込みは、Wav2Vec2.0単体に比べ、フラuent発話の検出をKNNで5.34%、NBCで1.13%、NNで5.13%向上させ、強力なスフィアアイデンティティ情報を持つことが示された。
- ECAPA-TDNNとWav2Vec2.0埋め込みの埋め込み統合により、ニューラルネットワークを用いた全体精度が68.35%に達し、最高の性能を示した。ブロック(23.86%)と挿入語(69.54%)では、ベースラインに比べ顕著な向上が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。