Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Speaker Height and age estimation using Attention Mechanism with LSTM-RNN

Manav Kaushik, Van Tung Pham|arXiv (Cornell University)|Jan 13, 2021
Human Pose and Action Recognition被引用数 6
ひとこと要約

本稿では、LSTM-RNNと統合された新規のクロスアテンションメカニズムを用いて、音声特徴の長期的依存関係を捉えるエンドツーエンドのスプーカー身長および年齢推定モデルを提案する。時間フレームとエンコーダー単位の両方に同時に注目することで、TIMITデータセット上で身長推定のRMSEが男性で6.92cm、女性で6.34cm、年齢推定のRMSEが男性で7.85年、女性で8.75年という最先端の性能を達成した。また、推定において最も情報量が多いのは母音の音素であることが明らかになった。

ABSTRACT

Automatic height and age estimation of speakers using acoustic features is widely used for the purpose of human-computer interaction, forensics, etc. In this work, we propose a novel approach of using attention mechanism to build an end-to-end architecture for height and age estimation. The attention mechanism is combined with Long Short-Term Memory(LSTM) encoder which is able to capture long-term dependencies in the input acoustic features. We modify the conventionally used Attention -- which calculates context vectors the sum of attention only across timeframes -- by introducing a modified context vector which takes into account total attention across encoder units as well, giving us a new cross-attention mechanism. Apart from this, we also investigate a multi-task learning approach for jointly estimating speaker height and age. We train and test our model on the TIMIT corpus. Our model outperforms several approaches in the literature. We achieve a root mean square error (RMSE) of 6.92cm and6.34cm for male and female heights respectively and RMSE of 7.85years and 8.75years for male and females ages respectively. By tracking the attention weights allocated to different phones, we find that Vowel phones are most important whistlestop phones are least important for the estimation task.

研究の動機と目的

  • 音声特徴を用いて、スプーカー身長と年齢を同時に推定するエンドツーエンドのディープラーニングフレームワークの開発。
  • 時間フレームとエンコーダー隠れユニットの両方に注目する新規のクロスアテンションメカニズムを導入することで、性能の向上を図る。
  • マルチタスク学習と性別を特徴量として用いることの推定精度への影響を調査する。
  • アテンション重みを通じて、どの音声単位がスプーカーの身体的パラメータ推定において最も予測に寄与するかを分析する。

提案手法

  • モデルは、生の音声特徴からの長期的依存関係を抽出するため、一方向LSTMエンコーダーを用いる。
  • 新規のクロスアテンションメカニズムにより、時間フレームに沿った注目とエンコーダー隠れユニットに沿った注目の両方で、2つのコンテキストベクトルを計算する。
  • 最終的なコンテキストベクトルは、2つのコンテキストベクトルを連結して変換することで得られ、スプーカーの特徴をよりよく表現する。
  • モデルは、身長と年齢の両方を同時に予測するマルチタスク学習を採用し、タスク間で表現学習を共有する。
  • 性別は、推定性能の向上を図るため、2値の入力特徴として組み込む。
  • ドロップアウト(20%)をLSTM層および全結合層に適用し、過学習を防ぐためにAdam最適化手法でネットワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1時間フレームとエンコーダー隠れユニットの両方に注目するクロスアテンションメカニズムは、従来のアテンションと比較して、スプーカー身長および年齢推定性能を向上させるか?
  • RQ2身長と年齢推定のためのマルチタスク学習は、単一タスク学習と比較してモデル性能にどのように影響するか?
  • RQ3性別情報を特徴量として組み込むことで、身長および年齢予測の精度が向上するか?
  • RQ4アテンション重みから明らかになるように、どの音声単位(例:母音、停止音など)がスプーカー身長および年齢の予測において最も予測に寄与するか?

主な発見

  • 提案されたクロスアテンションメカニズムは、従来のアテンションおよび最後の隠れ状態ベースラインを上回り、すべての設定で最小のRMSEを達成した。
  • TIMITテストセットにおいて、男性の身長推定でRMSEが6.92cm、女性で6.34cmを達成した。
  • 年齢推定においては、RMSEが男性で7.85年、女性で8.75年であり、複数の先行研究を上回った。
  • アテンション解析により、母音の音素が最も高いアテンション重みを示しており、声帯長およびスプーカー特徴との強い相関が示唆された。
  • 停止音や特定の摩擦音の音素は、最も低いアテンション重みを示しており、おそらく声門部の声帯にほとんど関与していないためである。
  • 性別を2値特徴として組み込むことで、すべての指標で性能が一貫して向上し、推定タスクにおいてその重要性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。