Skip to main content
QUICK REVIEW

[論文レビュー] Joint gender and age estimation based on speech signals using x-vectors and transfer learning

Damian Kwaśny, Daria Hemmerling|arXiv (Cornell University)|Dec 2, 2020
Speech Recognition and Synthesis参考文献 17被引用数 9
ひとこと要約

本稿では、x-ベクトルと転移学習を用いた統合的性別・年齢推定システムを提案する。標準のTDNNに代えて、より深いQuartzNetアーキテクチャを採用している。VoxCelebおよびCommon Voiceデータセットでの事前学習により、性能が著しく向上し、TIMITでSOTA(最先端)の結果を達成した。平均絶対誤差(MAE)は男性で5.12年、女性で5.29年であり、性別分類の正確度は99.6%に達した。

ABSTRACT

In this paper we extend the x-vector framework for the task of speaker's age estimation and gender classification. In particular, we replace the baseline multilayer-TDNN architecture with QuartzNet, a convolutional architecture that has gained success in the field of speech recognition. We further propose a two-staged transfer learning scheme, utilizing large scale speech datasets: VoxCeleb and Common Voice, and usage of multitask learning to allow for joint age estimation and gender classification with a single system. We train and evaluate the performance on the TIMIT dataset. The proposed transfer learning scheme yields consecutive performance improvements in terms of both age estimation error and gender classification accuracy and the best performing system achieves new state-of-the-art results on the task of age estimation on the TIMIT TEST dataset with MAE of 5.12 and 5.29 years and RMSE of 7.24 and 8.12 years for male and female speakers respectively while maintaining a gender classification accuracy of 99.6%.

研究の動機と目的

  • 音声信号を用いた深層学習による統合的話者年齢推定と性別分類の精度向上を目的とする。
  • より良い特徴表現を得るため、標準のTDNNベースのx-ベクトルアーキテクチャを、より深いQuartzNetアーキテクチャに置き換えること。
  • 大規模な音声データセット(VoxCelebおよびCommon Voice)を用いた転移学習の有効性を、低リソースな年齢・性別推定に適用して検証すること。
  • 両方のタスクにおいて、TIMITデータセットで最先端の性能を達成すること。
  • 年齢回帰と性別分類のマルチタスク学習が、モデルの汎化性能と性能向上に寄与することを示すこと。

提案手法

  • システムは、従来のTDNNアーキテクチャの代わりに、QuartzNetベースのニューラルネットワークをx-ベクトル埋め込み器として使用する。
  • 埋め込み器は、畳み込みブロック、残差接続、統計プーリング(平均および標準偏差)を用いて、長さが可変な音声発話から固定長の埋め込みを抽出する。
  • 2段階の転移学習スキームを適用する:まずVoxCelebで話者認識のための事前学習を行い、次にTIMITで年齢回帰と性別分類の両方を同時に最適化するためのファインチューニングを行う。
  • さらにCommon Voiceでの事前学習を追加することで、特にMFCC特徴量の性能が向上する。
  • フロントエンドヘッドは、年齢回帰用と性別分類用の2つの全結合ブランチから構成され、マルチタスク学習により同時に学習される。
  • モデルは、NVIDIA NeMoフレームワークを用いて、TIMITデータセットの標準的な学習・テスト分割を用いて訓練および評価される。

実験結果

リサーチクエスチョン

  • RQ1より深いQuartzNetベースのx-ベクトルアーキテクチャは、標準のTDNNベースのx-ベクトルに比べ、統合的年齢・性別推定で優れた性能を示すか?
  • RQ2VoxCelebやCommon Voiceといった大規模な音声データセットからの転移学習は、TIMITにおける低リソースな年齢・性別推定の性能向上にどの程度有効か?
  • RQ3年齢回帰と性別分類の両方を同時に学習するマルチタスク学習は、単一タスクアプローチに比べて性能向上をもたらすか?
  • RQ4入力特徴量の種別(MFCC対メルスペクトログ램)が、統合推定システムの最終的性能に与える影響は何か?
  • RQ5提案された2段階の転移学習スキームは、TIMITデータセットにおける年齢推定と性別分類の両方でSOTA(最先端)の結果を達成できるか?

主な発見

  • 提案されたシステムは、TIMITテストセットにおいて、男性話者で5.12年、女性話者で5.29年の新しいSOTA(最先端)の平均絶対誤差(MAE)を達成した。
  • 平均二乗誤差(RMSE)は男性で7.24年、女性で8.12年にまで低下し、先行研究に比べ顕著な向上が見られた。
  • 性別分類の正確度は99.6%に達し、年齢と性別の両方を同時に学習しても、堅牢な性能を示した。
  • VoxCelebでの事前学習だけでもベースラインより性能が向上し、さらにCommon Voiceでの追加事前学習によりさらなる向上が得られた。
  • MFCC特徴量を用いたシステムで、2重事前学習(VoxCeleb + Common Voice)を実施した場合が最も優れた結果を示し、従来のDNNベースおよび特徴工学的アプローチを上回った。
  • QuartzNetベースの埋め込み器アーキテクチャは、年齢推定および性別分類の両タスクにおいて、標準のTDNNベースのx-ベクトルに比べ一貫して優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。