[論文レビュー] Speech-based Age and Gender Prediction with Transformers
この論文では、整備済みデータセット上でファインチューニングされたwav2vec 2.0トランスフォーマーを用いた音声ベースの年齢および性別予測システムを提案しており、年齢予測では7.1–10.8 MAE、性別予測では≥91.1%の精度を達成した。従来の手作業で特徴量を設計したモデルと比較して、年齢分類で9%、性別分類で4%のUAR向上を達成し、再現可能性を確保するため、最良のモデルとデータ分割を公開した。
We report on the curation of several publicly available datasets for age and gender prediction. Furthermore, we present experiments to predict age and gender with models based on a pre-trained wav2vec 2.0. Depending on the dataset, we achieve an MAE between 7.1 years and 10.8 years for age, and at least 91.1% ACC for gender (female, male, child). Compared to a modelling approach built on handcrafted features, our proposed system shows an improvement of 9% UAR for age and 4% UAR for gender. To make our findings reproducible, we release the best performing model to the community as well as the sample lists of the data splits.
研究の動機と目的
- 年齢および性別予測のための標準化され、公開可能なデータセットの不足に対処するため、訓練/開発/テストの分割を整備し、公開すること。
- 従来の手作業で特徴量を設計するアプローチと比較して、自己教師あり事前学習済みトランスフォーマーモデル(wav2vec 2.0)を用いて音声ベースの年齢および性別予測の性能を向上させること。
- ドメイン(インドメイン対クロスコーパス)、モデルアーキテクチャ(マルチヘッド対シングルヘッド)、および深さ(トランスフォーマーレイヤー数)におけるモデルの一般化性能を調査すること。
- 将来的な音声ベースの年齢および性別推定研究のための再現可能でオープンソースのベースラインモデルおよびデータ分割を提供すること。
提案手法
- aGender、CommonVoice、VoxCeleb2、Timitの4つの公開済みデータセットを、年齢および性別ラベルを整備・標準化した後、事前学習済みのwav2vec 2.0モデルをファインチューニングした。
- 年齢(回帰)と性別(分類)のための別々のヘッドを備えた共有エンコーダーを有するマルチタスク学習設定を採用し、同時に予測を可能にした。
- シングルヘッドおよびマルチヘッドアーキテクチャを評価し、インドメインおよびクロスコーパス設定での性能を比較した。
- トランスフォーマーレイヤー数(1から24まで)を体系的に変化させ、精度と推論速度の最適なトレードオフを特定した。
- 2010年パラリンガイスティックチャレンジのベースラインと比較するため、年齢ラベルを離散クラス(子供、若年層、成人、高齢者)にマッピングした。
- 再現可能性を確保するため、GitHubリポジトリを通じて最良のパフォーマンスを示したモデルとデータ分割をコミュニティに公開した。

実験結果
リサーチクエスチョン
- RQ1ファインチューニングされたwav2vec 2.0トランスフォーマーモデルは、従来の手作業で特徴量を設計したシステムと比較して、年齢および性別予測においてどのように性能を発揮するか?
- RQ2精度と推論効率の両立を考慮した場合、年齢および性別予測に最適なトランスフォーマーレイヤー数は何か?
- RQ3異なるデータセットにおいて、インドメイン設定とクロスコーパス設定の両方でモデルの性能はどのように変化するか?
- RQ4感情を含む音声は、中立的な音声データで学習したモデルの性能にどの程度悪影響を及えるか?
- RQ5別々のモデルと比較して、統合されたモデルが年齢と性別を同時に予測する際に、より効果的であるか、また、タスク固有のベースラインと比較してどのように差がつくか?
主な発見
- 提案されたwav2vec 2.0ベースのモデルは、異なるデータセットで年齢予測の平均絶対誤差(MAE)が7.1~10.8歳を達成し、2010年パラリンガイスティックチャレンジのベースラインを顕著に上回った。
- 性別分類(女性、男性、子供)では、少なくとも91.1%の精度を達成し、ベルリンの感情的音声データベースからの中立的サンプルでは96.04%のUARを達成した。
- 手作業で特徴量を設計したベースラインシステムと比較して、年齢分類で9ポイント、性別分類で4ポイントのUAR向上を達成した。
- 6つのトランスフォーマーレイヤーを用いることで、性能と推論速度の最適なトレードオフが達成され、パrameter数を3.5倍、推論時間を3倍に削減した。
- 感情を含む音声では性能が低下し、MAEが8.35(中立的サンプルでは5.94)に上昇した。これは、感情的なプロソディーに感受性であることを示している。
- aGender、CommonVoice、VoxCeleb2、Timitの4つのデータセットすべてで学習したモデルは、個々のデータセットでの学習モデルよりもわずかだが一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。