[論文レビュー] A Novel Fusion of Attention and Sequence to Sequence Autoencoders to Predict Sleepiness From Speech
本論文は、音声からの連続的眠気予測を目的とした、注意メカニズムを組み込んだseq2seq自己符号化器と従来のseq2seq自己符号化器の新規融合手法を提案する。メルスペクトログ램の抽出、両モデルの学習、および学習済み特徴量の統合により、テストデータでSpearman相関係数0.367を達成し、個々のモデルやベースラインを上回る性能を示した。
Motivated by the attention mechanism of the human visual system and recent developments in the field of machine translation, we introduce our attention-based and recurrent sequence to sequence autoencoders for fully unsupervised representation learning from audio files. In particular, we test the efficacy of our novel approach on the task of speech-based sleepiness recognition. We evaluate the learnt representations from both autoencoders, and then conduct an early fusion to ascertain possible complementarity between them. In our frameworks, we first extract Mel-spectrograms from raw audio files. Second, we train recurrent autoencoders on these spectrograms which are considered as time-dependent frequency vectors. Afterwards, we extract the activations of specific fully connected layers of the autoencoders which represent the learnt features of spectrograms for the corresponding audio instances. Finally, we train support vector regressors on these representations to obtain the predictions. On the development partition of the data, we achieve Spearman's correlation coefficients of .324, .283, and .320 with the targets on the Karolinska Sleepiness Scale by utilising attention and non-attention autoencoders, and the fusion of both autoencoders' representations, respectively. In the same order, we achieve .311, .359, and .367 Spearman's correlation coefficients on the test data, indicating the suitability of our proposed fusion strategy.
研究の動機と目的
- 音声信号を用いた連続的眠気認識のための無教師表現学習フレームワークの構築を目的とする。
- 注目メカニズムが音声ベースの眠気予測に向けたseq2seq自己符号化器をどのように改善するかを調査することを目的とする。
- 注目型と非注目型自己符号化器が学習する表現の相補性を、早期統合によって評価することを目的とする。
- 2019年INTERSPEECH ComParEデータセットにおいて、熟練者が設計した特徴量とチャレンジベースラインとを比較して、本手法の有効性を検証することを目的とする。
- 手動による特徴工学を一切行わず、エンドツーエンドで完全に無教師な学習により眠気検出の有効性を示すこと。
提案手法
- ハミング窓を用い、50%のオーバーラップで16 kHzの生の音声からメルスペクトログラムを抽出し、対数スケールのメルバンドを用いる。
- GRUまたはLSTMセルを用いた、注目メカニズムを備えたseq2seq自己符号化器と、そうでない2つの再帰的seq2seq自己符号化器を学習する。
- 注目型自己符号化器では、エンコーダーの最終全結合層とデコーダーの最終隠れ状態を、学習済み表現として用いる。
- 非注目型自己符号化器では、エンコーダーの全結合層とデコーダーの最終隠れ状態から表現を抽出する。
- 両自己符号化器の表現を事前に連結することで、早期特徴統合を実施し、その後サポートベクターレグレッサー(SVR)を訓練する。
- 開発セット上でSVRの複雑さを最適化し、テストデータ上でSpearman順位相関係数を用いてKSSスコアと比較して評価する。
実験結果
リサーチクエスチョン
- RQ1注目メカニズムは、眠気検出における無教師音声表現学習のseq2seq自己符号化器を改善するか?
- RQ2注目型と非注目型自己符号化器が学習する表現は、早期統合によって相補的であるか?
- RQ3提案手法の性能は、手作業で設計された特徴量とチャレンジベースラインと比べて、連続的眠気予測においてどのように差がつくか?
- RQ4眠気認識に最適な自己符号化器ハイパーパrameterの設定(例:窓サイズ、セルタイプ、次元数)は何か?
- RQ5両自己符号化器タイプの表現を早期に統合することで、個々のモデルよりも高い性能が得られるか?
主な発見
- 注目型自己符号化器は、開発セットでSpearman相関係数0.324、テストセットで0.311を達成した。
- 非注目型自己符号化器は、開発セットで0.286、テストセットで0.338を記録し、低性能ながらも強い汎化性能を示した。
- 両自己符号化器の表現を早期に統合した結果、最も高い性能を記録し、開発セットで0.320、テストセットで0.367の相関係数を達成した。
- 最良の統合設定では、複雑さ$10^{-1}$のSVRを用い、テスト相関係数0.367を達成した。これは開発セットではチャレンジ優勝者(0.383)を下回ったが、テストセットではわずかに下回った。
- 注目型モデルの最良性能は、LSTMセル、512次元特徴量、25エポックの設定で得られ、開発セットで0.324、テストセットで0.311の相関係数を記録した。
- 統合戦略は明確な相補性を示しており、統合された表現は両方の個別モデルを上回った。これにより、多様な学習済み表現の価値が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。