Skip to main content
QUICK REVIEW

[論文レビュー] AdaLTM: Adaptive Layer-wise Task Vector Merging for Categorical Speech Emotion Recognition with ASR Knowledge Integration

Chia-Yu Lee, Huang-Cheng Chou|arXiv (Cornell University)|Mar 26, 2026
Emotion and Mood Recognition被引用数 0
ひとこと要約

AdaLTMは、タスクベクトルをレイヤー-wiseで適応的に統合することで、ASR知識をSERに統合し、勾配干渉を回避し、ドメイン不整合を緩和する。 MSP-Podcastにおいて効率的な適応とともに、UARが高水準に達成される。

ABSTRACT

Integrating Automatic Speech Recognition (ASR) into Speech Emotion Recognition (SER) enhances modeling by providing linguistic context. However, conventional feature fusion faces performance bottlenecks, and multi-task learning often suffers from optimization conflicts. While task vectors and model merging have addressed such conflicts in NLP and CV, their potential in speech tasks remains largely unexplored. In this work, we propose an Adaptive Layer-wise Task Vector Merging (AdaLTM) framework based on WavLM-Large. Instead of joint optimization, we extract task vectors from in-domain ASR and SER models fine-tuned on emotion datasets. These vectors are integrated into a frozen base model using layer-wise learnable coefficients. This strategy enables depth-aware balancing of linguistic and paralinguistic knowledge across transformer layers without gradient interference. Experiments on the MSP-Podcast demonstrate that the proposed approach effectively mitigates conflicts between ASR and SER.

研究の動機と目的

  • SERに言語的文脈を活用するためASR知識を統合する動機付け。
  • 勾配干渉を回避したままASRとSER情報を融合する重み空間・レイヤー-wiseのタスクベクトル統合フレームワークを提案。
  • イン-domain ASR知識がMSP-PodcastのSERにおいて、アウトオブドメインソースより優れた整合性を提供することを示す。

提案手法

  • MSP-Podcastでファインチューニングされたイン-domain ASRおよびSERモデルからのタスクベクトルを抽出する(ΔW_ASR, ΔW_SER)。
  • レイヤー-wise学習可能係数λ^(l)を用いて凍結済みWavLM-Largeバックボーンにこれらのベクトルを統合し、θ_merged^(l) = θ_base^(l) + λ_ASR^(l)ΔW_ASR^(l) + λ_SER^(l)ΔW_SER^(l)を形成。
  • 致命的忘却を避けるため、統合係数λ^(l)、レイヤー表現を結合するレイヤー-wise特徴重みα_l、SER予測ヘッドのみを訓練。
  • 最終SER特徴を全トランスフォーマ層からの重み付き和H_out = Σ_l α_l H^(l)として表現し、この段階ではベースとタスクベクトルを固定。

実験結果

リサーチクエスチョン

  • RQ1イン-domain ASR知識を多タスク最適化の勾配ベースの訓練なしにSERへ効果的に統合できるか。
  • RQ2レイヤー-wise統合はASR強化SERにおいてグローバル統合より深さごとの利点を提供するか。
  • RQ3ドメイン的一貫性(イン-domain対アウトオブ-domainASR)はMSP-Podcastのタスクベクトル統合性能にどう影響するか。
  • RQ4デュアルタスクベクトル(ASRとSER)と単一ベクトルの使用はSER性能にどのような影響を与えるか。

主な発見

  • 適応的レイヤー-wise統合を用いると、AdaLTMはMSP-PodcastでUnweighted Average Recall (UAR)を38.94%、Macro-F1を35.20%達成。
  • イン-domain ASRタスクベクトルはアウトオブドメインの対応物より優れており、知識統合のドメイン一貫性の重要性を確認。
  • デュアルベクタ統合(ASR+SER)は単一ベクトル設定より良い性能を示し、言語的手掛かりとパラリンギュスティック手掛かりの相乗効果を示す。
  • レイヤー-wise統合は静的グローバル(λ=(0.5))や適応グローバル(一律λ)より優れており、深さを意識した統合の利点を確認。
  • 完全訓練可能なマルチタスク学習ベースラインと比較して、AdaLTMはパラメータの更新量が1%未満でUARを8ポイント以上向上させ、計算効率の高さを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。