[논문 리뷰] AdaLTM: Adaptive Layer-wise Task Vector Merging for Categorical Speech Emotion Recognition with ASR Knowledge Integration
AdaLTM은 적응형 계층별로 태스크 벡터를 융합하여 frozen WavLM 백본에 도메인 내 ASR 지식을 주입함으로써 그래디언트 충돌과 도메인 불일치를 완화하고 MSP-Podcast에서 UAR을 상태-유사 수준으로 달성하며 효율적으로 적응합니다.
Integrating Automatic Speech Recognition (ASR) into Speech Emotion Recognition (SER) enhances modeling by providing linguistic context. However, conventional feature fusion faces performance bottlenecks, and multi-task learning often suffers from optimization conflicts. While task vectors and model merging have addressed such conflicts in NLP and CV, their potential in speech tasks remains largely unexplored. In this work, we propose an Adaptive Layer-wise Task Vector Merging (AdaLTM) framework based on WavLM-Large. Instead of joint optimization, we extract task vectors from in-domain ASR and SER models fine-tuned on emotion datasets. These vectors are integrated into a frozen base model using layer-wise learnable coefficients. This strategy enables depth-aware balancing of linguistic and paralinguistic knowledge across transformer layers without gradient interference. Experiments on the MSP-Podcast demonstrate that the proposed approach effectively mitigates conflicts between ASR and SER.
연구 동기 및 목표
- ASR 지식을 SER에 통합하여 언어적 맥락을 활용하는 동시에 공동 학습의 최적화 충돌을 피하려는 동기를 제시합니다.
- 역할 가중치 공간에서 계층별 태스크 벡터 융합 프레임워크를 제안하여 ASR과 SER 정보를 그래디언트 간섭 없이 융합합니다.
- 도메인 내 ASR 지식이 MSP-Podcast SER의 정합성을 도메인 외 소스보다 우수하게 제공함을 보입니다.
제안 방법
- MSP-Podcast에 미세조정된 도메인 내 ASR 및 SER 모델에서 태스크 벡터를 추출합니다 (ΔW_ASR, ΔW_SER).
- 이 벡터들을 고정된 WavLM-Large 백본에 계층별 학습 가능한 계수 λ^(l)로 융합하여 θ_merged^(l) = θ_base^(l) + λ_ASR^(l)ΔW_ASR^(l) + λ_SER^(l)ΔW_SER^(l)로 형성합니다.
- 교란망각(catastrophic forgetting)을 피하기 위해 병합 계수 λ^(l), 계층 표현을 결합하는 계층별 특징 가중치 α_l, SER 예측 헤드만 학습합니다.
- 최종 SER 특징을 모든 트랜스포머 계층의 가중합 H_out = Σ_l α_l H^(l)으로 표현하고, 이 단계에서 베이스와 태스크 벡터를 고정합니다.
실험 결과
연구 질문
- RQ1도메인 내 ASR 지식을 그래디언트 기반 다중 작업 최적화 없이 SER에 효과적으로 통합할 수 있는가?
- RQ2계층별 융합이 ASR-강화 SER에 대해 전역 융합보다 깊이-의식적 이점을 제공하는가?
- RQ3도메인 일관성(도메인 내 대 도메인 외 ASR)이 MSP-Podcast의 태스크 벡터 융합 성능에 어떤 영향을 미치는가?
- RQ4다중 태스크 벡터(ASR과 SER)와 단일 벡터 간의 차이가 SER 성능에 미치는 영향은 무엇인가?
주요 결과
- 적응형 계층별 융합을 사용한 AdaLTM은 MSP-Podcast에서 Unweighted Average Recall(UAR) 38.94%를 달성하고 Macro-F1 35.20%를 기록합니다.
- 도메인 내 ASR 태스크 벡터가 도메인 외 파트너보다 우수한 성능을 보였으며, 지식 융합의 도메인 일관성의 중요성을 확인합니다.
- 이중 벡터 융합(ASR + SER)은 단일 벡터 구성보다 더 나은 성능을 보여 언어적 및 비언어적 단서 간의 시너지 효과를 보여줍니다.
- 계층별 융합은 고정 λ의 정적 글로벌이나 모든 층에 대해 하나의 λ를 쓰는 적응형 글로벌 전략보다 우수하며 깊이-의식적 통합의 이점을 확인합니다.
- 완전하게 학습 가능한 다중 작업 학습 기준선과 비교할 때 AdaLTM은 매개변수의 1% 미만만 업데이트하면서 UAR를 8포인트 이상 향상시키며 계산 효율성을 강조합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.