Skip to main content
QUICK REVIEW

[논문 리뷰] AcoustEmo: Open-Vocabulary Emotion Reasoning via Utterance-Aware Acoustic Q-Former

Liyun Zhang, Xuanmeng Sha|arXiv (Cornell University)|2026. 03. 21.
Emotion and Mood Recognition인용 수 0
한 줄 요약

AcoustEmo는 세그먼트 수준의 오디오 토큰을 추출하기 위해 타임스탬프 동기화된 슬라이딩 윈도우를 갖춘 발화-인식 음향 Q-Former를 도입하여 MLLMs에서 미세한 어휘 확장의 감정 추론을 가능하게 하고 EMER-Fine에서 베이스라인보다 우수하게 성능을 보인다.

ABSTRACT

Multimodal Large Language Models (MLLMs) excel in Open-Vocabulary (OV) emotion recognition but often neglect fine-grained acoustic modeling. Existing methods typically use global audio encoders, failing to capture subtle, local temporal dynamics like micro-prosody and intonation shifts within individual utterances. To address this, we propose AcoustEmo, a time-sensitive MLLM featuring a novel Utterance-Aware Acoustic Q-Former. Our approach utilizes a timestamp-synchronized sliding window to dynamically extract segment-level audio tokens instead of coarse global representations. This enables the model to explicitly trace the temporal evolution of subtle acoustic clues and capture deep contextual dependencies in dialogues. Experiments on the Explainable Multimodal Emotion Recognition (EMER) task show that AcoustEmo significantly enhances complex emotion reasoning, outperforming baselines while maintaining robust contextual accuracy.

연구 동기 및 목표

  • globally-오디오 인코더가 미세한 프로소디 및 로컬 시계열 dynamics를 놓치는 문제를 해결한다.
  • 발화-인식 음향 Q-Former를 개발하여 전사 타임스탬프와 정렬된 세그먼트 수준 토큰을 추출한다.
  • Fine-grained 음향 토큰을 시각적 및 텍스트 모달리티와 통합하여 MLLMs에서 오픈-보캐뷸러리 감정 추론을 가능하게 한다.
  • EMER 태스크에서 최첨단 baselines 대비 개선을 입증한다.

제안 방법

  • 전역 오디오 인코더를 발화-인식 음향 Q-Former로 교체하여 각 발화의 음향 세그먼트를 처리한다.
  • 프레임 수준의 오디오 특징에서 발화 i에 대해 타임스탬프-동기화된 슬라이딩 윈드를 사용하여 F_A^i를 추출한다.
  • 교차 주의에서 학습 가능한 질의 Q를 사용하여 각 발화의 미세 프로소딩 디테일을 추출한다.
  • 전역 음향 토큰과 발화별 토큰을 합쳐 T_A를 구성하고 이를 시각 토큰 T_V 및 지시 토큰 T_Lq와 연결하여 LLM 추론에 사용한다.
  • 비주얼/음향 인코더를 고정하고 LoRA를 활용해 LLaMA-2 백본으로 미세조정한다.

실험 결과

연구 질문

  • RQ1발화 수준의 타임스탬프 정렬된 음향 표현이 MLLMs의 오픈-보캐뷸러리 감정 추론을 개선할 수 있는가?
  • RQ2 lokal 음향 dynamics(마이크로-프로소디)가 감정 추론에 글로벌 오디오 풀링보다 더 큰 기여를 하는가?
  • RQ3타임스탬프 동기화가 EMER 태스크에서 음향 신호와 텍스트 발화 간 정렬에 어떤 영향을 미치는가?

주요 결과

  • AcoustEmo는 EMER-Fine에서 Avg 점수 67.55, 정확도 65.40, 재현율 70.15를 달성했다.
  • AcoustEmo는 AffectGPT 및 MicroEmo를 포함한 다수의 베이스라인보다 우수하며 설정에 따라 여러 비디오 중심 및 오디오 중심 모델에 근접하거나 능가한다.
  • ablation 연구에서 Utterance-Aware Acoustic Q-Former를 제거하면 Avg가 61.20으로 떨어져 로컬 음향 dynamics의 중요성을 강조한다.
  • 타임스탬프-동기화 윈드를 고정된 2s 윈드로 대체하면 Avg가 62.85로 하락하여 발화 정렬의 필요성을 보여준다.
  • Global Acoustic Q-Former를 제거하면 Avg가 64.10으로 감소하여 글로벌 컨텍스트가 여전히 유용한 배경 정보를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.