Skip to main content
QUICK REVIEW

[論文レビュー] AcoustEmo: Open-Vocabulary Emotion Reasoning via Utterance-Aware Acoustic Q-Former

Liyun Zhang, Xuanmeng Sha|arXiv (Cornell University)|Mar 21, 2026
Emotion and Mood Recognition被引用数 0
ひとこと要約

AcoustEmoは発話を意識した音響Q-Formerとタイムスタンプ同期スライディングウィンドウを用いてセグメントレベルの音声トークンを抽出し、MLLMsにおける細粒度のオープンボキャブラリ感情推論を可能にする。EMER-Fineでベースラインを凌駕。

ABSTRACT

Multimodal Large Language Models (MLLMs) excel in Open-Vocabulary (OV) emotion recognition but often neglect fine-grained acoustic modeling. Existing methods typically use global audio encoders, failing to capture subtle, local temporal dynamics like micro-prosody and intonation shifts within individual utterances. To address this, we propose AcoustEmo, a time-sensitive MLLM featuring a novel Utterance-Aware Acoustic Q-Former. Our approach utilizes a timestamp-synchronized sliding window to dynamically extract segment-level audio tokens instead of coarse global representations. This enables the model to explicitly trace the temporal evolution of subtle acoustic clues and capture deep contextual dependencies in dialogues. Experiments on the Explainable Multimodal Emotion Recognition (EMER) task show that AcoustEmo significantly enhances complex emotion reasoning, outperforming baselines while maintaining robust contextual accuracy.

研究の動機と目的

  • 全体的な音声エンコーダが微小プロソディーや局所的テンポ動態を見逃す点の限界を解消する。
  • 発話ごとに整列したセグメントレベルの音響トークンを抽出する発話認識対応の音響Q-Formerを開発する。
  • 細粒度の音響トークンを視覚・文本 modalityと統合し、MLLMsにおけるオープンボキャブラリ感情推論を実現する。
  • EMERタスクで最先端ベースラインを上回る改善を示す。

提案手法

  • グローバル音声エンコーダを発話認識対応の音響Q-Formerに置換し、発話ごとの音響セグメントを処理する。
  • フレームレベルの音声特徴から各発話iに対してタイムスタンプ同期スライディングウィンドウを用いてF_A^iを抽出する。
  • クロスアテンションで学習可能なクエリQを用いて各発話の局所的なミクロプロソディ詳細を抽出する。
  • グローバル音響トークンを発話固有トークンと組み合わせてT_Aとし、視覚トークンT_Vおよび指示トークンT_Lqと結合してLLM推論を行う。
  • 視覚エンコーダ/音響エンコーダを凍結しつつ、LLaMA-2ボトムアップでLoRAを用いて微調整する。

実験結果

リサーチクエスチョン

  • RQ1発話レベルでタイムスタンプに整列した音響表現は、MLLMsにおけるオープンボキャブラリ感情推論を改善するか。
  • RQ2局所的な音響動態(ミクロプロソディ)は感情推論においてグローバル音声プーリングより寄与度が大きいか。
  • RQ3EMERタスクにおける音響手がかりと文本発話の整列に、タイムスタンプ同期がどう影響するか。

主な発見

  • AcoustEmoはEMER-FineでAvgスコア67.55、Accuracy 65.40、Recall 70.15を達成。
  • AcoustEmoはAffectGPTやMicroEmoを含む多くのベースラインを上回り、設定に応じてビデオ中心・音声中心モデルのいくつかを上回るまたは近接。
  • アブレーションによりUtterance-Aware Acoustic Q-Formerを除去するとAvgが61.20に低下し、局所的音響動態の重要性を示唆。
  • タイムスタンプ同期ウィンドウを固定の2sウィンドウに置換するとAvgが62.85に低下し、発話整列の正確さが必要であることを示す。
  • Global Acoustic Q-Formerを除去するとAvgが64.10に低下し、グローバル文脈が有用な背景情報を提供することを示唆。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。