Skip to main content
QUICK REVIEW

[论文解读] Multimodal Affective Analysis Using Hierarchical Attention Strategy with Word-Level Alignment

Yue Gu, Kangning Yang|arXiv (Cornell University)|May 22, 2018
Sentiment Analysis and Opinion Mining参考文献 25被引用 10
一句话总结

本文提出了一种分层多模态注意力网络,通过在词级别对齐文本与音频,以提升情感和情绪分类性能。通过采用水平、垂直和微调策略融合模态特异性特征与注意力权重,该模型在MOSI、IEMOCAP、YouTube和EmotiW数据集上均取得了最先进性能,同时实现了对两种模态的可解释性注意力可视化。

ABSTRACT

Multimodal affective computing, learning to recognize and interpret human affects and subjective information from multiple data sources, is still challenging because: (i) it is hard to extract informative features to represent human affects from heterogeneous inputs; (ii) current fusion strategies only fuse different modalities at abstract level, ignoring time-dependent interactions between modalities. Addressing such issues, we introduce a hierarchical multimodal architecture with attention and word-level fusion to classify utter-ance-level sentiment and emotion from text and audio data. Our introduced model outperforms the state-of-the-art approaches on published datasets and we demonstrated that our model is able to visualize and interpret the synchronized attention over modalities.

研究动机与目标

  • 为解决多模态情感计算中异质性文本与音频模态在时间上的错位问题。
  • 克服现有融合方法仅在抽象或话语级别表示上操作的局限,忽略时间依赖性交互。
  • 实现语言内容与语音表达在词级别上的同步,以实现更精确的情感与情绪识别。
  • 通过注意力可视化,为模态特异性及融合表示提供可解释性。
  • 在数据质量与标注方案各异的多样化多模态数据集上,展示模型的泛化能力。

提出的方法

  • 模型使用双向门控循环单元(GRUs)从文本和音频输入中提取高层特征。
  • 应用词级别强制对齐,以实现语言内容与对应声学帧的同步。
  • 采用多层级注意力机制,计算文本词、音频帧及对齐后的词级别表示的注意力权重。
  • 提出三种融合策略——水平、垂直和微调注意力融合,以在词级别整合特征与注意力。
  • 使用基于CNN的分类器,从融合表示中分类话语级别的情感与情绪。
  • 该架构支持对模态特异性及共享注意力权重的可视化,以增强可解释性。

实验结果

研究问题

  • RQ1文本与音频在词级别对齐是否能超越话语级别融合,进一步提升多模态情感分类性能?
  • RQ2在词级别同步的情况下,模态特异性注意力机制之间如何相互作用?
  • RQ3在词级别联合注意力是否相比单模态或晚期融合方法,能带来更好的性能与可解释性?
  • RQ4该模型在数据质量与标注一致性各异的数据集上是否具有良好的泛化能力?
  • RQ5注意力可视化是否能有效揭示模型在单模态及联合模态下的决策过程?

主要发现

  • 所提模型在四个基准数据集(MOSI、IEMOCAP、YouTube和EmotiW)上均达到最先进性能。
  • 在MOSI数据集上,模型达到78.5%的准确率与0.721的F1分数,优于先前最先进方法。
  • 在IEMOCAP数据集上,模型达到74.2%的准确率与0.712的F1分数,尽管仅使用音频的模型表现优于仅使用文本的模型,仍展现出强劲性能。
  • 泛化结果表明,在YouTube数据集上(在MOSI上训练)达到66.2%的准确率与0.665的F1分数,在EmotiW数据集上(在IEMOCAP上训练)达到61.4%的准确率,表明模型在不同领域间具有良好的迁移能力。
  • 注意力可视化结果表明,共享注意力与微调注意力机制成功识别出情绪显著的词语与语音线索,例如‘hell’对应愤怒,‘you’re’对应喜悦,通过结合文本与声学强调实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。