[论文解读] Efficient Multimodal Transformer with Dual-Level Feature Restoration for Robust Multimodal Sentiment Analysis
本文提出 EMT-DLFR,一种新颖的多模态 Transformer 框架,通过建模全局-局部跨模态交互并采用双层次特征恢复,实现了高效且鲁棒的情感分析。在三种基准数据集上,无论在完整模态还是不完整模态设置下,均取得了最先进性能,展现出卓越的效率和对随机模态缺失的鲁棒性。
With the proliferation of user-generated online videos, Multimodal Sentiment Analysis (MSA) has attracted increasing attention recently. Despite significant progress, there are still two major challenges on the way towards robust MSA: 1) inefficiency when modeling cross-modal interactions in unaligned multimodal data; and 2) vulnerability to random modality feature missing which typically occurs in realistic settings. In this paper, we propose a generic and unified framework to address them, named Efficient Multimodal Transformer with Dual-Level Feature Restoration (EMT-DLFR). Concretely, EMT employs utterance-level representations from each modality as the global multimodal context to interact with local unimodal features and mutually promote each other. It not only avoids the quadratic scaling cost of previous local-local cross-modal interaction methods but also leads to better performance. To improve model robustness in the incomplete modality setting, on the one hand, DLFR performs low-level feature reconstruction to implicitly encourage the model to learn semantic information from incomplete data. On the other hand, it innovatively regards complete and incomplete data as two different views of one sample and utilizes siamese representation learning to explicitly attract their high-level representations. Comprehensive experiments on three popular datasets demonstrate that our method achieves superior performance in both complete and incomplete modality settings.
研究动机与目标
- 为解决现有方法在非对齐多模态序列上建模跨模态交互时效率低下的问题。
- 提升模型在随机模态特征缺失这一常见现实挑战下的鲁棒性。
- 在保持或提升性能的同时,降低多模态融合的计算复杂度。
- 在完整与不完整模态条件下,统一实现高效融合与鲁棒表示学习。
- 通过隐式低层次重建和显式高层次表示对齐,实现从不完整数据中的有效学习。
提出的方法
- EMT 从话语级表示中提取全局多模态上下文,以实现高效的全局-局部跨模态交互,避免局部-局部注意力带来的二次方复杂度。
- 采用分层参数共享机制,提升参数效率并简化训练过程。
- DLFR 执行低层次特征重建,以隐式方式促进从不完整数据中的语义学习。
- DLFR 利用孪生表示学习,显式对齐同一样本的完整与不完整视图的高层次表示。
- 该框架将完整与不完整数据视为两种视图,利用对比学习吸引鲁棒且共享的表示。
- 模型使用 BERT 处理文本,将缺失的音频和视觉特征用零填充,同时将缺失的文本标记替换为 [UNK]。
实验结果
研究问题
- RQ1与局部-局部注意力相比,全局-局部跨模态交互是否能在保持或提升性能的同时降低计算复杂度?
- RQ2低层次特征重建在提升对随机模态缺失的鲁棒性方面效果如何?
- RQ3通过孪生学习实现的显式高层次表示对齐,是否能进一步增强不完整设置下的鲁棒性?
- RQ4隐式与显式恢复策略的结合是否优于单独使用任一策略?
- RQ5所提出的框架是否能在完整与不完整模态场景下均实现泛化,并保持一致的性能提升?
主要发现
- EMT-DLFR 在三种流行的多模态情感分析数据集上,无论在完整模态还是不完整模态设置下,均取得了最先进性能。
- 全局-局部注意力机制相比局部-局部方法显著降低了计算成本,实现与模态数量的线性缩放。
- 低层次特征重建在提升对缺失模态特征的鲁棒性方面,比仅依靠高层次表示对齐更为有效。
- 两种双层次恢复策略的结合带来了互补性改进,从而实现更优的整体性能。
- 可视化结果表明,即使在中等缺失率下,模型仍能将注意力集中在有意义的跨模态信号上,对缺失标记仅保留部分注意力,体现出良好的鲁棒性。
- 所提出的 OAGL(全局-局部)策略的注意力矩阵相比 OOLL(局部-局部)策略更少冗余,且更不易产生虚假相关性,证实了更低的过拟合风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。