[论文解读] Improving Multimodal Accuracy Through Modality Pre-training and Attention
本文提出了一种两阶段训练方法用于多模态学习,通过在端到端微调前分别对模态专用子网络(如文本、音频、视频)进行预训练,从而提升准确率。注意力模块根据每个输入的相关性动态加权模态,使模型在情感分析、情绪识别和说话人特质识别任务上表现更优,且架构更简单,优于复杂的端到端模型。
Training a multimodal network is challenging and it requires complex architectures to achieve reasonable performance. We show that one reason for this phenomena is the difference between the convergence rate of various modalities. We address this by pre-training modality-specific sub-networks in multimodal architectures independently before end-to-end training of the entire network. Furthermore, we show that the addition of an attention mechanism between sub-networks after pre-training helps identify the most important modality during ambiguous scenarios boosting the performance. We demonstrate that by performing these two tricks a simple network can achieve similar performance to a complicated architecture that is significantly more expensive to train on multiple tasks including sentiment analysis, emotion recognition, and speaker trait recognition.
研究动机与目标
- 解决在端到端多模态训练过程中不同模态(文本、音频、视频)收敛速度不均的问题。
- 在不依赖复杂且昂贵架构的前提下,提升多模态模型性能。
- 在推理过程中利用注意力机制实现模态的动态加权,以识别每个样本中最具信息量的模态。
- 证明独立预训练子网络可提升模态内表征学习效果,从而提高整体准确率。
- 为现有多模态融合方法提供一种更具可解释性和效率的替代方案。
提出的方法
- 在每个模态(文本、音频、视频)上独立预训练模态专用的双向LSTM,以学习鲁棒的模态内表征,再进行融合。
- 预训练完成后移除最后一层的softmax,将最后一个隐藏状态作为每个输入的模态嵌入表示。
- 使用可学习的注意力机制融合模态,通过一个包含ReLU和softmax非线性的两层前馈网络计算显著性权重。
- 注意力机制使用如下公式计算权重:$ A = \text{softmax}(W_2(\tanh(W_1 H^T + b_1)) + b_2) $,其中 $ H $ 为所有模态隐藏状态的拼接。
- 将加权后的模态表征拼接,并通过全连接层和softmax进行最终分类。
- 在预训练和注意力模块集成后,对整个网络进行端到端微调,以同时优化模态内与模态间动态关系。
实验结果
研究问题
- RQ1与从随机初始化开始的端到端训练相比,独立预训练模态专用子网络是否能显著提升多模态分类准确率?
- RQ2在模态信息模糊或冲突的情况下,能够动态加权模态的注意力机制是否能提升模型性能?
- RQ3在性能上,采用预训练与注意力机制的简单架构在多大程度上可达到甚至超越更复杂的多模态模型?
- RQ4注意力权重在多模态理解任务中是否能反映人类对模态的优先排序行为?
- RQ5两阶段训练策略是否能在保持高准确率的同时,降低训练时间与复杂度?
主要发现
- 所提方法在情感分析、情绪识别和说话人特质识别任务上表现具有竞争力,准确率与更复杂的模型相当或更优。
- 独立预训练子网络显著提升了性能,使各模态能以各自最优速率收敛。
- 注意力机制在模糊场景中成功识别出最具信息量的模态,例如当视觉或文本线索具有误导性时。
- 在POM数据集中,模型在识别自信情绪时为声学模态分配了最高的注意力权重,正确识别其为关键信号。
- 在MOSEI数据集中,当所有模态均显示快乐情绪时,模型为各模态分配了相近的注意力权重,反映出一致的多模态信号。
- 该方法减少了对收敛较快模态(如文本)的训练偏见,提升了多模态决策的整体鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。