[论文解读] From Multimodal to Unimodal Attention in Transformers using Knowledge Distillation
本文提出在变压器模型中应用知识蒸馏,以实现从多模态预训练模型进行单模态推理,采用对比表示蒸馏(CRD)和注意力图中的熵蒸馏(EDAM)。最佳配置在保持仅使用视频模态进行情感识别性能的同时,将SOTA准确率提升3%,参数量减少2.5倍,推理时间缩短22%。
Multimodal Deep Learning has garnered much interest, and transformers have triggered novel approaches, thanks to the cross-attention mechanism. Here we propose an approach to deal with two key existing challenges: the high computational resource demanded and the issue of missing modalities. We introduce for the first time the concept of knowledge distillation in transformers to use only one modality at inference time. We report a full study analyzing multiple student-teacher configurations, levels at which distillation is applied, and different methodologies. With the best configuration, we improved the state-of-the-art accuracy by 3%, we reduced the number of parameters by 2.5 times and the inference time by 22%. Such performance-computation tradeoff can be exploited in many applications and we aim at opening a new research area where the deployment of complex models with limited resources is demanded.
研究动机与目标
- 解决多模态变压器中的高计算成本和模态缺失问题。
- 通过从多模态教师模型蒸馏知识到单模态学生模型,实现高效单模态推理。
- 探索最优蒸馏程度和方法,在降低模型复杂度的同时保持性能。
- 为在资源受限条件下部署复杂多模态模型建立新的研究方向。
- 验证注意力图上的蒸馏有效性,并对比CRD与EDAM在知识迁移中的表现。
提出的方法
- 从多模态交叉注意力变压器(教师)蒸馏知识到单模态自注意力变压器(学生)。
- 使用对比表示蒸馏(CRD)在中间特征层级(特别是注意力图)传递知识。
- 提出注意力图中的熵蒸馏(EDAM),直接在注意力图上应用交叉熵损失以传递注意力模式。
- 实施两种处理教师(交叉注意力)与学生(自注意力)注意力图之间维度不匹配的策略:下采样(EDAM-S↓)和上采样(EDAM-T↑)。
- 在多个层级(早期、中期、晚期)使用蒸馏损失训练学生网络,包括线性层和注意力图表示。
- 评估多种教师配置:完整的9层变压器网络以及单个模态分支(视频、音频、语言)。
实验结果
研究问题
- RQ1知识蒸馏能否在保持高准确率的同时,有效将多模态知识传递给单模态学生变压器?
- RQ2在变压器架构中,知识蒸馏在哪个层级对单模态推理最有效?
- RQ3不同蒸馏方法(CRD与EDAM)在性能和计算成本上的对比如何?
- RQ4教师架构的选择(如完整网络与单个分支)是否显著影响蒸馏结果?
- RQ5对注意力图进行蒸馏能否克服教师与学生之间注意力机制差异(交叉注意力与自注意力)的挑战?
主要发现
- 最佳配置在推理时仅使用视频模态的情况下,将情感识别的SOTA准确率提升了3%。
- 与完整的多模态教师模型相比,学生模型的参数量减少了2.5倍,推理时间缩短22%。
- 注意力图中的熵蒸馏(EDAM)优于CRD,在更低的计算开销下实现了更高的准确率和F1分数。
- 下采样注意力图(EDAM-S↓)的效果优于上采样,因为它在不造成过度信息损失的情况下保留了更多相关特征。
- 在深层(尤其是注意力图)进行蒸馏的效果优于在输出层或浅层进行,证实中间表示对知识迁移更具信息量。
- 使用单个模态分支作为教师与使用完整教师网络相比,性能无显著差异,表明知识迁移具有模态独立性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。