[论文解读] DMCL: Distillation Multiple Choice Learning for Multimodal Action Recognition
该论文提出DMCL,一种新颖的知识蒸馏框架,支持模态特异性网络在多模态动作识别任务中的协作训练,其中在每个训练步骤中,表现最佳的模态网络将知识蒸馏给其他网络。该方法在三个基准数据集上实现了最先进性能,在较小数据集上准确率最高提升6%,且在测试时对缺失模态具有鲁棒性。
In this work, we address the problem of learning an ensemble of specialist networks using multimodal data, while considering the realistic and challenging scenario of possible missing modalities at test time. Our goal is to leverage the complementary information of multiple modalities to the benefit of the ensemble and each individual network. We introduce a novel Distillation Multiple Choice Learning framework for multimodal data, where different modality networks learn in a cooperative setting from scratch, strengthening one another. The modality networks learned using our method achieve significantly higher accuracy than if trained separately, due to the guidance of other modalities. We evaluate this approach on three video action recognition benchmark datasets. We obtain state-of-the-art results in comparison to other approaches that work with missing modalities at test time.
研究动机与目标
- 解决在测试时某些模态可能缺失的情况下,训练鲁棒的多模态动作识别模型的挑战。
- 通过使各模态特异性网络能够从不同模态间的互补信息中协同学习,提升其性能。
- 克服在多模态设置下朴素多选学习(MCL)的局限性,即学习速度较快的模态网络主导训练过程。
- 在训练过程中利用多模态的特权信息,以增强单模态分类器在推理时的泛化能力。
- 开发一种框架,即使在测试时仅提供单一模态(如RGB)时也能保持高准确率,且无需重新训练。
提出的方法
- 提出一种协作训练范式:对于每个训练样本,分类损失最低的模态网络充当“教师”,并向其他网络蒸馏知识。
- 使用教师网络的软目标,通过式(3)定义的广义蒸馏损失来指导学生网络的训练。
- 在不同模态(RGB、深度、光流)之间采用多教师、多学生设置的知识蒸馏,实现跨模态知识迁移。
- 采用动态选择机制:在每次前向传播中,选择损失最低的模态作为教师,确保最具信心的模态引导其他模态。
- 以端到端方式联合训练所有模态网络,使每个网络能够专注于其表现最佳的类别或样本。
- 支持在测试时使用任意模态子集进行推理,因为蒸馏知识使模型在部分模态缺失时仍能保持鲁棒性能。
实验结果
研究问题
- RQ1如何协同训练多个模态网络,以提升多模态动作识别任务的性能?
- RQ2标准多选学习(MCL)在应用于多模态数据时的失败模式是什么?如何加以缓解?
- RQ3知识蒸馏能否有效将某一模态的判别优势传递给其他模态,特别是在测试时某些模态缺失的情况下?
- RQ4与独立训练的模态网络相比,通过蒸馏实现的协作学习在准确率提升方面有多大程度的改善?
- RQ5DMCL框架在不同数据集规模和模态可用性设置下的性能扩展性如何?
主要发现
- 在仅测试RGB模态时,DMCL在NTU60数据集上相比基线模型实现了6%的绝对准确率提升。
- 在UWA3DII数据集上,DMCL在仅使用RGB模态时达到78.39%的准确率,比之前最先进方法高出1.3%。
- 在仅使用深度模态时,DMCL在UWA3DII数据集上达到81.87%的准确率,相比基线提升4.8%。
- 在完整的NTU120数据集上,DMCL在仅使用光流模态时达到86.44%的准确率,比基线高出1.7%。
- 在小规模数据集(如NTU60和NTU120 mini)上,蒸馏效果最为显著,DMCL相比基线模型准确率最高提升6%。
- 在所有三个基准数据集(UWA3DII、NWUCLA、NTU)上,即使仅使用单一模态进行测试,DMCL也实现了最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。