[论文解读] SMIL: Multimodal Learning with Severely Missing Modality
本文提出 SMIL,一种用于在严重缺失模态条件下进行多模态学习的贝叶斯元学习框架——在高达 90% 的训练数据缺乏完整模态的情况下依然有效。通过联合重建缺失模态并利用不确定性感知推理正则化潜在特征,SMIL 在 MM-IMDb、CMU-MOSI 和 avMNIST 上均实现了最先进性能,即使在极端缺失情况下也优于生成基线方法(如 VAE 和 GAN)。
A common assumption in multimodal learning is the completeness of training data, i.e., full modalities are available in all training examples. Although there exists research endeavor in developing novel methods to tackle the incompleteness of testing data, e.g., modalities are partially missing in testing examples, few of them can handle incomplete training modalities. The problem becomes even more challenging if considering the case of severely missing, e.g., 90% training examples may have incomplete modalities. For the first time in the literature, this paper formally studies multimodal learning with missing modality in terms of flexibility (missing modalities in training, testing, or both) and efficiency (most training data have incomplete modality). Technically, we propose a new method named SMIL that leverages Bayesian meta-learning in uniformly achieving both objectives. To validate our idea, we conduct a series of experiments on three popular benchmarks: MM-IMDb, CMU-MOSI, and avMNIST. The results prove the state-of-the-art performance of SMIL over existing methods and generative baselines including autoencoders and generative adversarial networks. Our code is available at https://github.com/mengmenm/SMIL.
研究动机与目标
- 解决训练数据存在严重模态不完整时缺乏多模态学习方法的问题,这是现实世界中常见的挑战。
- 克服现有方法仅能在推理阶段处理模态缺失或要求训练时具备完整模态的局限性。
- 开发一个统一框架,兼顾灵活性(支持训练、测试或两者中均存在模态缺失)与效率(能从高度不完整的数据中有效学习)。
- 设计一种方法,避免生成模型(如 VAE 和 GAN)固有的偏差,这些模型依赖完整模态数据进行预训练。
- 在无需大量完整模态数据用于分布建模的前提下,实现对多样化缺失模式的鲁棒性能。
提出的方法
- 提出一种贝叶斯元学习框架,通过变分推理联合优化模态重建与潜在特征正则化。
- 使用重建网络 $\phi_c$ 从后验分布中生成模态特定的权重,实现对缺失模态的动态重建。
- 引入正则化网络 $\phi_r$,输出正则化项的后验分布以扰动潜在特征,促进平滑且可泛化的嵌入表示。
- 对 $\phi_c$ 和 $\phi_r$ 的后验分布进行随机采样,以建模不确定性并提升对模态缺失的鲁棒性。
- 利用 K-means 聚类指导重建网络,使其学习到更准确且解耦的缺失模态特征表示。
- 将目标形式化为变分推理问题,以近似模型权重与正则化项的真实后验分布,支持端到端训练。
实验结果
研究问题
- RQ1当高达 90% 的训练样本存在模态缺失,且不依赖完整模态数据时,能否有效训练多模态模型?
- RQ2如何使模型在多种缺失模态模式下(训练中缺失、测试中缺失或两者皆有)保持高性能,而无需设计独立架构?
- RQ3在低数据、高缺失率设置下,具有不确定性引导正则化的贝叶斯元学习是否优于标准生成模型(如 VAE、GAN)?
- RQ4模态重建与特征正则化联合作用在提升泛化能力与减少模态生成偏差方面有多大的贡献?
- RQ5由于元学习获得的归纳偏置,模型是否能在无需微调的情况下泛化到未见过的缺失模式?
主要发现
- SMIL 在 MM-IMDb、CMU-MOSI 和 avMNIST 上均达到最先进性能,无论在何种模态缺失模式下,均优于下界基线与生成基线(AE、GAN)。
- 在仅 5% 音频模态可用的单模态测试中,SMIL 相较于下界基线将分类准确率提升 1.10%,展现出对极端缺失的鲁棒性。
- 当从全模态测试切换到单模态测试时,SMIL 仅出现 1.0% 的性能下降,而 AE 和 GAN 的性能下降达 5.6%,表明其具有更优的灵活性。
- 消融实验表明,若移除 K-means 引导的重建(SMIL w/o K-means),F1 分数下降 1.0–2.0,证明其对准确生成缺失模态特征至关重要。
- 若移除特征正则化(SMIL w/o Regularization),F1 分数下降 0.015–0.025,证实正则化对最小化嵌入差异至关重要。
- 采用固定高斯分布或确定性推理替代贝叶斯元学习,导致 F1 分数降低 0.01–0.03,证明不确定性感知推理具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。