Skip to main content
QUICK REVIEW

[论文解读] Multiple Meta-model Quantifying for Medical Visual Question Answering

Tuong Do, Binh X. Nguyen|arXiv (Cornell University)|May 19, 2021
Multimodal Machine Learning Applications参考文献 44被引用 5
一句话总结

该论文提出了一种名为多模型量化(Multiple Meta-model Quantifying, MMQ)的新颖元学习框架,用于医学视觉问答(VQA),通过从数据集内图像自动生成并优化元标注,增强特征学习,有效处理噪声标签,并完全消除对外部数据的依赖。MMQ在PathVQA和VQA-RAD数据集上达到最先进性能,在开放式问题上相比先前方法最高提升9.8%,且未使用数据集外图像。

ABSTRACT

Transfer learning is an important step to extract meaningful features and overcome the data limitation in the medical Visual Question Answering (VQA) task. However, most of the existing medical VQA methods rely on external data for transfer learning, while the meta-data within the dataset is not fully utilized. In this paper, we present a new multiple meta-model quantifying method that effectively learns meta-annotation and leverages meaningful features to the medical VQA task. Our proposed method is designed to increase meta-data by auto-annotation, deal with noisy labels, and output meta-models which provide robust features for medical VQA tasks. Extensively experimental results on two public medical VQA datasets show that our approach achieves superior accuracy in comparison with other state-of-the-art methods, while does not require external data to train meta-models.

研究动机与目标

  • 通过利用数据集内元标注,解决医学图像标注有限且存在噪声的VQA挑战。
  • 通过减少对用于元模型预训练的外部数据集的依赖,提升医学VQA中元学习的鲁棒性。
  • 开发一种可扩展的自监督方法,通过迭代优化元模型增强特征表示能力。
  • 在最小化计算开销和模型复杂度的前提下,实现在医学VQA基准上的卓越性能。

提出的方法

  • MMQ引入一种多阶段优化流程,利用不确定性感知的预测评分,从无标签医学图像中生成并改进元标注。
  • 采用多个量化元模型,通过一种元无关的优化过程进行训练,以增强模型的鲁棒性与泛化能力。
  • 该框架通过m次迭代数据优化,并聚合n个元模型的预测结果,生成稳定且高质量的特征。
  • 在训练过程中利用模型预测的不确定性,以过滤噪声标签并提升元标注质量。
  • 采用VQA框架,利用注意力机制(SAN或BAN)整合输出的元模型,实现视觉与问题表征的联合学习。
  • 该方法完全依赖数据集内图像进行元模型训练,彻底避免使用外部数据。

实验结果

研究问题

  • RQ1是否可以有效利用数据集内图像在不依赖外部数据的前提下生成高质量元标注?
  • RQ2元模型的迭代优化在多大程度上提升了医学VQA中的鲁棒性与准确性?
  • RQ3不确定性感知的预测过滤在多大程度上可减轻噪声标签对元标注的影响?
  • RQ4在数据稀缺条件下,多模型元模型集成是否优于单模型元模型方法?

主要发现

  • 在PathVQA的自由形式问题上,MMQ达到13.4%的top-1准确率,相比之前最先进方法MEVF提升5.3%。
  • 在VQA-RAD上,MMQ使用BAN注意力机制达到67.0%的整体准确率,相比MEVF提升9.8%。
  • 仅使用一个优化后的元模型,MMQ已超越MAML和MEVF,证明其核心有效性。
  • 性能提升在自由形式问题上更为显著,表明其对复杂、信息密集型问题具有更强的处理能力。
  • 增加元模型数量和优化步骤可进一步提升性能,但当m>5且n>3时,性能增益趋于饱和。
  • MMQ保持极低的推理时间(0.010s/样本),且与MAML和MEVF相比,模型参数仅略有增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。