Skip to main content
QUICK REVIEW

[论文解读] SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering

Bo Liu, Li-Ming Zhan|arXiv (Cornell University)|Feb 18, 2021
Multimodal Machine Learning Applications参考文献 16被引用 10
一句话总结

本文提出了 SLAKE,一个大规模、双语(英语/中文)、带语义标签且融合知识的医学视觉问答(Med-VQA)数据集,包含详细的器官与病灶分割掩码、边界框以及结构化的医学知识图谱。该数据集在使用语义视觉标注和外部知识时,可实现高达 2.6% 的准确率提升,证明其在训练鲁棒、具有临床相关性的 Med-VQA 系统方面的价值。

ABSTRACT

Medical visual question answering (Med-VQA) has tremendous potential in healthcare. However, the development of this technology is hindered by the lacking of publicly-available and high-quality labeled datasets for training and evaluation. In this paper, we present a large bilingual dataset, SLAKE, with comprehensive semantic labels annotated by experienced physicians and a new structural medical knowledge base for Med-VQA. Besides, SLAKE includes richer modalities and covers more human body parts than the currently available dataset. We show that SLAKE can be used to facilitate the development and evaluation of Med-VQA systems. The dataset can be downloaded from http://www.med-vqa.com/slake.

研究动机与目标

  • 解决当前用于训练和评估医学视觉问答(Med-VQA)系统时缺乏高质量、公开可用数据集的问题。
  • 克服现有数据集(如 VQA-RAD)缺乏语义标注和外部医学知识整合的局限性。
  • 构建一个多样化、平衡且具有临床相关性的数据集,覆盖多种影像模态(CT、MRI、X 射线)、身体部位(包括颈部和盆腔腔室)以及问题类型。
  • 支持训练能够对视觉内容和外部医学知识进行联合推理的 Med-VQA 模型,以应对复杂的临床问题。
  • 通过提供带有详细标注和结构化知识库的基准数据集,推动多模态融合与知识增强推理在医学人工智能中的研究。

提出的方法

  • 从公开数据源(如 NIH、Medical Decathlon 等)收集 642 幅放射科图像,构建大规模、双语(英语/中文)的 Med-VQA 数据集。
  • 由经验丰富的放射科医生使用 ITK-SNAP 工具,对每幅图像标注 39 个器官和 12 种疾病对应的语义分割掩码与边界框。
  • 设计两类问题:仅视觉类问题(基于图像内容)和基于知识类问题(需依赖外部医学知识),并通过显式标注引导模型推理。
  • 利用 TransE 方法构建结构化的医学知识图谱,嵌入实体与关系(如 <肝脏, 存在功能障碍于, 肝硬化>),实现知识感知推理。
  • 通过将视觉特征与知识图谱嵌入进行融合,将知识图谱集成到多模态注意力网络(SAN)中,用于答案预测。
  • 采用双流 LSTM 架构从问题中预测关系与尾部实体,实现相关知识图谱三元组的检索,以支持推理。

实验结果

研究问题

  • RQ1一个大规模、带语义标签且融合知识的 Med-VQA 数据集,是否能提升最先进模型在临床推理任务中的性能?
  • RQ2语义视觉标注(分割掩码与边界框)在多大程度上提升了 Med-VQA 模型的推理能力?
  • RQ3将外部医学知识图谱整合到模型中,在提升基于知识的临床问题准确率方面有多高效?
  • RQ4双语(英语/中文)问答对的引入是否提升了 Med-VQA 系统的泛化能力与可访问性?
  • RQ5所提出的数据集能否作为评估跨多种影像模态与身体区域的多模态及知识增强型 Med-VQA 模型的稳健基准?

主要发现

  • SLAKE 数据集包含 642 幅放射科图像,覆盖 5 个体部(头部、颈部、胸部、腹部、盆腔腔室),共 14,000 个问答对,显著扩展了现有数据集(如 VQA-RAD)的覆盖范围。
  • 在使用语义分割掩码微调的模型(VGG seg + SAN)下,仅视觉类问题的准确率达到 75.36%,较基线模型(72.73%)提升 2.6%,证明了详细视觉标注的价值。
  • 在英语中,基于知识的问题准确率从无知识图谱时的 70.27% 提升至使用知识图谱后的 72.30%;在中文中,使用知识增强模型后准确率提升至 75.01%,表明外部知识的有效性。
  • 该数据集支持开放式与封闭式问题,各类问题分布均衡,提升了模型的泛化能力与评估的可靠性。
  • 通过 TransE 嵌入实现的知识图谱使模型能够对涉及疾病机制、器官功能与治疗方案的复杂复合型问题进行准确推理,而仅依赖视觉的模型难以实现此类推理。
  • SLAKE 的双语设计支持跨语言评估与开发,中文模型在仅视觉任务中达到 74.27% 的准确率,在基于知识的任务中达到 75.01%,表明其具备强大的跨语言迁移潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。