Skip to main content
QUICK REVIEW

[论文解读] A Labeled Ophthalmic Ultrasound Dataset with Medical Report Generation Based on Cross-modal Deep Learning

Jing Wang, Junyan Fan|arXiv (Cornell University)|Jul 26, 2024
Digital Imaging in MedicineMedicine被引用 3
一句话总结

本文提出了一种新型的大规模眼科超声数据集,包含4,858张去标识化的眼部超声图像、对应的中文诊断报告以及来自2,417名患者的血流动力学参数。该数据集支持跨模态深度学习,用于自动化医学报告生成,在CMN模型中表现出色,能够有效将图像区域与相关报告短语对齐,尤其在常见眼病病理方面表现突出。

ABSTRACT

Ultrasound imaging reveals eye morphology and aids in diagnosing and treating eye diseases. However, interpreting diagnostic reports requires specialized physicians. We present a labeled ophthalmic dataset for the precise analysis and the automated exploration of medical images along with their associated reports. It collects three modal data, including the ultrasound images, blood flow information and examination reports from 2,417 patients at an ophthalmology hospital in Shenyang, China, during the year 2018, in which the patient information is de-identified for privacy protection. To the best of our knowledge, it is the only ophthalmic dataset that contains the three modal information simultaneously. It incrementally consists of 4,858 images with the corresponding free-text reports, which describe 15 typical imaging findings of intraocular diseases and the corresponding anatomical locations. Each image shows three kinds of blood flow indices at three specific arteries, i.e., nine parameter values to describe the spectral characteristics of blood flow distribution. The reports were written by ophthalmologists during the clinical care. The proposed dataset is applied to generate medical report based on the cross-modal deep learning model. The experimental results demonstrate that our dataset is suitable for training supervised models concerning cross-modal medical data.

研究动机与目标

  • 为解决多模态眼科超声数据集缺乏的问题,创建一个全面的、真实世界临床数据集,包含图像、报告和血流动力学参数。
  • 支持开发能够将视觉特征与临床语言模式对齐的跨模态医学报告生成模型。
  • 通过基于超声影像的AI辅助报告生成,减轻眼科医生的诊断负担。
  • 为训练和评估监督型模型提供基准数据集,特别是在非英语(中文)临床报告生成方面。
  • 通过AI驱动的报告标准化,减少不同医生之间的诊断差异,提高诊断的准确性和一致性。

提出的方法

  • 该数据集基于2018年在中国沈阳一家眼科医院收集的真实临床数据构建,患者信息已去标识化以保护隐私。
  • 每个病例包含三种超声图像类型(B型、多普勒、频谱多普勒)、来自三条眼动脉的九项血流指数,以及由眼科医生撰写的自由文本诊断报告。
  • 训练了一个跨模态记忆网络(CMN),通过关注相关图像区域并整合视觉与血流动力学特征,实现医学报告生成。
  • 该模型采用双分支架构:卷积神经网络(CNN)用于图像特征提取,循环神经网络(RNN)用于文本生成。
  • 应用注意力机制以可视化图像区域与报告短语之间的对齐关系,提升模型预测的可解释性。
  • 评估采用BLEU、ROUGE和CIDEr等指标,并结合注意力图的定性分析及报告长度分布进行综合评估。

实验结果

研究问题

  • RQ1包含图像、报告和血流动力学参数的多模态眼科超声数据集是否能有效支持跨模态医学报告生成?
  • RQ2像CMN这样的跨模态深度学习模型,在将图像特征与临床相关的报告描述对齐方面表现如何?
  • RQ3与仅依赖图像的模型相比,纳入血流动力学参数是否能提高生成报告的准确性和临床相关性?
  • RQ4通过专家解读验证,模型的注意力机制在多大程度上聚焦于超声图像中的实际病灶区域?
  • RQ5生成报告的长度和内容分布与真实医生书写的报告相比有何异同?

主要发现

  • 所提出的数据集包含4,858张超声图像、4,858份对应的中文诊断报告,以及2,417名患者的病历记录,包含九项血流动力学参数,是目前唯一同时具备这三种模态的眼科数据集。
  • CMN模型生成的报告在长度分布上与真实报告高度一致,尤其在50–60词范围内,约350份真实报告集中于此区间。
  • 注意力图的可视化结果证实,CMN模型成功聚焦于病灶区域,如玻璃体出血、玻璃体混浊及玻璃体切除术后改变。
  • 该模型展现出强大的泛化能力,在部分病例中准确识别出复杂病理,如“玻璃体内机化性积血”和“眼内异常回声”。
  • 尽管性能优异,仍存在挑战:在图像边缘区域(如后部巩膜扩张)检测病灶困难,且难以区分视觉上相似的病理。
  • 该数据集可有效支持监督型跨模态模型的训练,展现出通过AI辅助报告生成减轻临床工作负荷的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。