[论文解读] A Systematic Collection of Medical Image Datasets for Deep Learning
本文系统性地整理并构建了一个涵盖300多个医学影像数据集与挑战的综合性资源库(2013–2020年),覆盖四个领域:头颈部、胸部与腹部、病理学与血液、以及其他。该资源库使研究人员能够识别相关数据集,对方法进行稳健评估,并访问挑战排行榜,从而解决医学深度学习中数据稀缺与可及性不足的问题。
The astounding success made by artificial intelligence (AI) in healthcare and other fields proves that AI can achieve human-like performance. However, success always comes with challenges. Deep learning algorithms are data-dependent and require large datasets for training. The lack of data in the medical imaging field creates a bottleneck for the application of deep learning to medical image analysis. Medical image acquisition, annotation, and analysis are costly, and their usage is constrained by ethical restrictions. They also require many resources, such as human expertise and funding. That makes it difficult for non-medical researchers to have access to useful and large medical data. Thus, as comprehensive as possible, this paper provides a collection of medical image datasets with their associated challenges for deep learning research. We have collected information of around three hundred datasets and challenges mainly reported between 2013 and 2020 and categorized them into four categories: head & neck, chest & abdomen, pathology & blood, and ``others''. Our paper has three purposes: 1) to provide a most up to date and complete list that can be used as a universal reference to easily find the datasets for clinical image analysis, 2) to guide researchers on the methodology to test and evaluate their methods' performance and robustness on relevant datasets, 3) to provide a ``route'' to relevant algorithms for the relevant medical topics, and challenge leaderboards.
研究动机与目标
- 通过汇编一个全面、最新且可访问的数据集与挑战列表,解决医学图像分析中数据稀缺这一关键瓶颈。
- 指导研究人员为特定临床影像任务选择合适的数据集,以评估和基准化其深度学习算法。
- 提供一个可导航的参考资源,链接数据集、挑战与相关算法,以加速人工智能驱动的医学图像分析研究与开发。
- 通过整合公开可获取且符合伦理规范的数据集与挑战平台,克服数据访问与标注的障碍。
- 通过聚合基准测试平台与排行榜,支持医学AI研究的可复现性与可比性。
提出的方法
- 系统性地收集并整理了2013年至2020年间在主要会议与机构中报告的300多个医学影像数据集与挑战。
- 根据解剖学与临床相关性,将数据集划分为四大主题类别:头颈部、胸部与腹部、病理学与血液,以及“其他”类别。
- 为每个数据集提供详细的元数据,包括成像模态、任务类型(如分类、分割)、样本数量及标注质量。
- 将数据集与相关挑战(如MICCAI、ISBI、AAPM)进行映射,并提供挑战排行榜与公共代码库的链接。
- 审查并总结了数据高效学习的关键方法,包括迁移学习、少样本学习、主动学习与联邦学习。
- 讨论了自然语言处理在利用放射科报告实现半自动标注中的作用,以减轻人工标注负担。
实验结果
研究问题
- RQ1目前在医疗健康领域深度学习研究中,哪些是全面且最新的医学影像数据集与挑战的集合?
- RQ2研究人员如何高效识别并获取特定医学影像任务(如MRI或CT中的肿瘤分割)的相关数据集?
- RQ3在医学图像分析中,克服数据稀缺与标注瓶颈的最有效策略是什么?
- RQ4基准测试平台与挑战排行榜如何提升医学影像中深度学习模型的评估与可复现性?
- RQ5新兴技术如联邦学习与主动学习在实现隐私保护与成本效益模型训练方面发挥何种作用?
主要发现
- 本研究汇编并组织了2013至2020年间来自300多个医学影像数据集与挑战,覆盖多种解剖区域与成像模态。
- 数据集被系统性地划分为四大主题:头颈部、胸部与腹部、病理学与血液,以及“其他”,显著提升了可搜索性与可用性。
- 作者发现,由MICCAI、ISBI与AAPM主办的挑战是医学影像中深度学习模型基准测试与评估的关键平台。
- 在医学影像的低数据环境下,基于预训练模型的迁移学习与微调被证明极为有效。
- 主动学习与联邦学习被识别为降低标注成本并保护数据隐私的有前景方法。
- 利用放射科报告的自然语言处理技术被证实可支持半自动数据标注,减少对专家标注数据的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。