[论文解读] BiomedParse: a biomedical foundation model for image parsing of everything everywhere all at once
BiomedParse 是一个生物医学基础模型,通过统一的文本提示在 82 种对象类型和 9 种成像模式下联合执行分割、检测和识别,无需用户提供的边界框。它通过利用 GPT-4 将嘈杂的非结构化数据集描述与生物医学本体对齐,创建了一个包含超过 600 万张图像-掩码-描述三元组的大规模数据集用于预训练,从而实现了最先进性能。
Biomedical image analysis is fundamental for biomedical discovery in cell biology, pathology, radiology, and many other biomedical domains. Holistic image analysis comprises interdependent subtasks such as segmentation, detection, and recognition of relevant objects. Here, we propose BiomedParse, a biomedical foundation model for imaging parsing that can jointly conduct segmentation, detection, and recognition for 82 object types across 9 imaging modalities. Through joint learning, we can improve accuracy for individual tasks and enable novel applications such as segmenting all relevant objects in an image through a text prompt, rather than requiring users to laboriously specify the bounding box for each object. We leveraged readily available natural-language labels or descriptions accompanying those datasets and use GPT-4 to harmonize the noisy, unstructured text information with established biomedical object ontologies. We created a large dataset comprising over six million triples of image, segmentation mask, and textual description. On image segmentation, we showed that BiomedParse is broadly applicable, outperforming state-of-the-art methods on 102,855 test image-mask-label triples across 9 imaging modalities (everything). On object detection, which aims to locate a specific object of interest, BiomedParse again attained state-of-the-art performance, especially on objects with irregular shapes (everywhere). On object recognition, which aims to identify all objects in a given image along with their semantic types, we showed that BiomedParse can simultaneously segment and label all biomedical objects in an image (all at once). In summary, BiomedParse is an all-in-one tool for biomedical image analysis by jointly solving segmentation, detection, and recognition for all major biomedical image modalities, paving the path for efficient and accurate image-based biomedical discovery.
研究动机与目标
- 为解决传统生物医学图像分析方法将分割、检测和识别视为独立任务且用户负担高的局限性。
- 通过实现零样本、文本引导的图像中所有相关对象的解析,消除分割过程中对用户指定边界框的需求。
- 开发一种可扩展的统一框架,实现整体生物医学图像分析,利用分割、检测和识别之间的相互依赖关系。
- 仅使用标准分割数据集和大语言模型生成的语义对齐,构建大规模多模态生物医学图像解析数据集。
提出的方法
- BiomedParse 在一个包含超过 600 万张图像-掩码-描述三元组的数据集上进行预训练,该数据集通过使用 GPT-4 将现有分割数据集中嘈杂的非结构化自然语言描述与既定的生物医学对象本体对齐而构建。
- 该模型采用多任务学习框架,通过单一视觉-语言主干网络联合优化分割、检测和识别,实现从单一文本提示端到端的解析。
- 对于不规则形状的对象,模型通过互相关和迭代位移实现注意力图优化,以提高掩码对齐效果,尤其在 CT 和 MRI 等 3D 成像模式中表现更优。
- 对象识别通过两阶段流程完成:首先通过基于面积的阈值化(λ × 原始面积)选择目标区域;其次通过像素级概率排序实现非重叠掩码聚合。
- 模型采用分层目标结构,将 82 种生物医学对象类型按 9 种成像模式组织,实现模态特定且解剖学一致的解析。
- 检测评估指标包括框比(Box Ratio)、凸包比(Convex Ratio)和逆旋转惯性(IRI),用于量化形状规则性和掩码保真度。
实验结果
研究问题
- RQ1一个单一的基础模型是否能够在不依赖用户提供的边界框的情况下,联合执行生物医学图像中的分割、检测和识别?
- RQ2GPT-4 在多大程度上可用于将标准分割数据集中嘈杂的非结构化文本描述与结构化本体对齐标签进行语义调和,以用于预训练?
- RQ3与任务特定模型相比,分割、检测和识别之间的联合学习在多样化生物医学成像模态上的性能提升程度如何?
- RQ4该模型是否能更好地泛化到不规则形状对象,并相比基于边界框的方法更准确地检测它们?
- RQ5仅使用标准分割数据集并辅以大语言模型增强的描述,对统一图像解析模型性能的影响如何?
主要发现
- BiomedParse 在 9 种成像模态下对 102,855 个测试图像-掩码-标签三元组的性能优于最先进方法,展示了其在分割任务中的广泛适用性。
- 该模型在对象检测方面达到最先进性能,尤其在不规则形状对象上,Box Ratio、Convex Ratio 和 IRI 指标均有显著提升。
- BiomedParse 仅通过一个文本提示即可成功识别并分割图像中所有相关生物医学对象,完全消除了对手动边界框输入的需求。
- 该模型能够检测并拒绝用户输入中描述图像中不存在对象的无效输入,表现出对语义幻觉的鲁棒性。
- 利用 GPT-4 将非结构化描述与生物医学本体对齐,成功从仅标准分割数据集中构建了包含 680 万张图像-掩码-描述三元组的大规模数据集。
- 两阶段对象识别流程有效减少了掩码重叠并提升了选择准确性,其性能优于使用 Grounding DINO、SAM 和 MedSAM 的基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。