[论文解读] PathGen-1.6M: 1.6 Million Pathology Image-text Pairs Generation through Multi-agent Collaboration
本文提出 PathGen-1.6M,一个通过 TCGA 的全切片图像(WSIs)上多智能体协作生成的 160 万张病理图像-文本对数据集。通过利用大规模多模态模型提取代表性切片并生成优化后的描述,作者训练了 PathGen-CLIP 和 PathGen-LLaVA,这两者在零样本和少样本分类任务中均达到最先进性能,并在病理学基准测试中甚至超越 GPT-4V 的表现。
Vision Language Models (VLMs) like CLIP have attracted substantial attention in pathology, serving as backbones for applications such as zero-shot image classification and Whole Slide Image (WSI) analysis. Additionally, they can function as vision encoders when combined with large language models (LLMs) to support broader capabilities. Current efforts to train pathology VLMs rely on pathology image-text pairs from platforms like PubMed, YouTube, and Twitter, which provide limited, unscalable data with generally suboptimal image quality. In this work, we leverage large-scale WSI datasets like TCGA to extract numerous high-quality image patches. We then train a large multimodal model to generate captions for these images, creating PathGen-1.6M, a dataset containing 1.6 million high-quality image-caption pairs. Our approach involves multiple agent models collaborating to extract representative WSI patches, generating and refining captions to obtain high-quality image-text pairs. Extensive experiments show that integrating these generated pairs with existing datasets to train a pathology-specific CLIP model, PathGen-CLIP, significantly enhances its ability to analyze pathological images, with substantial improvements across nine pathology-related zero-shot image classification tasks and three whole-slide image tasks. Furthermore, we construct 200K instruction-tuning data based on PathGen-1.6M and integrate PathGen-CLIP with the Vicuna LLM to create more powerful multimodal models through instruction tuning. Overall, we provide a scalable pathway for high-quality data generation in pathology, paving the way for next-generation general pathology models.
研究动机与目标
- 为解决现有病理图像-文本数据集稀缺且质量低下的问题,这些限制了鲁棒视觉-语言模型的训练。
- 开发一种可扩展的、高质量的病理数据生成流水线,利用 TCGA 的大规模全切片图像(WSIs)。
- 创建一个大规模、高保真的图像-文本数据集,以提升病理专用视觉-语言模型的性能。
- 将生成的数据与大型语言模型集成,构建用于临床推理和诊断的强大多模态病理模型。
提出的方法
- 采用多智能体协作从 TCGA 的高分辨率全切片图像(WSIs)中提取代表性切片,确保捕捉到多样化且具有诊断相关性的区域。
- 利用大规模多模态模型为提取的图像切片生成初始描述,结合视觉和上下文特征,生成描述性且与病理相关的文本。
- 通过基于智能体的反馈与验证,迭代式地优化描述,提升图像-文本对的准确性、细节程度和临床相关性。
- 利用生成的 PathGen-1.6M 数据集,通过图像-文本对上的对比学习方法,预训练 PathGen-CLIP——一种针对病理学的 CLIP 模型。
- 将 PathGen-CLIP 使用从 PathGen-1.6M 中提取的 20 万条指令微调样本进行微调,以训练 PathGen-LLaVA——一种用于病理理解的多模态大语言模型。
- 通过指令微调将视觉编码器(PathGen-CLIP)与大型语言模型(如 Vicuna)集成,实现复杂推理与多模态问答。
实验结果
研究问题
- RQ1多智能体协作是否能有效生成高质量、具有诊断相关性的图像-文本对,而无需依赖低质量的网络来源?
- RQ2大规模、高保真的病理数据集在全切片图像分析中的零样本和少样本分类性能方面,能带来多大程度的提升?
- RQ3经过病理优化的视觉-语言模型(PathGen-CLIP)是否能在下游病理任务中超越现有模型(如 PLIP 和 BiomedCLIP)?
- RQ4将 PathGen-CLIP 与大型语言模型集成后,是否能生成超越通用领域模型(如 GPT-4V)的多模态模型(PathGen-LLaVA),在病理特异性推理任务中表现更优?
主要发现
- 在使用 ABMIL 架构的 CAMELYON16 数据集上,PathGen-CLIP 的平均 AUC 达到 96.9,显著优于 PLIP(90.0)、BiomedCLIP(83.6)和 Quilt-Net(87.1)。
- 更大的 PathGen-CLIP-L 变体在使用 ACMIL 架构时,跨数据集的平均 AUC 达到 92.6,超越 PLIP(87.2)、BiomedCLIP(83.4)和 Quilt-Net(86.2)。
- PathGen-LLaVA 在 PathMMU 基准测试中整体准确率达到 58.4%,优于 GPT-4V(49.8%),并在多个子集上较 Quilt-LLaVA 提升 17.5% 至 22.2%。
- PathGen-LLaVA 在 PathMMU 的所有子集上均显著优于 Quilt-LLaVA,提升幅度分别为:PubMed 子集 17.5%,SocialPath 子集 12.2%,Atlas 子集 15.4%,PathCLS 子集 22.2%。
- 将 PathGen-1.6M 与现有数据集结合,使 PathGen-CLIP 在九项零样本图像分类任务和三项全切片图像分类任务中均达到最先进性能。
- 本研究证明,通过多智能体协作从 WSIs 中实现高质量、可扩展的数据生成是可行的,并能显著提升病理人工智能的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。