[论文解读] Model-based Cleaning of the QUILT-1M Pathology Dataset for Text-Conditional Image Synthesis
该论文提出了一种基于模型的流程,通过检测并移除视觉杂质(如解说员、软件叠加层和文本注释)来清理 QUILT-1M 组织病理学数据集,以实现文本条件图像生成。该方法利用基于 ResNet50-D 的多标签分类器检测视觉杂质,并通过 CLIP 分数进行语义对齐过滤。该方法显著提升了文本到图像生成的图像保真度,减少了伪影,并使下游扩散模型的 FID 分数降低了 32%。
The QUILT-1M dataset is the first openly available dataset containing images harvested from various online sources. While it provides a huge data variety, the image quality and composition is highly heterogeneous, impacting its utility for text-conditional image synthesis. We propose an automatic pipeline that provides predictions of the most common impurities within the images, e.g., visibility of narrators, desktop environment and pathology software, or text within the image. Additionally, we propose to use semantic alignment filtering of the image-text pairs. Our findings demonstrate that by rigorously filtering the dataset, there is a substantial enhancement of image fidelity in text-to-image tasks.
研究动机与目标
- 为解决 QUILT-1M 数据集中图像质量差和存在视觉杂质的问题,这些因素限制了其在文本条件图像生成中的应用价值。
- 开发一种自动化、可扩展的方法,用于检测来自公共在线存储库的组织病理学图像中常见的图像杂质。
- 通过基于 CLIP 的评分对大规模数据集中图像-文本对进行语义对齐过滤,以提升其质量。
- 通过 FID 和定性分析评估数据集清洗对下游文本到图像生成质量的影响。
- 通过过滤低质量及非纯净图像内容,实现高保真度、病理学特定的图像生成。
提出的方法
- 在 QUILT-1M 中抽取的 6,532 张图像的 1% 手动标注数据上,训练了一个基于 ResNet50-D 的多标签分类器,用于检测九类视觉杂质,包括解说员、桌面元素和文本叠加层。
- 通过基于验证损失的早停和模型选择策略优化杂质检测模型。
- 通过 CONCH 模型计算 CLIP 分数,实施语义对齐过滤,仅保留 CLIP 分数最高的前 50% 图像-文本对。
- 结合两个过滤步骤:首先进行杂质检测,然后进行语义对齐,生成一个清洗后的数据子集。
- 在过滤后的数据集上对潜在扩散模型(Stable Diffusion 2.1)进行 15,000 次迭代的微调,以评估文本到图像生成质量。
- 通过在 10,000 张生成图像裁剪样本上计算条件 Fréchet Inception Distance (FID),对比基线和基准数据集(MIDOG++ 和 PLISM),评估生成质量。
实验结果
研究问题
- RQ1深度学习模型在多大程度上能够检测来自公开抓取源(如 QUILT-1M)的组织病理学图像中的常见视觉杂质?
- RQ2基于语义对齐(通过 CLIP 分数)的过滤在多大程度上提升了大规模数据集中图像-文本对的质量?
- RQ3移除杂质并提升对齐度对组织病理学文本到图像生成保真度有何影响?
- RQ4清洗后的数据集是否能显著降低扩散模型中的伪影并提升 FID 分数?
主要发现
- 多标签杂质分类器在测试集上达到了 92.71% 的准确率,对任意杂质的检测召回率达到 97.17%,AUC 为 0.9481。
- QUILT-1M 数据集中超过 78% 的图像至少包含一种视觉杂质,其中桌面/软件元素(35.96%)和额外的按钮/控制元素(31.89%)最为普遍。
- 在未清洗的 QUILT-1M 数据集上训练的模型在生成图像中产生了明显的伪影,定性样本中已明确可见。
- 经过过滤的数据集显著提升了图像保真度,与未清洗基线相比,FID 分数降低了 32%。
- 通过 CONCH 的 CLIP 分数进行语义对齐过滤,有效去除了对齐不佳的图像-文本对,提升了训练数据质量。
- 杂质检测与语义过滤的结合,生成了一个更清洁、更可靠的高质量数据集,适用于组织病理学中高保真度文本到图像模型的训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。