[论文解读] Inference of captions from histopathological patches
本论文提出了 PatchGastricADC22,一个大规模的组织病理学切片数据集,包含 262,777 个来自胃腺癌 H&E 染色全切片图像的组织病理学切片,每个切片均配有从临床报告中提取的诊断描述。通过使用基于注意力机制的 RNN 模型并结合预训练的 CNN 特征(EfficientNetB3 和 DenseNet121),该研究在真实临床数据环境下实现了 BLEU@4 得分为 0.324(±0.354),证明了在从切片集合生成描述方面具有令人期待的性能表现。
Computational histopathology has made significant strides in the past few years, slowly getting closer to clinical adoption. One area of benefit would be the automatic generation of diagnostic reports from H\&E-stained whole slide images which would further increase the efficiency of the pathologists' routine diagnostic workflows. In this study, we compiled a dataset (PatchGastricADC22) of histopathological captions of stomach adenocarcinoma endoscopic biopsy specimens, which we extracted from diagnostic reports and paired with patches extracted from the associated whole slide images. The dataset contains a variety of gastric adenocarcinoma subtypes. We trained a baseline attention-based model to predict the captions from features extracted from the patches and obtained promising results. We make the captioned dataset of 262K patches publicly available.
研究动机与目标
- 开发一种无需新标注的组织病理学切片生成诊断描述的方法。
- 创建一个大规模、经过筛选的切片-描述对数据集,来自真实的临床全切片图像和报告,用于医学视觉-语言建模。
- 评估基于注意力机制的模型在从胃腺癌多个切片生成临床相关描述方面的性能。
- 探索利用现有非结构化临床报告在计算病理学中训练视觉-语言模型的可行性。
- 公开发布一个数据集,以加速组织病理学报告生成领域的研究。
提出的方法
- 从单一医院收集了 991 幅 H&E 染色的全切片图像,所有图像均诊断为腺癌,并在 x20 放大倍数下进行数字化。
- 从含有腺癌病变的区域提取 300x300px 的切片,分别在 x10 和 x20 放大倍数下进行,使用宽松的标注以最小化非肿瘤切片的包含。
- 从现有的临床报告中提取诊断描述,并由专家病理科医生翻译成英文,最终得到一个包含 277 个词的词汇表,最长句子长度为 50 个词。
- 训练一个基于注意力机制的 RNN 模型,使用 CNN 编码器(EfficientNetB3 或 DenseNet121)进行特征提取,RNN 解码器用于自回归描述生成。
- 应用数据增强技术,并在最终的特征图上比较两种池化策略——3x3 最大池化与全局平均池化。
- 使用 BLEU@4 和平均 1/2-gram 重叠度量评估模型性能,按腺癌亚型和模型配置进行分层分析。
实验结果
研究问题
- RQ1视觉-语言模型能否从从全切片图像中提取的组织病理学切片集合中生成具有临床意义的诊断描述?
- RQ2当训练数据集的描述多样性有限时,模型性能在不同腺癌亚型之间如何变化?
- RQ3数据增强和池化策略(3x3 与平均池化)是否会影响组织病理学切片的描述生成性能?
- RQ4预训练的 CNN 模型(EfficientNetB3、DenseNet121)在未在目标领域进行微调的情况下,能否在组织病理学描述生成任务中实现良好泛化?
- RQ5在单一医院的临床报告上进行训练的模型,其泛化能力是否足够强,足以在计算病理学的下游应用中发挥作用?
主要发现
- 表现最佳的模型采用 EfficientNetB3,结合数据增强和 x20 放大倍数下的 3x3 最大池化策略,BLEU@4 得分为 0.324(±0.354),表明与参考描述有合理的匹配度。
- 该最佳模型的平均 1/2-gram 重叠度最高(0.744 ± 0.269),表明在预测描述中对腺癌亚型的召回能力较强。
- 在数据集中代表性更高的亚型,如高分化和中等分化的管状腺癌,其 BLEU@4 得分更高,表明类别不平衡影响了模型性能。
- BLEU@4 的标准差较高(最高达 ±0.354),表明不同病例间的性能差异显著,部分预测几乎无用(BLEU < 0.1)。
- 模型的主要错误模式出现在形态学描述方面,而非亚型识别,这从亚型术语的高 1/2-gram 重叠度中得到证实。
- 本研究发布的数据集 PatchGastricADC22 包含来自 991 幅全切片图像的 262,777 个切片,已公开发布,以支持未来在组织病理学报告生成领域的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。