[论文解读] Blind Inpainting of Large-scale Masks of Thin Structures with Adversarial and Reinforcement Learning
本文提出了一种新颖的盲图像修复方法,用于大规模二值分割掩码中细结构的修复,采用带有双判别器结构的对抗性训练与基于策略梯度的强化学习。该方法在无需事先知晓缺口位置的情况下,通过联合优化局部补丁级细节与全局结构一致性,实现了最先进性能,在植物根系数据集上的表现与人类专家相当。
Several imaging applications (vessels, retina, plant roots, road networks from satellites) require the accurate segmentation of thin structures for subsequent analysis. Discontinuities (gaps) in the extracted foreground may hinder down-stream image-based analysis of biomarkers, organ structure and topology. In this paper, we propose a general post-processing technique to recover such gaps in large-scale segmentation masks. We cast this problem as a blind inpainting task, where the regions of missing lines in the segmentation masks are not known to the algorithm, which we solve with an adversarially trained neural network. One challenge of using large images is the memory capacity of current GPUs. The typical approach of dividing a large image into smaller patches to train the network does not guarantee global coherence of the reconstructed image that preserves structure and topology. We use adversarial training and reinforcement learning (Policy Gradient) to endow the model with both global context and local details. We evaluate our method in several datasets in medical imaging, plant science, and remote sensing. Our experiments demonstrate that our model produces the most realistic and complete inpainted results, outperforming other approaches. In a dedicated study on plant roots we find that our approach is also comparable to human performance. Implementation available at \url{https://github.com/Hhhhhhhhhhao/Thin-Structure-Inpainting}.
研究动机与目标
- 解决在视网膜血管、植物根系和道路网络等细结构的二值分割掩码中,因间隙导致下游分析困难的问题。
- 开发一种盲图像修复方法,其中模型对缺失区域的位置未知,与传统非盲图像修复方法不同。
- 通过在小 patch 上进行训练并利用全局判别器保持全局结构一致性,克服处理大规模图像时的 GPU 显存限制。
- 通过对抗性训练与强化学习结合局部补丁级优化与全局结构一致性,提升图像修复质量。
- 在医学影像、植物科学与遥感等多个领域展示泛化能力,并通过定量与定性验证证明其有效性。
提出的方法
- 该方法使用基于 U-Net 的生成器网络,从大规模图像中随机裁剪 patch 进行训练,并在训练过程中引入人工缺口。
- 局部判别器(D_L)通过将修复后的 patch 与真实 patch 比较,评估其真实性。
- 全局判别器(D_G)通过将完整修复图像与原始无缺口图像比较,评估整体结构一致性。
- 采用策略梯度强化学习训练生成器,使其在不可微设置下与全局判别器交互,即使在随机采样与重组成过程中也能保持有效交互。
- 模型在合成数据(含人工缺口)与真实数据(含实际缺口)的组合上进行训练,提升对真实世界分割掩码的泛化能力。
- 最终模型 GAN-GL-M 在合成与真实根系数据上联合训练,使其既能泛化至真实世界中的不连续结构,又能保持高保真度的图像修复。
实验结果
研究问题
- RQ1深度学习模型能否在不知晓缺口位置的前提下,有效实现大规模二值掩码中细结构的盲图像修复?
- RQ2当在小 patch 上进行训练时,如何在大规模图像修复中保持全局结构一致性?
- RQ3基于全局判别器的强化学习训练方案在多大程度上能提升细结构修复结果的逼真度与完整性?
- RQ4所提出的方法能否在植物根系等复杂细结构的分割任务中达到与人类专家相当的性能?
- RQ5在训练过程中结合合成与真实数据,是否能提升模型在真实世界分割掩码上的泛化能力与性能?
主要发现
- GAN-GL-M 模型在真实根系 patch 上的平均 F1 分数达到 0.7211(±0.5970),优于所有基线模型,接近专家水平表现。
- 在完整根系分割掩码上,GAN-GL-M 将连通组件数量减少了 13.58(±14.47),表明结构完整性显著提升。
- 模型改善了根系长度与凸包面积的测量结果,修复后凸包面积平均增加 81.12(±23.94),表明断裂片段得到了更好连接。
- 与专家标注相比,GAN-GL-M 在根系长度与凸包面积上的表现相当或更优,表明修复结果具有一致性与真实性。
- 全局判别器(D_G)与策略梯度的结合对保持拓扑结构至关重要,缺乏该组件的模型会产生碎片化结果,连通组件数量更高。
- 视觉与定量评估均证实,GAN-GL-M 在医学、植物与遥感数据集上均产生了最逼真且完整的图像修复结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。