Skip to main content
QUICK REVIEW

[论文解读] End to End Trainable Active Contours via Differentiable Rendering

Shir Gur, Tal Shaharabany|arXiv (Cornell University)|Dec 1, 2019
Advanced Vision and Imaging参考文献 41被引用 7
一句话总结

该论文提出了一种端到端可训练的活动轮廓方法,通过可微分渲染器演化多边形,利用单个编码器-解码器推理生成的2D位移图。通过反向传播直接优化多边形形状与真实掩码之间的差异,该方法在医学、航拍和城市基准上实现了最先进(SOTA)的分割性能。

ABSTRACT

We present an image segmentation method that iteratively evolves a polygon. At each iteration, the vertices of the polygon are displaced based on the local value of a 2D shift map that is inferred from the input image via an encoder-decoder architecture. The main training loss that is used is the difference between the polygon shape and the ground truth segmentation mask. The network employs a neural renderer to create the polygon from its vertices, making the process fully differentiable. We demonstrate that our method outperforms the state of the art segmentation networks and deep active contour solutions in a variety of benchmarks, including medical imaging and aerial images. Our code is available at https://github.com/shirgur/ACDRNet.

研究动机与目标

  • 开发一种简单而强大的活动轮廓方法,以提升语义分割中的边界精度。
  • 通过可微分渲染实现活动轮廓的端到端训练,使梯度能够从分割损失反向传播至多边形顶点。
  • 在包括数据有限的医学和航拍图像在内的多样化数据集上,超越现有深度活动轮廓和语义分割模型。
  • 证明仅通过一次位移图推理、无需迭代监督的极简架构即可取得卓越结果。
  • 通过将传统不可微分的轮廓演化过程替换为可学习、可微分的多边形形变过程,验证可微分渲染在分割任务中的有效性。

提出的方法

  • 该方法使用U-Net风格的编码器-解码器,通过输入图像的一次前向传播预测2D位移图。
  • 位移图定义了多边形顶点的移动,顶点初始为规则形状(如圆形),并通过迭代方式演化。
  • 使用可微分网格渲染器(Kato et al., 2018)将演化中的多边形转换为二值分割掩码,从而实现梯度流向顶点位移。
  • 损失函数为渲染后的多边形掩码与真实分割掩码之间的均方误差(MSE)损失。
  • 模型通过可微分渲染器端到端训练,支持通过梯度下降优化顶点位置。
  • 该方法无需迭代监督或辅助损失,尽管消融实验表明加入曲率和膨胀损失可带来轻微性能提升。

实验结果

研究问题

  • RQ1一个单一的、端到端的可微分渲染流程能否取代经典迭代式活动轮廓演化,并实现更优性能?
  • RQ2直接通过一次推理预测位移图的方法是否优于多阶段或力平衡的活动轮廓方法?
  • RQ3仅包含分割损失和可微分渲染的极简架构能否在多样化数据集上实现最先进性能?
  • RQ4性能对多边形顶点数量和演化过程迭代次数的敏感程度如何?
  • RQ5当传统方法因不可微性而失效时,可微分渲染是否能有效支持活动轮廓的训练?

主要发现

  • 所提方法在Cityscapes数据集上实现了75.09的平均IoU,优于所有基线模型,包括PSP-DeepLab和Polygon-GCN。
  • 在Vaihingen航拍数据集上,模型在64×64分辨率下训练时达到91.74%的mIoU和95.62%的F1-score,性能在低于64像素时显著下降。
  • 性能在约32个顶点时趋于饱和,且在低顶点数(如4–16个顶点)时与DARNet(Cheng et al., 2019)相比存在明显性能差距。
  • 仅通过一次迭代训练的模型也取得了优异结果,表明位移图即使在无迭代优化的情况下也极为有效。
  • 消融实验表明,复合损失(L_seg + L_K + L_B)性能最佳(91.74% mIoU),但即使仅使用基础MSE损失也优于SOTA。
  • 该方法在不同领域间泛化能力出色,在医学影像、航拍图像和城市街景中均实现了最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。