Skip to main content
QUICK REVIEW

[论文解读] DARNet: Deep Active Ray Network for Building Segmentation

Dominic Cheng, Renjie Liao|arXiv (Cornell University)|May 15, 2019
Advanced Neural Network Applications参考文献 5被引用 13
一句话总结

DARNet 提出了一种用于建筑实例分割的深度主动射线网络,采用极坐标参数化的轮廓以避免自相交并提升边界贴合度。通过训练卷积神经网络(CNN)预测能量图,并端到端优化轮廓演化过程,DARNet 在三个数据集上实现了最先进或具有竞争力的性能,相较于 DSAC 等先前方法,其边界对齐效果更优,轮廓自相交现象更少。

ABSTRACT

In this paper, we propose a Deep Active Ray Network (DARNet) for automatic building segmentation. Taking an image as input, it first exploits a deep convolutional neural network (CNN) as the backbone to predict energy maps, which are further utilized to construct an energy function. A polygon-based contour is then evolved via minimizing the energy function, of which the minimum defines the final segmentation. Instead of parameterizing the contour using Euclidean coordinates, we adopt polar coordinates, i.e., rays, which not only prevents self-intersection but also simplifies the design of the energy function. Moreover, we propose a loss function that directly encourages the contours to match building boundaries. Our DARNet is trained end-to-end by back-propagating through the energy minimization and the backbone CNN, which makes the CNN adapt to the dynamics of the contour evolution. Experiments on three building instance segmentation datasets demonstrate our DARNet achieves either state-of-the-art or comparable performances to other competitors.

研究动机与目标

  • 为解决基于深度学习的航空影像语义与实例分割中建筑边界界定不精确的问题。
  • 通过采用极坐标(基于射线)参数化方法,克服传统主动轮廓模型存在的自相交与复杂能量优化等局限。
  • 设计一种可微分框架,实现 CNN 与轮廓演化过程的端到端训练。
  • 引入一种新型损失函数,明确鼓励轮廓与真实建筑边界匹配。
  • 提升复杂且密集排列建筑的分割质量,尤其在城市区域与灾后影响区域。

提出的方法

  • 使用极坐标(射线)表示轮廓,而非笛卡尔坐标,从而消除自相交问题并简化能量函数设计。
  • 采用深度 CNN 主干网络,预测三种能量图:数据项(D)、曲率项(β)和膨胀项(κ),用以引导轮廓演化。
  • 通过在极坐标参数化下对能量函数进行梯度下降优化,实现可微分的轮廓演化。
  • 提出一种新型损失函数,对未与真实建筑边缘对齐的轮廓点施加惩罚,直接监督边界精度。
  • 支持每幅图像多个初始轮廓,以提升对大型或复杂建筑的分割效果,并采用融合策略生成最终预测结果。
  • 通过反向传播梯度,实现 CNN 与能量最小化过程的端到端联合训练。

实验结果

研究问题

  • RQ1主动轮廓的极坐标参数化是否能提升建筑分割中的边界贴合度并消除自相交?
  • RQ2将 CNN 与轮廓演化过程联合进行端到端训练,是否能实现与真实建筑边界更优的对齐?
  • RQ3所提出的能量函数与损失设计在分割精度方面,相较于现有主动轮廓与深度学习方法表现如何?
  • RQ4多个初始轮廓在多大程度上提升了城市环境中大型或复杂建筑的分割效果?
  • RQ5该方法在具有不同建筑形状与图像质量的多样化数据集上是否具备良好的泛化能力?

主要发现

  • DARNet 在三个基准数据集(Vaihingen、Bing Huts 和 TorontoCity)上实现了最先进或具有竞争力的性能。
  • 在 Vaihingen 数据集上,DARNet 的平均交并比(mIOU)达到 83.4%,优于 DSAC 及其他最先进方法。
  • 在 TorontoCity 数据集上,DARNet 的 mIOU 高于 DSAC,且在边界 F1(BoundF)指标上显著提升,表明边界对齐效果更优。
  • 采用多初始轮廓策略可提升对大型商业与工业建筑的分割性能,减少欠分割并提高覆盖度。
  • 定性结果表明,DARNet 的轮廓更紧密贴合建筑边缘,且避免了自相交现象,而 DSAC 在某些情况下存在此类问题。
  • 失败案例包括:在不确定性出现时轮廓过度扩展至邻近建筑,以及在具有复杂布局的大型、特征丰富的商业地块上产生混淆。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。