Skip to main content
QUICK REVIEW

[论文解读] Adaptive Affinity Fields for Semantic Segmentation

Tsung-Wei Ke, Jyh-Jing Hwang|arXiv (Cornell University)|Mar 27, 2018
Advanced Neural Network Applications参考文献 30被引用 13
一句话总结

本文提出自适应亲和场(Adaptive Affinity Fields, AAF),一种新颖的语义分割方法,通过对抗性训练学习空间结构,以自适应选择不同语义类别最优的邻域大小。通过将亲和匹配形式化为极小化-极大化问题,AAF 在 PASCAL VOC 2012、Cityscapes 和 GTA5 上提升了分割精度,且无推理开销,实现了最先进性能与强大的域泛化能力。

ABSTRACT

Semantic segmentation has made much progress with increasingly powerful pixel-wise classifiers and incorporating structural priors via Conditional Random Fields (CRF) or Generative Adversarial Networks (GAN). We propose a simpler alternative that learns to verify the spatial structure of segmentation during training only. Unlike existing approaches that enforce semantic labels on individual pixels and match labels between neighbouring pixels, we propose the concept of Adaptive Affinity Fields (AAF) to capture and match the semantic relations between neighbouring pixels in the label space. We use adversarial learning to select the optimal affinity field size for each semantic category. It is formulated as a minimax problem, optimizing our segmentation neural network in a best worst-case learning scenario. AAF is versatile for representing structures as a collection of pixel-centric relations, easier to train than GAN and more efficient than CRF without run-time inference. Our extensive evaluations on PASCAL VOC 2012, Cityscapes, and GTA5 datasets demonstrate its above-par segmentation performance and robust generalization across domains.

研究动机与目标

  • 解决像素级分类在捕捉细粒度空间结构方面的局限,特别是对细小或复杂形状(如细辐条或远距离物体)的建模能力不足。
  • 克服条件随机场(CRF)(推理成本高)与生成对抗网络(GAN)(训练不稳定)在强制施加结构先验时的缺陷。
  • 提出一种在训练阶段自动学习不同语义类别最优邻域大小的方法,而非使用固定或人工调校的感受野。
  • 在无微调的情况下,提升模型在域偏移(如从真实世界数据集 Cityscapes 到合成数据集 GTA5)下的分割鲁棒性。
  • 引入一种轻量化、高效的替代方案,替代 CRF 与 GAN,不增加任何运行时推理成本,同时增强预测结果的结构一致性。

提出的方法

  • 提出自适应亲和场(Adaptive Affinity Fields, AAF)作为成对损失函数,建模标签空间中相邻像素之间的空间关系,通过局部关系捕捉语义结构。
  • 将 AAF 形式化为极小化-极大化优化问题:最小化亲和匹配损失,同时最大化不同核大小下的误差,构建最差情况下的学习场景。
  • 使用判别器网络评估不同核大小(3×3、5×5、7×7)下亲和场匹配的质量,使网络能够为每种类别学习最优感受野大小。
  • 引入多核大小的加权组合,通过注意力机制式的权重学习每种类别对应的最优核响应。
  • 端到端训练分割网络,采用混合损失:标准交叉熵损失用于像素级分类,AAF 损失用于结构一致性建模。
  • 仅在训练阶段应用 AAF 损失,避免任何运行时推理开销——与基于 CRF 或 GAN 的后处理或精炼模块不同。

实验结果

研究问题

  • RQ1对抗性训练能否用于自动学习语义分割中每种类别的最优感受野大小?
  • RQ2学习类别特定的亲和场是否能提升对细粒度结构(如细辐条或远距离人物)的分割性能?
  • RQ3AAF 是否能在无微调的情况下跨域泛化(如从 Cityscapes 到 GTA5),并优于标准基线方法?
  • RQ4组合使用多种核大小(3×3、5×5、7×7)如何影响分割精度与结构建模能力?
  • RQ5AAF 是否能在避免 CRF 或 GAN 方法缺陷(如高推理成本或训练不稳定性)的前提下,实现更优性能?

主要发现

  • 在 PASCAL VOC 2012 验证集上,使用 3×3、5×5 和 7×7 核组合时,AAF 实现 88.22% 的平均交并比(mIoU),优于 PSPNet 基线模型。
  • 在 Cityscapes 数据集上,AAF 在未微调的 GTA5 测试中,mIoU 提升 1.46%,像素准确率提升 9.5%,均优于 PSPNet。
  • ‘person’ 和 ‘dog’ 类别的最优核大小分别为 3.1 和 3.4,表明更偏好较小的感受野;而 ‘cow’ 和 ‘plant’ 则受益于更大的感受野(分别为 4.6 和 4.5)。
  • 3×3 与 5×5 核的组合表现最佳,在 ‘aero’ 上达到 90.19% mIoU,在 ‘bird’ 上达到 89.87% mIoU,优于单一核或三核组合。
  • AAF 显著提升了对细小结构(如细辐条)和远距离物体的分割质量,视觉对比显示其优于 PSPNet 与基线亲和场方法。
  • AAF 展现出强大的跨域泛化能力:在 GTA5 Part 1 上实现 78.28% mIoU,较 PSPNet 提升 1.46%,证明其在无适应条件下具备优异的域泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。