Skip to main content
QUICK REVIEW

[论文解读] QuadFormer: Quadruple Transformer for Unsupervised Domain Adaptation in Power Line Segmentation of Aerial Images

Pratyaksh Prabhav Rao, Feng Qiao|arXiv (Cornell University)|Nov 29, 2022
Advanced Neural Network Applications被引用 5
一句话总结

本文提出QuadFormer,一种分层四重注意力Transformer架构,通过交叉注意力与自注意力机制,自适应对齐合成(源域)与真实(目标域)航拍图像之间的特征,实现电力线分割的无监督域自适应。通过引入基于跨域上下文的在线伪标签校正机制,QuadFormer在ARPLSyn → ARPLReal和ARPLSyn → TTPLA两个基准上分别取得44.25 mIoU和46.32 mIoU的最先进性能。

ABSTRACT

Accurate segmentation of power lines in aerial images is essential to ensure the flight safety of aerial vehicles. Acquiring high-quality ground truth annotations for training a deep learning model is a laborious process. Therefore, developing algorithms that can leverage knowledge from labelled synthetic data to unlabelled real images is highly demanded. This process is studied in Unsupervised domain adaptation (UDA). Recent approaches to self-training have achieved remarkable performance in UDA for semantic segmentation, which trains a model with pseudo labels on the target domain. However, the pseudo labels are noisy due to a discrepancy in the two data distributions. We identify that context dependency is important for bridging this domain gap. Motivated by this, we propose QuadFormer, a novel framework designed for domain adaptive semantic segmentation. The hierarchical quadruple transformer combines cross-attention and self-attention mechanisms to adapt transferable context. Based on cross-attentive and self-attentive feature representations, we introduce a pseudo label correction scheme to online denoise the pseudo labels and reduce the domain gap. Additionally, we present two datasets - ARPLSyn and ARPLReal to further advance research in unsupervised domain adaptive powerline segmentation. Finally, experimental results indicate that our method achieves state-of-the-art performance for the domain adaptive power line segmentation on ARPLSyn$ ightarrow$TTTPLA and ARPLSyn$ ightarrow$ARPLReal.

研究动机与目标

  • 解决航拍图像中电力线精准分割的挑战,该任务对无人机飞行安全至关重要,但受限于高质量真实世界标注的稀缺性。
  • 缓解合成(源域)与真实(目标域)航拍图像之间的域偏移问题,因光照、色彩与背景差异导致模型泛化能力下降。
  • 通过利用跨域上下文依赖关系,提升基于自训练的无监督域自适应中伪标签的质量,减少噪声与分布差异。
  • 通过发布两个新数据集ARPLSyn(合成)与ARPLReal(真实)并附带高质量标注,推动域自适应电力线分割研究。

提出的方法

  • 设计一种分层四重注意力结构,结合域内自注意力与域间交叉注意力,学习可迁移的、上下文感知的特征表示。
  • 在源域与目标域特征之间引入交叉注意力,通过建模域间上下文依赖关系,对齐语义分布,减少域偏移。
  • 实现一种在线伪标签校正机制,利用交叉注意力原型在训练过程中优化噪声伪标签,提升标签的一致性与鲁棒性。
  • 采用多阶段训练策略:先在源域上进行预训练,随后在目标域上应用自训练,通过迭代生成与校正伪标签进行优化。
  • 应用一致性正则化与对抗损失,稳定训练过程,并进一步对齐域间特征分布。
  • 使用轻量化主干网络(如MiT-B0)进行训练,并逐步扩展至更大架构(如MiT-B5)以评估性能。

实验结果

研究问题

  • RQ1通过交叉注意力实现跨域上下文建模,能否显著减少无监督域自适应中电力线分割的域偏移?
  • RQ2利用交叉注意力原型进行在线伪标签校正,在未标注的真实图像上,其在提升分割精度方面的有效性如何?
  • RQ3分层注意力集成(自注意力与交叉注意力)在学习细长、碎片化结构(如电力线)的特征表示方面,提升程度如何?
  • RQ4在多样化真实航拍场景下,该方法与现有最先进方法相比,在域泛化能力方面表现如何?
  • RQ5各组件(自注意力、交叉注意力、对抗损失、伪标签去噪)对目标域最终性能的贡献分别是什么?

主要发现

  • QuadFormer在ARPLSyn → TTPLA域自适应基准上达到46.32 mIoU的最先进mIoU,显著优于先前方法。
  • 在更具挑战性的ARPLSyn → ARPLReal基准上,QuadFormer实现44.25 mIoU,展现出对真实世界复杂光照、缩放与背景变化的强大鲁棒性。
  • 消融实验表明,在源域与目标域特征中均引入交叉注意力可获得最高性能(39.65 mIoU),证实跨域上下文建模的重要性。
  • 所提出的在线伪标签校正机制贡献最大性能增益,相比仅使用源域的基线(mIoU从25.67提升至39.65),mIoU提升达14.0%。
  • 消融研究确认,结合自注意力、对抗损失与伪标签去噪可获得最佳性能,各组件对域对齐均有增量贡献。
  • 定性结果表明,与基线模型相比,QuadFormer生成的电力线预测更连贯、更少碎片化,尤其在背景杂乱的复杂场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。