Skip to main content
QUICK REVIEW

[论文解读] Line Segment Detection Using Transformers without Edges

Yifan Xu, Weijian Xu|arXiv (Cornell University)|Jan 6, 2021
Image and Object Detection Techniques参考文献 33被引用 8
一句话总结

本文提出LET R,一种基于Transformer的新型端到端线段检测方法,通过直接预测线段端点并采用多尺度编码器-解码器架构,绕过了边缘检测和启发式分组步骤。通过引入端点距离损失函数,LET R在Wireframe和YorkUrban基准上实现了最先进性能,取得了新的SOTA结果,且无需依赖传统中层视觉处理流水线。

ABSTRACT

In this paper, we present a joint end-to-end line segment detection algorithm using Transformers that is post-processing and heuristics-guided intermediate processing (edge/junction/region detection) free. Our method, named LinE segment TRansformers (LETR), takes advantages of having integrated tokenized queries, a self-attention mechanism, and an encoding-decoding strategy within Transformers by skipping standard heuristic designs for the edge element detection and perceptual grouping processes. We equip Transformers with a multi-scale encoder/decoder strategy to perform fine-grained line segment detection under a direct endpoint distance loss. This loss term is particularly suitable for detecting geometric structures such as line segments that are not conveniently represented by the standard bounding box representations. The Transformers learn to gradually refine line segments through layers of self-attention. In our experiments, we show state-of-the-art results on Wireframe and YorkUrban benchmarks.

研究动机与目标

  • 解决在杂乱、遮挡场景中传统基于边缘和启发式分组方法失效的线段检测长期挑战。
  • 消除线段检测流水线中对中间启发式驱动阶段(如边缘检测、角点检测和感知分组)的依赖。
  • 通过Transformer实现几何结构(如线段)的端到端学习,尽管Transformer本身并不天然适合边界框表示。
  • 通过引入新型端点距离损失函数,提升对细长几何结构的检测精度。

提出的方法

  • 采用受DETR启发的多尺度编码器-解码器Transformer架构,结合深层(C5)和浅层(C4)ResNet特征,分别用于粗粒度和细粒度解码。
  • 引入直接端点距离损失,使模型能够直接预测线段端点,从而实现超越标准边界框回归的几何结构建模。
  • 使用可学习查询和自注意力机制,以端到端方式联合预测多个线段,避免后处理和启发式分组。
  • 在训练过程中采用二分图匹配(匈牙利匹配),基于端点距离损失将预测结果与真实线段关联。
  • 采用自粗到细的解码策略:粗粒度解码器从高层特征预测初始线段,细粒度解码器利用低层特征和注意力机制进行优化。
  • 在C5和C4特征之间进行特征金字塔融合,以增强最终预测的空间精度。

实验结果

研究问题

  • RQ1纯Transformer架构是否能在不依赖边缘检测或启发式分组模块的前提下实现最先进线段检测性能?
  • RQ2与标准边界框回归相比,直接端点距离损失在检测细长几何结构(如线段)方面效果如何?
  • RQ3多尺度特征融合与自粗到细解码策略对线段检测精度有何影响?
  • RQ4在大规模数据集(如COCO)上进行预训练,对Wireframe等低数据场景下的收敛性和性能有何影响?
  • RQ5图像上采样在多大程度上能提升线段检测性能?在该设置下,LETR与基线方法相比表现如何?

主要发现

  • 在Wireframe基准上,LETR以sAP10为65.2、sAP15为67.7达到最先进性能,优于HAWP和DWP等先前方法。
  • 多尺度编码器-解码器设计显著提升检测精度,当在粗粒度和细粒度解码器中同时使用C5和C4特征时性能最佳。
  • 直接端点距离损失相比标准焦点损失和边界框回归带来一致改进,尤其在长而细的线段上表现更优。
  • 在COCO目标检测权重上进行预训练,相比ImageNet预训练(sAP10: 58.4, sAP15: 62.0)或无预训练,能实现更快收敛和更好性能(sAP10: 62.3, sAP15: 65.2)。
  • 推理阶段进行图像上采样可提升HAWP和LETR的性能,其中LETR在1100×1100分辨率下达到测试sAP10为65.2、sAP15为67.7。
  • 消融实验验证了自粗到细解码策略的有效性,注意力热力图可视化显示线段预测在各解码层中逐步优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。