Skip to main content
QUICK REVIEW

[논문 리뷰] Line Segment Detection Using Transformers without Edges

Yifan Xu, Weijian Xu|arXiv (Cornell University)|2021. 01. 06.
Image and Object Detection Techniques참고 문헌 33인용 수 8
한 줄 요약

이 논문은 엣지 검출 및 히우리스틱 군집화를 생략하는 트랜스포머 기반의 새로운 엔드 투 엔드 선분 검출 방법인 LETR를 제안한다. 다중 척도 인코더-디코더 아키텍처와 직접적인 종점 거리 손실을 활용함으로써, Wireframe 및 YorkUrban 벤치마크에서 기존 최고 성능을 넘어서는 SOTA 성능을 달성한다.

ABSTRACT

In this paper, we present a joint end-to-end line segment detection algorithm using Transformers that is post-processing and heuristics-guided intermediate processing (edge/junction/region detection) free. Our method, named LinE segment TRansformers (LETR), takes advantages of having integrated tokenized queries, a self-attention mechanism, and an encoding-decoding strategy within Transformers by skipping standard heuristic designs for the edge element detection and perceptual grouping processes. We equip Transformers with a multi-scale encoder/decoder strategy to perform fine-grained line segment detection under a direct endpoint distance loss. This loss term is particularly suitable for detecting geometric structures such as line segments that are not conveniently represented by the standard bounding box representations. The Transformers learn to gradually refine line segments through layers of self-attention. In our experiments, we show state-of-the-art results on Wireframe and YorkUrban benchmarks.

연구 동기 및 목표

  • 기존의 엣지 기반 및 히우리스틱 군집화 방법이 실패하는 혼잡하고 가림이 있는 환경에서 선분 검출 문제를 해결하기 위해.
  • 선분 검출 파이프라인에서 엣지 검출, 절점 검출, 인지적 군집화와 같은 중간 단계의 히우리스틱 기반 처리 단계가 필요 없도록 제거하기 위해.
  • 바운딩 박스 표현 방식에 자연스럽게 적합하지 않은 트랜스포머를 활용해 기하학적 구조인 선분을 엔드 투 엔드로 학습할 수 있도록 하기 위해.
  • 새로운 종점 거리 손실 함수를 도입하여 세밀하고 길쭉한 기하학적 구조의 검출 정확도를 향상시키기 위해.

제안 방법

  • DETR를 영감으로 삼은 다중 척도 인코더-디코더 트랜스포머 아키텍처를 활용하며, 고수준(C5)과 저수준(C4)의 ResNet 레이어 특징을 사용해 굵은 해상도와 정밀한 해상도의 디코딩을 수행한다.
  • 직접적인 종점 거리 손실을 도입하여 모델이 선분의 종점을 직접 예측하도록 학습함으로써, 표준 바운딩 박스 회귀를 넘는 기하학적 구조 모델링이 가능해진다.
  • 학습 가능한 쿼리와 자기주의 어텐션 메커니즘을 활용해 엔드 투 엔드 방식으로 다수의 선분을 동시에 예측하며, 후처리 및 히우리스틱 군집화를 피한다.
  • 학습 중에 이항 매칭(Hungarian matching)을 사용하여 예측값을 종점 거리 손실 기반으로 정답 선분과 매칭한다.
  • 粗-세밀 디코딩을 적용: 고수준 특징에서 초기 선분 예측을 수행하는 굵은 디코더와, 저수준 특징과 어텐션을 활용해 이를 정밀하게 보정하는 세밀 디코더를 순차적으로 사용한다.
  • C5와 C4 특징 간의 피처 피라미드 융합을 통해 최종 예측의 공간 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1순수한 트랜스포머 아키텍처가 엣지 검출 또는 히우리스틱 군집화 모듈에 의존하지 않고도 최고의 선분 검출 성능을 달성할 수 있는가?
  • RQ2긴 선분과 같은 길쭉한 기하학적 구조를 검출할 때, 표준 바운딩 박스 회귀에 비해 직접적인 종점 거리 손실은 얼마나 효과적인가?
  • RQ3다중 척도 특징 융합과 굵은-세밀 디코딩 전략이 선분 검출 정확도에 미치는 영향은 어떠한가?
  • RQ4대규모 데이터셋(COCO 등)에서의 사전 학습이 Wireframe과 같은 저자원 환경에서 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ5이미지 업샘플링이 선분 검출 성능에 어떤 영향을 미치며, 이러한 설정 하에서 LETR는 기준 모델에 비해 얼마나 우수한가?

주요 결과

  • LETR는 Wireframe 벤치마크에서 sAP10 65.2와 sAP15 67.7을 기록하며 기존 방법들인 HAWP와 DWP를 모두 능가하는 SOTA 성능을 달성한다.
  • 다중 척도 인코더-디코더 설계가 검출 정확도를 크게 향상시키며, 굵은 디코더와 세밀 디코더 양쪽에 C5와 C4 특징을 모두 사용할 때 최고의 성능을 기록한다.
  • 직접적인 종점 거리 손실은 표준 포칼 손실 및 바운딩 박스 회귀에 비해 일관된 성능 향상을 이끌어내며, 특히 길고 얇은 선분에 대해 뚜렷한 개선 효과가 있다.
  • COCO 객체 검출 가중치에서의 사전 학습은 ImageNet 사전 학습(sAP10: 58.4, sAP15: 62.0) 또는 사전 학습 없음보다 더 빠른 수렴과 향상된 성능(sAP10: 62.3, sAP15: 65.2)을 이끌어낸다.
  • 추론 중 이미지 업샘플링은 HAWP와 LETR 양쪽 모두 성능 향상에 기여하며, LETR는 1100×1100 해상도에서 테스트 sAP10 65.2와 sAP15 67.7을 기록한다.
  • 절단 분석 결과, 어텐션 히트맵 시각화를 통해 디코딩 레이어 간에 점진적인 선분 예측 정밀도 향상이 관찰된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.