Skip to main content
QUICK REVIEW

[論文レビュー] Line Segment Detection Using Transformers without Edges

Yifan Xu, Weijian Xu|arXiv (Cornell University)|Jan 6, 2021
Image and Object Detection Techniques参考文献 33被引用数 8
ひとこと要約

この論文は、エッジ検出やヒューリスティックなグループ化を回避する、トランスフォーマーを用いたエンドツーエンドのラインセグメント検出手法LET Rを提案する。マルチスケールのエンコーダデコーダアーキテクチャと直接的なエンドポイント距離損失を採用することで、WireframeおよびYorkUrbanベンチマークにおいて最先端の性能を達成し、従来のミドルレベルのビジョナルプロセッシングパイプラインに依存せずにSOTA結果を設定した。

ABSTRACT

In this paper, we present a joint end-to-end line segment detection algorithm using Transformers that is post-processing and heuristics-guided intermediate processing (edge/junction/region detection) free. Our method, named LinE segment TRansformers (LETR), takes advantages of having integrated tokenized queries, a self-attention mechanism, and an encoding-decoding strategy within Transformers by skipping standard heuristic designs for the edge element detection and perceptual grouping processes. We equip Transformers with a multi-scale encoder/decoder strategy to perform fine-grained line segment detection under a direct endpoint distance loss. This loss term is particularly suitable for detecting geometric structures such as line segments that are not conveniently represented by the standard bounding box representations. The Transformers learn to gradually refine line segments through layers of self-attention. In our experiments, we show state-of-the-art results on Wireframe and YorkUrban benchmarks.

研究の動機と目的

  • 従来のエッジベースの手法やヒューリスティックなグループ化手法が失敗する、ごみくずが多く、隠蔽があるシーンにおけるラインセグメント検出という、長年の課題に取り組むこと。
  • エッジ検出、ジョイント検出、知覚的グループ化といった中間のヒューリスティクス駆動ステージを必要としないラインセグメント検出パイプラインの構築を可能にすること。
  • ボクシングボックス表現に自然に適さないトランスフォーマーを用いて、幾何的構造(例:ラインセグメント)をエンドツーエンドで学習可能にする。
  • 新しいエンドポイント距離損失関数を導入することで、細かく長い幾何的構造の検出精度を向上させること。

提案手法

  • DETRにインspiredされたマルチスケールのエンコーダデコーダトランスフォーマー構造を採用。粗い復元には深層(C5)と浅層(C4)のResNet層からの特徴を併用。
  • 直接的なエンドポイント距離損失を導入し、モデルがラインセグメントのエンドポイントを直接予測できるようにすることで、標準的なボクシングボックス回帰を超えた幾何的構造モデリングを可能にする。
  • 学習可能なクエリと自己注意機構を用いて、後処理やヒューリスティックなグループ化を回避したエンドツーエンドの複数ラインセグメント同時予測を実現。
  • トレーニング時に、エンドポイント距離損失に基づいて予測と真値ラインセグメントを二部マッチング(ハンガリアンマッチング)で関連付ける。
  • 粗いから細かい復元の順序で処理する:粗いデコーダーが高レベル特徴から初期のラインセグメントを予測し、細かいデコーダーが低レベル特徴と注目を用いてそれを精錬する。
  • C5とC4特徴の特徴ピラミッド統合により、最終予測の空間的精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1エッジ検出やヒューリスティックなグループ化モジュールに依存しない純粋なトランスフォーマー基盤アーキテクチャが、最先端のラインセグメント検出を達成できるか?
  • RQ2長く細い幾何的構造(例:ラインセグメント)の検出において、標準的なボクシングボックス回帰と比較して、直接的なエンドポイント距離損失はどの程度有効か?
  • RQ3マルチスケール特徴統合と粗いから細かい復元の処理が、ラインセグメント検出の精度に与える影響は何か?
  • RQ4大規模データセット(例:COCO)での事前学習が、Wireframeのような低データ環境における収束性と性能に与える影響は?
  • RQ5画像のアップサンプリングはラインセグメント検出の性能向上にどの程度寄与するか。また、このような条件下でLETRはベースライン手法と比較してどの程度優れているか?

主な発見

  • LETRはWireframeベンチマークでsAP10が65.2、sAP15が67.7を達成し、HAWP や DWP などの先行手法を上回る最先端の性能を示した。
  • マルチスケールエンコーダデコーダ設計により検出精度が顕著に向上し、粗いデコーダーと細かいデコーダーの両方でC5とC4特徴を用いることで最高の性能が達成された。
  • 直接的なエンドポイント距離損失は、標準的なフォーカル損失やボクシングボックス回帰よりも一貫した改善をもたらし、特に長く細いラインセグメントに対して顕著であった。
  • COCOオブジェクト検出の重みでの事前学習は、ImageNetでの事前学習(sAP10: 58.4、sAP15: 62.0)や事前学習なしよりも、収束が速く、性能も優れていた(sAP10: 62.3、sAP15: 65.2)。
  • 推論時に画像のアップサンプリングを行うと、HAWPおよびLETRの両方の性能が向上し、LETRは1100×1100解像度でテストsAP10が65.2、sAP15が67.7を達成した。
  • アブレーションスタディにより、注目マップの可視化を通じて、粗いから細かい復元の各段階でラインセグメント予測が段階的に精錬されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。