Skip to main content
QUICK REVIEW

[論文レビュー] DLA-Net: Learning Dual Local Attention Features for Semantic Segmentation of Large-Scale Building Facade Point Clouds

Yanfei Su, Weiquan Liu|arXiv (Cornell University)|Jun 1, 2021
3D Surveying and Cultural Heritage参考文献 44被引用数 7
ひとこと要約

本稿では、大規模な建物ファサード点群における局所的特徴抽出を強化するための二重局所注意(DLA)モジュールを備えた新規な3次元セマンティックセグメンテーションネットワーク、DLA-Netを提案する。DLAモジュールは自己注意と注意プーリングを統合し、強化された位置符号化を組み合わせており、16000万点以上のラベル付き点群を含む新しく構築された大規模で細分化された建物ファサード点群ベンチマークにおいて最先端の性能を達成している。

ABSTRACT

Semantic segmentation of building facade is significant in various applications, such as urban building reconstruction and damage assessment. As there is a lack of 3D point clouds datasets related to the fine-grained building facade, we construct the first large-scale building facade point clouds benchmark dataset for semantic segmentation. The existing methods of semantic segmentation cannot fully mine the local neighborhood information of point clouds. Addressing this problem, we propose a learnable attention module that learns Dual Local Attention features, called DLA in this paper. The proposed DLA module consists of two blocks, including the self-attention block and attentive pooling block, which both embed an enhanced position encoding block. The DLA module could be easily embedded into various network architectures for point cloud segmentation, naturally resulting in a new 3D semantic segmentation network with an encoder-decoder architecture, called DLA-Net in this work. Extensive experimental results on our constructed building facade dataset demonstrate that the proposed DLA-Net achieves better performance than the state-of-the-art methods for semantic segmentation.

研究の動機と目的

  • 建物ファサードのセマンティックセグメンテーションに向けた大規模で細分化された3次元点群データセットの不足に対処すること。
  • 特に複雑で大規模なシーンにおいて、3次元点群セグメンテーションにおける局所的近傍特徴表現を向上させること。
  • 点群内の空間的依存関係および幾何学的構造を効果的に捉えることができる学習可能な注意メカニズムを開発すること。
  • 将来的な3次元建物ファサード理解分野の研究を支援するため、モバイルレーザースキャニング(MLS)データを用いて新規なベンチマークデータセットを構築すること。

提案手法

  • 自己注意ブロックと注意プーリングブロックの両方を備えた二重局所注意(DLA)モジュールを提案し、位置符号化ブロックによって強化する。
  • 相対的位置符号化(相対的な点位置およびユークリッド距離)を注目メカニズムに統合し、空間認識能力を向上させる。
  • Farthest-Point Samplingの高い計算コストを回避するため、効率的な特徴抽出のためのランダムサンプリングを採用する。
  • エンコーダ-デコーダアーキテクチャにDLAモジュールを統合し、エンドツーエンドのセマンティックセグメンテーションを実現するDLA-Netを構築する。
  • 大規模点群における細粒度のディテールを保持するためのマルチスケール特徴集約戦略を採用する。
  • クエリポイント、キーポイント、相対的位置、距離を組み合わせた構成により、位置符号化ブロックを設計する。

実験結果

リサーチクエスチョン

  • RQ1学習可能な注目メカニズムは、大規模な3次元建物ファサード点群における局所的な幾何学的・構造的特徴を効果的に捉えることができるか?
  • RQ2相対的位置符号化の統合は、点群セグメンテーションにおける注目ベースの特徴抽出にどのように寄与するか?
  • RQ3分類精度を最大化するために、位置符号化ブロックにおける空間的情報の最適な構成は何か?
  • RQ4DLA-Netアーキテクチャは、大規模で細分化された建物ファサードベンチマークにおいて、最先端手法と比較してどのように差をつけるか?
  • RQ5注意プーリングブロックは、特徴の精錬およびセグメンテーション性能にどの程度寄与しているか?

主な発見

  • DLA-Netは、新しく構築されたベンチマークのテストセットにおいて、平均交差率(mIoU)68.2%を達成し、最先端手法を上回る性能を示した。
  • アブレーションスタディの結果、位置符号化ブロックに相対的位置とユークリッド距離を併用することで最良の性能が得られ、mIoUが59.7%に上昇した。
  • 自己注意ブロックのマッピング関数および変換された特徴の両方に位置符号化ブロックを追加した場合が最も高い性能(mIoU: 68.2%)を示した。
  • 注意プーリングブロックを削除するか、最大/平均プーリングに置き換えると性能が著しく低下し、その重要性が確認された。
  • 注意プーリングブロックにおける位置符号化ブロックの追加により、完全に削除した場合と比較してmIoUが3.5ポイント向上した。
  • 完全なDLA-Netは、全体の正確度(OA)83.9%および平均正確度(mAcc)81.4%を達成し、複雑なファサードシーンにおける優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。