Skip to main content
QUICK REVIEW

[論文レビュー] QuadFormer: Quadruple Transformer for Unsupervised Domain Adaptation in Power Line Segmentation of Aerial Images

Pratyaksh Prabhav Rao, Feng Qiao|arXiv (Cornell University)|Nov 29, 2022
Advanced Neural Network Applications被引用数 5
ひとこと要約

本稿では、合成(ソース)および実際の(ターゲット)空中画像間の特徴を自己適応的にアライメントするために、クロスアテンションと自己アテンションメカニズムを活用する階層的4重変換器アーキテクチャであるQuadFormerを提案する。自己学習に基づく弱教師ありドメイン適応において、オンラインで偽ラベルを補正するクロスドメインの文脈を統合することで、最先端の性能を達成し、ARPLSyn → ARPLRealで44.25 mIoU、ARPLSyn → TTPLAで46.32 mIoUを達成した。

ABSTRACT

Accurate segmentation of power lines in aerial images is essential to ensure the flight safety of aerial vehicles. Acquiring high-quality ground truth annotations for training a deep learning model is a laborious process. Therefore, developing algorithms that can leverage knowledge from labelled synthetic data to unlabelled real images is highly demanded. This process is studied in Unsupervised domain adaptation (UDA). Recent approaches to self-training have achieved remarkable performance in UDA for semantic segmentation, which trains a model with pseudo labels on the target domain. However, the pseudo labels are noisy due to a discrepancy in the two data distributions. We identify that context dependency is important for bridging this domain gap. Motivated by this, we propose QuadFormer, a novel framework designed for domain adaptive semantic segmentation. The hierarchical quadruple transformer combines cross-attention and self-attention mechanisms to adapt transferable context. Based on cross-attentive and self-attentive feature representations, we introduce a pseudo label correction scheme to online denoise the pseudo labels and reduce the domain gap. Additionally, we present two datasets - ARPLSyn and ARPLReal to further advance research in unsupervised domain adaptive powerline segmentation. Finally, experimental results indicate that our method achieves state-of-the-art performance for the domain adaptive power line segmentation on ARPLSyn$ ightarrow$TTTPLA and ARPLSyn$ ightarrow$ARPLReal.

研究の動機と目的

  • 無人航空機(UAV)の飛行安全に不可欠であるが、高品質な実世界のアノテーションが不足している空中画像における正確な送電線セグメンテーションの課題に対処すること。
  • 照明、色彩、背景の違いによりモデルの一般化性能が低下する、合成(ソース)と実際の(ターゲット)空中画像間のドメインシフトを軽減すること。
  • ドメイン間の文脈的依存関係を活用することで、自己学習に基づく弱教師ありドメイン適応における偽ラベル品質を向上させ、ノイズと分布の乖離を低減すること。
  • 2つの新しいデータセット、高品質なアノテーションを備えた合成データのARPLSynと実データのARPLRealをリリースすることで、ドメイン適応型送電線セグメンテーション分野の研究を促進すること。

提案手法

  • 各ドメイン内での自己アテンションとドメイン間でのクロスアテンションを統合した階層的4重変換器を設計し、転送可能で文脈に敏感な特徴表現を学習すること。
  • ソースとターゲットの特徴間にクロスアテンションを統合することで、ドメイン間の文脈的依存関係をモデル化し、意味的分布のアライメントとドメインシフトの低減を実現すること。
  • トレーニング中にノイズの多い偽ラベルを改善するため、クロスアテンティブプロトタイプを用いたオンライン偽ラベル補正メカニズムを実装し、ラベルの一貫性と耐障害性を向上させること。
  • マルチステージトレーニング戦略を採用:まずソースドメインで事前学習を行い、次にターゲットドメインで反復的な偽ラベル生成と補正を伴う自己学習を適用すること。
  • トレーニングの安定化とドメイン間の特徴分布のさらなるアライメントを図るため、一貫性正則化と敵対的損失を適用すること。
  • 性能評価のため、軽量バックボーン(例:MiT-B0)で学習を開始し、徐々に大きなアーキテクチャ(例:MiT-B5)にスケーリングすること。

実験結果

リサーチクエスチョン

  • RQ1クロスアテンションによるドメイン間文脈モデリングは、送電線セグメンテーションにおける弱教師ありドメイン適応において、ドメインシフトを顕著に低減できるか?
  • RQ2クロスアテンティブプロトタイプを用いたオンライン偽ラベル補正は、ラベルなし実画像におけるセグメンテーション精度をどの程度向上できるか?
  • RQ3階層的アテンション統合(自己アテンションとクロスアテンションの併用)は、細く断続的な構造(例:送電線)の特徴表現学習をどの程度向上できるか?
  • RQ4本手法は、多様な実世界の空中シーンにわたるドメイン一般化性能において、既存の最先端手法と比較してどの程度優れているか?
  • RQ5各構成要素(自己アテンション、クロスアテンション、敵対的損失、偽ラベルノイズ除去)がターゲットドメインでの最終的性能にどの程度寄与しているか?

主な発見

  • QuadFormerは、ARPLSyn → TTPLAの適応ベンチマークで46.32 mIoUという最先端のmIoUを達成し、先行手法を大きく上回った。
  • より困難なARPLSyn → ARPLRealベンチマークでは、44.25 mIoUを達成し、照明、ズーム、背景の複雑な実世界の変動に対しても強いロバストネスを示した。
  • アブレーションスタディの結果、ソースおよびターゲット特徴の両方にクロスアテンションを統合した場合が最高の性能(39.65 mIoU)を示し、ドメイン間文脈モデリングの重要性を確認した。
  • 提案されたオンライン偽ラベル補正メカニズムが最大の性能向上をもたらし、ソースのみのベースライン(25.67 → 39.65)からmIoUを14.0%向上させた。
  • アブレーションスタディの結果、自己アテンション、敵対的損失、偽ラベルノイズ除去の組み合わせが最良の性能をもたらし、各構成要素がドメインアライメントに段階的に寄与していることが確認された。
  • 定性的な結果では、特に背景がごちゃごちゃした複雑なシーンにおいて、QuadFormerがベースラインモデルよりも一貫性があり、断片化の少ない送電線予測を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。