[論文レビュー] Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation
本稿では、360°等角投影画像における顕著な画像歪みと物体変形に対処する歪みに配慮したビジョン変換器、Trans4PASS+ を提案する。このモデルは、可変パッチ埋め込み(DPE)と可変MLP(DMLPv2)を統合し、歪みに強い特徴表現を実現する。さらに、偽ラベル補正を施した相互プロトタイプ適応(MPA)戦略を導入し、教師なしドメイン適応を実現。Pinhole-to-PanoramicおよびSynthetic-to-Realの両適応スキームを用いて4つのベンチマークで最先端性能を達成し、新規データセットであるSynPASSを支援として用いる。
In this paper, we address panoramic semantic segmentation which is under-explored due to two critical challenges: (1) image distortions and object deformations on panoramas; (2) lack of semantic annotations in the 360° imagery. To tackle these problems, first, we propose the upgraded Transformer for Panoramic Semantic Segmentation, i.e., Trans4PASS+, equipped with Deformable Patch Embedding (DPE) and Deformable MLP (DMLPv2) modules for handling object deformations and image distortions whenever (before or after adaptation) and wherever (shallow or deep levels). Second, we enhance the Mutual Prototypical Adaptation (MPA) strategy via pseudo-label rectification for unsupervised domain adaptive panoramic segmentation. Third, aside from Pinhole-to-Panoramic (Pin2Pan) adaptation, we create a new dataset (SynPASS) with 9,080 panoramic images, facilitating Synthetic-to-Real (Syn2Real) adaptation scheme in 360° imagery. Extensive experiments are conducted, which cover indoor and outdoor scenarios, and each of them is investigated with Pin2Pan and Syn2Real regimens. Trans4PASS+ achieves state-of-the-art performances on four domain adaptive panoramic semantic segmentation benchmarks. Code is available at https://github.com/jamycheung/Trans4PASS.
研究の動機と目的
- 等角投影によるパノラマセマンティックセグメンテーションにおける画像歪みと物体変形の課題に対処する。
- 360°画像における高密度セマンティックアノテーションの不足を解消するため、教師なしドメイン適応(UDA)を可能にする。
- さまざまな視野(FoV)およびドメインシフトに一般化可能な強力なモデルアーキテクチャを開発する。
- 360°シーンにおけるSynthetic-to-Real(Syn2Real)ドメイン適応を支援する新しい合成パノラマデータセット、SynPASSを構築する。
- 相互プロトタイプ学習を活用し、ラベル付きソースデータと偽ラベル付きターゲットデータを統合的に活用することで、ドメイン適応性能を向上させる。
提案手法
- パッチ化プロセス中にパノラマ固有のインダクティブバイアスを学習するための可変パッチ埋め込み(DPE)を提案。歪み下でも特徴表現の向上を実現する。
- 並列トークンミキシングを備えた可変MLP(DMLPv2)を導入。浅い層と深い層の両方で特徴の精錬を強化し、視野(FoV)変動に対する耐性を向上させる。
- ソースドメインおよびターゲットドメインからの相互プロトタイプを用いて、特徴空間と出力空間の両方の整合性を同時に最適化する相互プロトタイプ適応(MPA)を提案。
- MPAに偽ラベル補正を適用し、不完全または不正確な偽ラベルに起因するノイズを低減。実世界のターゲットドメインにおける一般化性能を向上。
- 360°シーンにおける教師あり学習とSyn2Realドメイン適応を可能にする、9,080枚のパノラマ画像から構成される新規データセットであるSynPASSを導入。
- 二重適応パラダイム(ピンホールからパノラマへの変換:Pin2Pan、および合成から実世界への変換:Syn2Real)を採用。より広範なドメインシフトへの一般化を実現。
実験結果
リサーチクエスチョン
- RQ1ビジョン変換器アーキテクチャは、360°パノラマ画像における顕著な幾何的歪みと物体変形を効果的に処理できるように適応可能か?
- RQ2ラベル付きターゲットデータが入手不可である場合、パノラマセマンティックセグメンテーションにおける教師なしドメイン適応をどのように改善できるか?
- RQ3ソースドメインおよびターゲットドメインからの相互プロトタイプ学習は、パノラマセグメンテーションにおけるドメインシフトをどの程度低減できるか?
- RQ4新規の合成パノラマデータセット(SynPASS)は、合成から実世界への360°シーンへのドメイン一般化を効果的に支援できるか?
- RQ5歪みに配慮したモジュールとMPAの統合は、多様なドメインおよび視野(FoV)において一貫した性能向上をもたらすか?
主な発見
- Trans4PASS+ は、Pin2PanおよびSyn2Realの両設定を含む4つのドメイン適応パノラマセマンティックセグメンテーションベンチマークで最先端性能を達成した。
- 視野(FoV)が狭いものから360°に変化する中でも、mIoUが安定した性能を維持し、視野変動に対する耐性を示した。
- ソースのみの設定においても、屋内(SPin → SPan)および屋外(CS → DP)の両ドメインで顕著なmIoU向上を達成。内在的な耐性を示した。
- MPA戦略により、教師なしモデルがSAMベースの自己教師あり学習および従来の完全教師ありモデルを上回る性能をターゲットドメインで達成した。
- t-SNE可視化により、MPAがソースドメインとターゲットドメインの特徴分布を効果的に統合しており、相互プロトタイプが特徴空間で近づいていることが確認された。
- SynPASSを活用したSyn2Real適応スキームは、形状とテクスチャが一貫した物体の認識において優れた性能を示した。一方、Pin2Panは、交通標識のような豊富なテクスチャを持つ物体の検出に優れた性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。