Skip to main content
QUICK REVIEW

[논문 리뷰] Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation

Jiaming Zhang, Kailun Yang|arXiv (Cornell University)|2022. 07. 25.
Advanced Neural Network Applications인용 수 12
한 줄 요약

이 논문은 360° 등경도 이미지에서 심각한 이미지 왜곡과 물체 변형을 다루기 위해 왜곡 인지 Vision Transformer인 Trans4PASS+를 제안한다. 이는 Deformable Patch Embedding(DPE)와 Deformable MLP(DMLPv2)를 통합하여 구현되며, 비순차적 도메인 적응을 위한 상호 원형 적응(MPA) 전략과 가짜 레이블 보정 기법을 도입하여, Pinhole-to-Panoramic 및 Synthetic-to-Real 적응 방식을 모두 활용한 네 가지 벤치마크에서 최신 기술 수준 성능을 달성한다. 이는 새로운 데이터셋인 SynPASS를 통해 뒷받 dri된 것이다.

ABSTRACT

In this paper, we address panoramic semantic segmentation which is under-explored due to two critical challenges: (1) image distortions and object deformations on panoramas; (2) lack of semantic annotations in the 360° imagery. To tackle these problems, first, we propose the upgraded Transformer for Panoramic Semantic Segmentation, i.e., Trans4PASS+, equipped with Deformable Patch Embedding (DPE) and Deformable MLP (DMLPv2) modules for handling object deformations and image distortions whenever (before or after adaptation) and wherever (shallow or deep levels). Second, we enhance the Mutual Prototypical Adaptation (MPA) strategy via pseudo-label rectification for unsupervised domain adaptive panoramic segmentation. Third, aside from Pinhole-to-Panoramic (Pin2Pan) adaptation, we create a new dataset (SynPASS) with 9,080 panoramic images, facilitating Synthetic-to-Real (Syn2Real) adaptation scheme in 360° imagery. Extensive experiments are conducted, which cover indoor and outdoor scenarios, and each of them is investigated with Pin2Pan and Syn2Real regimens. Trans4PASS+ achieves state-of-the-art performances on four domain adaptive panoramic semantic segmentation benchmarks. Code is available at https://github.com/jamycheung/Trans4PASS.

연구 동기 및 목표

  • 등경도 투영으로 인한 이미지 왜곡과 물체 변형 문제를 해결하기 위해, 원형 시각적 세그멘테이션에서 발생하는 과제를 해결한다.
  • 360° 영상에서의 정밀 세그멘테이션 레이블의 부족 문제를 해결하기 위해 비지도 도메인 적응(UDA)을 가능하게 한다.
  • 다양한 시야각(FoV)과 도메인 이동에 일반화되는 강력한 모델 아키텍처를 개발한다.
  • 합성된 원형 영상 데이터셋인 SynPASS를 제작하여, 360° 환경에서의 합성에서 실세계로의 도메인 적응(Syn2Real)을 지원한다.
  • 상호 원형 학습을 통해 레이블이 있는 소스 데이터와 가짜 레이블이 있는 타겟 데이터를 동시에 활용하여 도메인 적응 성능을 향상시킨다.

제안 방법

  • 패치화 과정에서 원형에 특화된 인덕티브 바이어스를 학습하기 위해 Deformable Patch Embedding(DPE)을 제안하여 왜곡 하에서의 특징 표현을 향상시킨다.
  • 얕은 층과 깊은 층 모두에서 특징 정제를 향상시키기 위해 병렬 토큰 믹싱을 갖춘 Deformable MLP(DMLPv2)를 도입하여 시야각 변화에 대한 강건성을 높인다.
  • 소스 도메인과 타겟 도메인의 상호 원형을 활용하여 특징 공간과 출력 공간의 정렬을 동시에 최적화하는 상호 원형 적응(MPA) 전략을 개발한다.
  • 가짜 레이블의 불완전성이나 정확도 부족으로 인한 노이즈를 줄이기 위해 MPA에 가짜 레이블 보정 기법을 적용하여 실제 타겟 도메인에서의 일반화 성능을 향상시킨다.
  • 9,080장의 원형 영상으로 구성된 새로운 데이터셋인 SynPASS를 제작하여, 360° 환경에서의 지도 학습과 Syn2Real 도메인 적응을 가능하게 한다.
  • 이중 적응 파라다임인 Pinhole-to-Panoramic(Pin2Pan)과 Synthetic-to-Real(Syn2Real)을 적용하여 더 넓은 도메인 이동 일반화를 달성한다.

실험 결과

연구 질문

  • RQ1Vision Transformer 아키텍처가 360° 원형 영상에서 심각한 기하학적 왜곡과 물체 변형을 효과적으로 다룰 수 있는가?
  • RQ2레이블이 없는 타겟 데이터에서 비지도 도메인 적응을 어떻게 향상시킬 수 있는가?
  • RQ3소스 도메인과 타겟 도메인 양쪽에서의 상호 원형 학습이 원형 세그멘테이션에서의 도메인 이동을 얼마나 줄일 수 있는가?
  • RQ4새로운 합성 원형 데이터셋(SynPASS)이 합성에서 실세계 360° 환경으로의 일반화를 효과적으로 지원할 수 있는가?
  • RQ5왜곡 인지 모듈과 MPA의 통합이 다양한 도메인과 시야각에서 일관된 성능 향상을 이끌 수 있는가?

주요 결과

  • Trans4PASS+는 Pin2Pan 및 Syn2Real 설정을 포함한 네 가지 도메인 적응 원형 세그멘테이션 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 모델은 다양한 시야각(FoV)에서도 안정적인 성능을 유지하며, 시야각이 좁은 것에서 360°로 확장되더라도 mIoU가 유연하게 유지된다.
  • 소스 전용 설정에서 Trans4PASS+는 실내(SPin → SPan)와 실외(CS → DP) 도메인 모두에서 상당한 mIoU 향상을 달성하여 내재된 강건성을 입증한다.
  • MPA 전략을 통해 비지도 모델이 SAM 기반의 자기지도 학습 및 이전의 완전 지도 학습 모델보다 타겟 도메인에서 더 뛰어난 성능을 내는 것을 확인했다.
  • t-SNE 시각화 결과, MPA가 소스 도메인과 타겟 도메인 간의 특징 분포를 성공적으로 정렬했으며, 상호 원형이 특징 공간에서 더욱 가까워짐을 확인했다.
  • Syn2Real 적응 방식은 SynPASS를 통해 강력한 성능을 보이며, 일관된 형태와 질감을 가진 물체를 인식하는 데 뛰어나다. 반면 Pin2Pan은 교통 표지와 같이 풍부한 질감을 가진 물체 탐지에 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.