Skip to main content
QUICK REVIEW

[논문 리뷰] Smoothing Matters: Momentum Transformer for Domain Adaptive Semantic Segmentation

Runfa Chen, Yu Rong|arXiv (Cornell University)|2022. 03. 15.
Domain Adaptation and Few-Shot Learning인용 수 8
한 줄 요약

이 논문은 GTA5→Cityscapes 및 SYNTHIA→Cityscapes 벤치마크에서 최신 기술 수준을 달성하며, 투명한 가속도 기반 Transformer 프레임워크인 TransDA를 제안한다. 이는 가속도 네트워크를 통해 가짜 레이블과 특징을 스무딩하여 학습 동역학을 안정화함으로써 도메인 적응형 세그멘테이션 성능을 향상시킨다. 결과적으로 60.6 mIoU와 +21.4의 적응 성과 향상을 기록한다.

ABSTRACT

After the great success of Vision Transformer variants (ViTs) in computer vision, it has also demonstrated great potential in domain adaptive semantic segmentation. Unfortunately, straightforwardly applying local ViTs in domain adaptive semantic segmentation does not bring in expected improvement. We find that the pitfall of local ViTs is due to the severe high-frequency components generated during both the pseudo-label construction and features alignment for target domains. These high-frequency components make the training of local ViTs very unsmooth and hurt their transferability. In this paper, we introduce a low-pass filtering mechanism, momentum network, to smooth the learning dynamics of target domain features and pseudo labels. Furthermore, we propose a dynamic of discrepancy measurement to align the distributions in the source and target domains via dynamic weights to evaluate the importance of the samples. After tackling the above issues, extensive experiments on sim2real benchmarks show that the proposed method outperforms the state-of-the-art methods. Our codes are available at https://github.com/alpc91/TransDA

연구 동기 및 목표

  • 지역적 비전 트랜스포머(ViTs)가 강력한 표현 능력을 지니고 있음에도 불구하고 도메인 적응형 세그멘테이션에서 성능 저하가 발생하는 이유를 조사하는 것.
  • 자기 학습 및 적대적 적응 과정에서 ViT 기반 모델의 불안정성의 근본 원인을 특정하는 것, 특히 가짜 레이블과 특징에서 고주파 성분으로 인한 영향을 분석하는 것.
  • 가속도 네트워크를 통한 저통과 필터링 메커니즘을 제안하여 타겟 도메인의 특징과 가짜 레이블 생성 과정에서의 학습 동역학을 안정화하는 것.
  • 적대적 정렬 과정에서 샘플 중요도를 적응적으로 가중하는 동적 불일치 측정 방식을 도입하여 도메인 일반화 능력을 향상시키는 것.
  • 학습 복잡도를 증가시키지 않고도 ViT 기반 도메인 적응형 세그멘테이션의 새로운 최신 기술 수준 기준을 설정하는 것.

제안 방법

  • 이 방법은 원천 도메인의 특징 추출기와 분류기를 천천히 이동하는 복제본을 유지하는 가속도 네트워크를 도입하여, 타겟 도메인의 스무딩된 가짜 레이블과 특징을 생성하는 데 사용된다.
  • 가속도 네트워크는 타겟 네트워크의 가중치에 지수 평균을 적용하여 예측값과 특징에서 고주파 노이즈를 억제하는 저통과 필터로 기능한다.
  • 이 프레임워크는 지식 정복과 적대적 학습을 통합하며, 원천 모델이 타겟 도메인에서 학생 모델에 안정적인 감독을 제공한다.
  • 적대적 특징 정렬 과정에서 샘플 중요도를 적응적으로 할당하는 동적 불일치 측정 전략을 제안하여 안정성과 수렴 성능을 향상시킨다.
  • 이 방법은 최소한의 아키텍처 변경으로 표준 자기 학습 및 적대적 학습 파이프라인에 통합되어, CNN 기반 베이스라인과의 직접 비교가 가능하다.

실험 결과

연구 질문

  • RQ1지역적 비전 트랜스포머가 강력한 표현 능력을 지니고 있음에도 불구하고 도메인 적응형 세그멘테이션에서 성능이 열등한 이유는 무엇인가?
  • RQ2자기 학습 및 타겟 도메인에서의 적대적 적응 과정에서 ViT 기반 모델의 불안정한 학습 동역학을 유발하는 원인은 무엇인가?
  • RQ3가짜 레이블과 특징에 저통과 필터링을 적용하면 ViT 기반 모델의 일반화 능력과 안정성 향상에 기여할 수 있는가?
  • RQ4밀도 예측 작업인 세그멘테이션과 같은 과제에서 전통적인 룩업 테이블 기반 필터링을 대체하기 위해 가속도 기반 메커니즘이 효과적으로 작용할 수 있는가?
  • RQ5특징 정렬 과정에서 샘플에 대한 가중치를 동적으로 조정하면 도메인 적응 성능을 추가로 향상시킬 수 있는가?

주요 결과

  • TransDA는 GTA5→Cityscapes 벤치마크에서 새로운 최신 기술 수준의 mIoU 60.6을 달성하여 이전 방법들보다 뚜렷한 성능 향상을 보였다.
  • TransDA의 적응 성과는 +21.4 mIoU(60.6 - 39.2)에 이르며, 이는 이전 최신 기술 수준 방법 ProDA를 +0.7 초월한 성과이다.
  • SYNTHIA→Cityscapes 벤치마크에서 TransDA는 62.2 mIoU의 성능을 기록했고, 적응 성과는 +24.5로 ProDA의 +23.4를 초월했다.
  • 절단 실험 결과, 가속도 계수 0.999가 최고의 성능(59.3 mIoU)을 내며, 이는 낮은 값이나 높은 값에서의 불안정성 또는 과도한 스무딩으로 인한 성능 저하를 방지함을 시사한다.
  • 시각화 결과 TransDA는 CNN 및 일반 ViT와 비교해 더 잘 분리되고 더 견고한 특징 표현을 도메인 간에 생성함을 확인했다.
  • 가속도 네트워크는 예측 값의 변동성을 효과적으로 억제하여, 연속된 예측 간 L1-거리가 감소함으로써 학습 반복 과정에서의 예측 변동성을 줄임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.