Skip to main content
QUICK REVIEW

[논문 리뷰] Domain Adaptation via Bidirectional Cross-Attention Transformer

Xiyu Wang, Pengxin Guo|arXiv (Cornell University)|2022. 01. 15.
Domain Adaptation and Few-Shot Learning인용 수 13
한 줄 요약

이 논문은 도메인 적응을 위해 이중 방향 교차 주의 트랜스포머(BCAT)를 제안하며, 소스 및 타겟 표현을 암묵적으로 혼합함으로써 도메인 불변 특징을 학습하기 위해 가중치 공유 사중 트랜스포머와 이중 방향 교차 주의를 활용한다. BCAT는 공동 자기 주의 및 교차 주의 메커니즘과 MMD 정규화를 통해 도메인 간 격차를 효과적으로 줄여 네 가지 벤치마크 데이터셋에서 최신 기술 성능(SOTA)을 달성한다.

ABSTRACT

Domain Adaptation (DA) aims to leverage the knowledge learned from a source domain with ample labeled data to a target domain with unlabeled data only. Most existing studies on DA contribute to learning domain-invariant feature representations for both domains by minimizing the domain gap based on convolution-based neural networks. Recently, vision transformers significantly improved performance in multiple vision tasks. Built on vision transformers, in this paper we propose a Bidirectional Cross-Attention Transformer (BCAT) for DA with the aim to improve the performance. In the proposed BCAT, the attention mechanism can extract implicit source and target mixup feature representations to narrow the domain discrepancy. Specifically, in BCAT, we design a weight-sharing quadruple-branch transformer with a bidirectional cross-attention mechanism to learn domain-invariant feature representations. Extensive experiments demonstrate that the proposed BCAT model achieves superior performance on four benchmark datasets over existing state-of-the-art DA methods that are based on convolutions or transformers.

연구 동기 및 목표

  • 기존 트랜스포머 기반 도메인 적응 모델에서 단방향 주의의 한계를 해결하기 위해 소스 및 타겟 도메인 간 이중 방향 특징 상호작용을 가능하게 하기 위해.
  • 자기 주의와 교차 주의를 공유 아키텍처에서 결합하여 더 나은 특징 정렬을 위한 도메인 불변 표현 학습을 향상시키기 위해.
  • 엄격한 의사 레이블링 제약에 의존하지 않고 도메인 간 격차를 줄여 실제 도메인 적응 시나리오에 더 넓은 적용 가능성을 확보하기 위해.
  • 기존의 컨volutional 및 트랜스포머 기반 최신 기술(SOTA) 방법보다 표준 벤치마크 데이터셋에서 뛰어난 성능을 달성하기 위해.

제안 방법

  • 각 도메인에 대해 자기 주의를 통합하고 도메인 간 이중 방향 교차 주의를 통해 증강된 특징 표현을 생성하는 사중 트랜스포머 블록을 제안한다.
  • 모든 네 개의 브랜치(소스 자기 주의, 타겟 자기 주의, 소스 → 타겟, 타겟 → 소스) 간 가중치 공유 아키텍처를 적용하여 파rameter 효율성과 도메인 대칭성을 확보한다.
  • 소스 및 타겟 특징 표현 간 도메인 이동을 최소화하기 위해 최대 평균 격차(MMD) 손실을 사용한다.
  • 메모리와 추론 시간을 줄이면서 성능를 유지하기 위해 두 가지 효율적인 추론 모델—지식 증류(BCAT-KD)와 동적 토큰 융합(BCAT-DTF)—을 도입한다.
  • 학습 중에 클래스 매칭 미니배치가 필요 없도록 엔드 투 엔드로 자기 지율 방식으로 모델을 적용한다.
  • 장거리 컨텍스트 모델링과 향상된 특징 분류 능력을 위해 시각 트랜스포머 백본(ViT 및 Swin)을 특징 추출기로 활용한다.

실험 결과

연구 질문

  • RQ1단방향 주의와 비교해 소스 및 타겟 도메인 간 이중 방향 교차 주의가 도메인 불변 표현 학습에 더 나은 성능을 내는가?
  • RQ2공유 가중치를 가진 제안된 사중 트랜스포머 블록이 도메인 적응에서 특징 정렬과 이동 가능성에 어떻게 기여하는가?
  • RQ3자기 주의와 이중 방향 교차 주의를 통합하면 자기 주의 전용 또는 단방향 교차 주의 대비 더 나은 성능을 내는가?
  • RQ4제안된 BCAT 모델이 ResNets 및 시각 트랜스포머 기반 최신 기술(SOTA) 방법보다 표준 도메인 적응 벤치마크에서 승리할 수 있는가?
  • RQ5제안된 추론 시간 최적화(BCAT-KD 및 BCAT-DTF)는 정확도를 희생시키지 않고 메모리 사용량과 추론 시간을 얼마나 효과적으로 줄이는가?

주요 결과

  • BCAT는 네 가지 벤치마크 데이터셋인 Office-Home, VisDA-2017, DomainNet에서 최신 기술 성능(SOTA)을 달성했으며, DomainNet에서 평균 정확도 86.5%, Office-Home에서 85.5%를 기록했다.
  • 제안된 이중 방향 교차 주의 메커니즘이 단방향 교차 주의 및 자기 주의 전용 기준 모델보다 뛰어난 성능을 보이며 암묵적 특징 혼합의 효과를 입증했다.
  • BCAT-KD 및 BCAT-DTF 추론 모델은 전체 BCAT 모델 대비 최대 50%의 GPU 메모리 사용량을 줄이고 추론 속도를 3배 이상 향상시켰으며, 정확도는 유사하게 유지했다.
  • MMD 손실과 의사 레이블링 전략이 함께 성능 향상을 이끌었으며, MMD는 모든 데이터셋과 모델에서 일관된 성능 향상을 보였다.
  • 주의 맵의 시각화 결과 BCAT는 소스 전용 기준 모델 대비 더 정확하게 관련 객체 영역에 집중하고 배경 노이즈를 억제하는 것으로 확인되었다.
  • 제거 분석 결과 이중 방향 교차 주의와 자기 주의를 결합한 조합이 가장 높은 성능를 기록하여 내부 및 외부 도메인 주의 간 상호보완적 상호작용의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.