Skip to main content
QUICK REVIEW

[논문 리뷰] Prompt Vision Transformer for Domain Generalization

Zangwei Zheng, Xiangyu Yue|arXiv (Cornell University)|2022. 08. 18.
Domain Adaptation and Few-Shot Learning인용 수 16
한 줄 요약

이 논문은 도메인 특화 프롬프트와 프롬프트 어댑터를 사용하여 미리 학습되지 않은 도메인으로의 제로샷 일반화 성능을 향상시키는 새로운 도메인 일반화 방법인 DoPrompt를 제안한다. 학습 중에 도메인 프롬프트를 학습하고 추론 시 도메인 어댑터를 통해 동적으로 이를 조정함으로써, ViT 기반으로 기존 최고 성능(SOTA) 대비 평균 정확도 1.4% 향상 및 이전 방법 대비 향상 폭의 3.5배를 달성한다.

ABSTRACT

Though vision transformers (ViTs) have exhibited impressive ability for representation learning, we empirically find that they cannot generalize well to unseen domains with previous domain generalization algorithms. In this paper, we propose a novel approach DoPrompt based on prompt learning to embed the knowledge of source domains in domain prompts for target domain prediction. Specifically, domain prompts are prepended before ViT input tokens from the corresponding source domain. Each domain prompt learns domain-specific knowledge efficiently since it is optimized only for one domain. Meanwhile, we train a prompt adapter to produce a suitable prompt for each input image based on the learned source domain prompts. At test time, the adapted prompt generated by the prompt adapter can exploit the similarity between the feature of the out-of-domain image and source domains to properly integrate the source domain knowledge. Extensive experiments are conducted on four benchmark datasets. Our approach achieves 1.4% improvements in the averaged accuracy, which is 3.5 times the improvement of the state-of-the-art algorithm with a ViT backbone.

연구 동기 및 목표

  • 도메인 이동 상황에서 비전 트랜스포머의 낮은 도메인 일반화 성능을 해결하기 위해.
  • 원천 도메인에서 도메인 특화 지식을 학습하여 제로샷 일반화 성능을 향상시키기 위해.
  • 추론 시 미리 알 수 없는 타겟 도메인에 대해 원천 도메인 지식을 적응적으로 통합할 수 있는 메커니즘을 개발하기 위해.
  • 이전 도메인 일반화 방법이 일부 네트워크 파라미터나 정적 앙상블만 사용하는 한계를 극복하기 위해.
  • 비전 트랜스포머의 백본을 파인튜닝하지 않고도 효과적인 프롬프트 기반 적응을 가능하게 하기 위해.

제안 방법

  • 학습 중에 이미지 패치 토큰 앞에 도메인 특화 프롬프트를 추가하여, 각 프롬프트가 자기 주의(self-attention)를 통해 도메인 특화 지식을 학습하도록 한다.
  • 입력 이미지의 특징을 입력으로 받아 원천 도메인 프롬프트의 가중 조합을 생성하는 프롬프트 어댑터 네트워크를 훈련한다.
  • 도메인 특징을 구분하는 데 목적이 있는 손실과 타겟 도메인에서의 예측 정확도 향상을 위한 손실을 두 가지 손실로 최적화한다.
  • 테스트 시 적응된 프롬프트를 사용해 도메인 유사도에 기반해 여러 원천 도메인의 지식을 동적으로 통합한다.
  • 프롬프트 어댑터와 도메인 프롬프트를 포함해 전체 모델을 엔드 투 엔드로 파인튜닝하여 일반화 성능을 향상시킨다.
  • ViT의 자기 주의 메커니즘을 활용해 프롬프트 토큰이 모든 레이어와 상호작용하도록 하여 풍부한 특징 이해를 가능하게 한다.

실험 결과

연구 질문

  • RQ1프롬프트 학습이 비전 트랜스포머에서 도메인 일반화를 위한 도메인 특화 지식을 효과적으로 포착할 수 있는가?
  • RQ2학습 가능한 프롬프트 어댑터가 원천 도메인 지식을 동적으로 통합함으로써 제로샷 일반화 성능을 향상시키는가?
  • RQ3ViT 백본을 사용할 때 DoPrompt가 SOTA 방법 대비 정확도와 일반화 성능 향상 면에서 어떻게 비교되는가?
  • RQ4도메인 프롬프트와 프롬프트 어댑터가 성능에 기여하는 정도는 어느 정도이며, 둘 다 필수적인가?
  • RQ5프롬프트 어댑터가 원천 도메인과 타겟 도메인 간의 도메인 유사도를 반영할 수 있는가?

주요 결과

  • DoPrompt는 ViT-Base 기반으로 SOTA 기준 대비 평균 정확도 1.4% 향상되었으며, 이는 이전 최고 성능 향상 폭 대비 3.5배 높은 성과이다.
  • 프롬프트 어댑터는 성능 향상에 크게 기여하며, 제거 시 평균 정확도가 1.2% 감소한다(OfficeHome에서 76.0% → 74.8%).
  • 제거 실험 결과 도메인 프롬프트와 프롬프트 어댑터 모두 필수적임을 확인하였으며, 도메인 프롬프트를 제거하면 성능이 1.7% 감소한다.
  • 가중치 분석 결과 프롬프트 어댑터는 타겟 도메인과 더 유사한 원천 도메인에 더 높은 가중치를 할당하는 경향을 보이며, 예를 들어 클리퍼트 타겟 도메인에 대해 아트 도메인을 우선순위로 삼는다.
  • 백본을 파인튜닝하지 않고 프롬프트 튜닝만 사용할 경우 정확도가 2.0% 감소한다(74.0% 대비 76.0%), 이는 전체 파인튜닝이 필요함을 시사한다.
  • 적응된 프롬프트는 모든 타겟 도메인에서 개별 원천 도메인 프롬프트보다 뛰어난 성능을 보이며, 어댑터가 상황 인식형 프롬프트를 생성할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.