[논문 리뷰] Domain Adaptation via Prompt Learning
이 논문은 사전 훈련된 시각-언어 모델을 최소한의 학습 가능한 프롬프트 토큰만 최적화하여 사용하는 새로운 비지도 도메인 적응 방법인 프롬프트 학습을 통한 도메인 적응(DAPL)을 제안한다. 기존의 소스 도메인과 타겟 도메인의 특징을 정렬하는 방식이 아닌, 도메인별 특성과 도메인에 관계없는 프롬프트 컨텍스트를 사용하여 의미 구조를 유지하고 분류 정확도를 향상시킨다. 이로 인해 Office-Home과 VisDA-2017에서 각각 74.5%와 86.9%의 최고 성능을 기록하며 최신 기준(SOTA)을 달성한다.
Unsupervised domain adaption (UDA) aims to adapt models learned from a well-annotated source domain to a target domain, where only unlabeled samples are given. Current UDA approaches learn domain-invariant features by aligning source and target feature spaces. Such alignments are imposed by constraints such as statistical discrepancy minimization or adversarial training. However, these constraints could lead to the distortion of semantic feature structures and loss of class discriminability. In this paper, we introduce a novel prompt learning paradigm for UDA, named Domain Adaptation via Prompt Learning (DAPL). In contrast to prior works, our approach makes use of pre-trained vision-language models and optimizes only very few parameters. The main idea is to embed domain information into prompts, a form of representations generated from natural language, which is then used to perform classification. This domain information is shared only by images from the same domain, thereby dynamically adapting the classifier according to each domain. By adopting this paradigm, we show that our model not only outperforms previous methods on several cross-domain benchmarks but also is very efficient to train and easy to implement.
연구 동기 및 목표
- 기존의 비지도 도메인 적응(UDA) 방법이 도메인 정렬을 강제함으로써 의미 특징 구조를 왜곡하는 한계를 해결하기 위해.
- 특징 표현에서 의미 정보와 도메인 정보를 분리함으로써 클래스의 구분 능력을 유지하기 위해.
- 대부분의 기존 방법이 적대적 또는 통계적 도메인 정렬을 사용하는 대신 연속적인 프롬프트 토닝을 사용하는 프롬프트 학습 프레임워크를 제안하기 위해.
- 사전 훈련된 시각-언어 모델에 최소한의 파라미터 업데이트로 높은 성능을 달성하기 위해.
제안 방법
- DAPL은 공유된 도메인에 관계없는 컨텍스트, 도메인별 특화된 컨텍스트, 그리고 클래스 레이블 토큰으로 구성된 프롬프트를 설계한다.
- 도메인별 특화된 컨텍스트는 각 도메인에 맞게 학습되며, 분류기의 도메인 고유의 분포에 동적으로 적응할 수 있도록 한다.
- 일치하는 도메인-클래스 쌍의 경우 이미지와 텍스트 표현을 정렬하는 대비 학습 목표를 사용하고, 불일치하는 쌍은 서로 멀어지도록 유도한다.
- 백본으로 CLIP를 사용하며, 오직 프롬프트 임베딩만 미세조정하여 파라미터 효율성을 확보한다.
- 도메인에 관계없는 프롬프트와 도메인별 프롬프트를 함께 최적화하기 위해, 일치하는 도메인-클래스 쌍 내에서의 정렬을 장려하는 대비 손실을 사용한다.
- 학습 중 타겟 도메인의 레이블을 신뢰도 기준 임계치를 사용한 의사 레이블링을 통해 생성하여 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1프롬프트 학습이 비지도 도메인 적응에 효과적으로 적용될 수 있는가? 특히 도메인 정렬에 의한 특징 공간 왜곡을 피할 수 있는가?
- RQ2도메인별 특화된 프롬프트 컨텍스트를 도입함으로써 도메인 불변 특징 학습 없이도 일반화 성능 향상을 이룰 수 있는가?
- RQ3프롬프트를 통한 의미 정보와 도메인 정보의 분리가 클래스의 구분 능력과 모델 정확도에 어떤 영향을 미치는가?
- RQ4제안된 방법이 표준 UDA 벤치마크에서 CLIP와 같은 강력한 베이스라인을 얼마나 뛰어넘는가?
주요 결과
- DAPL은 Office-Home 데이터셋에서 74.5%의 상위-1 정확도로 최신 기준(SOTA) 성능을 기록하며, 강력한 CLIP 베이스라인 대비 2.5%p 향상되었다.
- VisDA-2017 벤치마크에서는 86.9%의 정확도를 달성하여 CLIP 베이스라인 대비 2.5%p 향상되었다.
- 절단 실험 결과 도메인별 컨텍스트가 필수적임을 확인하였으며, 도메인에 관계없는 컨텍스트만 사용하는 경우 대비 1.4%p 성능 향상이 있었다.
- 초기화 조정에 대해 매우 강건하여, 다양한 의사 레이블링 임계치(τ = 0.4에서 0.7)에서도 성능 저하가 최소한이었다.
- 다양한 프롬프트 길이 조합에서도 성능이 안정적이었으며, 효과적인 연속 표현을 학습하기 위해 소수의 토큰만 필요한 것으로 나타났다.
- 시각화 결과는 학습 가능한 프롬프트가 수작업으로 만든 프롬프트보다 더 확신 있고 정확한 예측을 도출함을 보여주었으며, 특히 모호하거나 복잡한 이미지에서 두드러진 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.