[논문 리뷰] Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
이 논문은 블랙박스 설정에서 시각-언어 모델(VLM)을 학생 모델에 희석시키는 방식으로 이미지 분류에서 분포 외(OOD) 일반화를 향상시키기 위해 VL2V-ADiP를 제안한다. 희석 전에 학생의 시각적 특징을 VLM의 이미지 및 텍스트 임베딩과 정렬함으로써, 학생의 사전 훈련된 특징을 유지하면서도 OOD 성능을 크게 향상시켰으며, 도메인 일반화 벤치마크에서 최신 기술 성능(SOTA)을 달성하였다.
Vision-Language Models (VLMs) such as CLIP are trained on large amounts of image-text pairs, resulting in remarkable generalization across several data distributions. However, in several cases, their expensive training and data collection/curation costs do not justify the end application. This motivates a vendor-client paradigm, where a vendor trains a large-scale VLM and grants only input-output access to clients on a pay-per-query basis in a black-box setting. The client aims to minimize inference cost by distilling the VLM to a student model using the limited available task-specific data, and further deploying this student model in the downstream application. While naive distillation largely improves the In-Domain (ID) accuracy of the student, it fails to transfer the superior out-of-distribution (OOD) generalization of the VLM teacher using the limited available labeled images. To mitigate this, we propose Vision-Language to Vision - Align, Distill, Predict (VL2V-ADiP), which first aligns the vision and language modalities of the teacher model with the vision modality of a pre-trained student model, and further distills the aligned VLM representations to the student. This maximally retains the pre-trained features of the student, while also incorporating the rich representations of the VLM image encoder and the superior generalization of the text embeddings. The proposed approach achieves state-of-the-art results on the standard Domain Generalization benchmarks in a black-box teacher setting as well as a white-box setting where the weights of the VLM are accessible.
연구 동기 및 목표
- 사용 가능한 레이블이 있는 이미지 외에 VLM의 가중치나 아키텍처에 접근할 수 없는 블랙박스 환경에서, 학생 모델의 OOD 일반화 성능이 떨어지는 문제를 해결하기 위해.
- 레이블이 있는 이미지만 이용 가능한 상황에서, VLM의 강건성을 단일 모odal 학생 모델로 효과적으로 전이할 수 있는 방법을 탐구하기 위해.
- VLM의 가중치나 전체 아키텍처에 접근하지 않고도, VLM의 이미지 및 텍스트 임베딩을 모두 활용할 수 있는 방법을 개발하기 위해.
- 희석된 학생 모델의 OOD 성능을 향상시키면서도 사전 훈련된 특징을 유지하고 추론 비용을 최소화하기 위해.
- 블랙박스 및 전체 액세스 설정 모두에서 도메인 일반화에서 최신 기술 성능을 입증하기 위해.
제안 방법
- VLM에서 단일 모odal 학생 모델로의 희석을 위해 설계된 세 단계 프레임워크인 VL2V-ADiP를 제안한다: 시각-언어에서 시각 정렬, 희석, 예측.
- 첫 번째 단계에서, 대조적 정렬 목적함수를 사용하여 학생의 시각적 특징을 VLM의 이미지 및 텍스트 임베딩과 정렬한다.
- 두 번째 단계에서, 학생의 특징과 VLM의 이미지 및 텍스트 임베딩 간의 가중치가 부여된 코사인 유사도 손실을 사용하여 정렬된 VLM 임베딩을 학생 모델로 희석한다.
- 손실 함수는 두 모odal의 감독을 통합한다: $\mathcal{L} = -\frac{1}{2n}\sum_{i=1}^{n}\big{(}(1-\lambda)\cdot\cos(\mathbf{PF}^{s}_{x_{i}},\mathbf{T}_{y_{i}}) + \lambda\cdot\cos(\mathbf{PF}^{s}_{x_{i}},\mathbf{I}^{t}_{x_{i}})\big{)}$, $\lambda = 0.5$를 기본값으로 사용한다.
- VLM의 전체 파라미터나 내부 구조에 접근하지 않고도, ImageNet-1K에서 사전 훈련된 학생 모델을 사용하여 VLM의 풀 테이닝을 방지하며, 가중치 공유도 요구하지 않는다.
- 이 방법을 통해 VLM의 텍스트 임베딩을 추가 훈련 없이도 학생 모델의 분류기로 직접 사용할 수 있어, OOD 강건성이 향상된다.
실험 결과
연구 질문
- RQ1레이블이 있는 이미지만 이용 가능한 상황에서, VLM의 뛰어난 OOD 일반화 성능이 단일 모달 학생 모델로 효과적으로 전이될 수 있는가?
- RQ2이미지 임베딩만 사용하는 것과 비교해, VLM의 텍스트 임베딩이 OOD 강건성 향상에 어떤 역할을 하는가?
- RQ3제한된 데이터에서 블랙박스 VLM와 학생 모델 간의 특징 정렬이 희석 성능 향상에 어떻게 기여하는가?
- RQ4희석 과정에서 이미지 및 텍스트 임베딩 감독을 균형 있게 융합하면, 이미지만 사용하는 경우보다 OOD 일반화 성능이 향상되는가?
- RQ5VLM에 접근할 수 없는 상황에서, 자기 희석 기법이 OOD 일반화 성능 향상에 기여하는가? 그리고 직접 VLM에서 희석하는 것과 비교해 어떻게 성능을 내는가?
주요 결과
- Office-Home 데이터셋에서 VL2V-ADiP는 도메인 간 평균 OOD 정확도 81.89%를 기록하여, 이전 방법들인 SAGM(79.60%) 및 DART(77.29%)를 능가하는 최신 기술 성능을 달성하였다.
- PACS 데이터셋에서 VL2V-ADiP는 평균 OOD 정확도 96.68%를 기록하여, 다음으로 우수한 방법인 SAGM(94.30%)을 초월했으며, ERM 테일링(91.35%)에 비해 뚜렷한 우수성을 보였다.
- DomainNet에서 VL2V-ADiP는 CLIP 초기화로 평균 OOD 정확도 62.79%를 기록하여, SAGM(59.05%) 및 DART(59.32%)를 능가했으며, 극단적으로 이격된 도메인에서도 강력한 성능을 보였다.
- 최대 도메인 이격이 발생하는 도메인—예를 들어 ClipArt(OH), Infograph(DN), Painting(OH)—에서 가장 높은 성과 향상을 보였으며, 이는 VLM의 강건성 전이가 효과적으로 이루어졌음을 시사한다.
- 절단 실험 결과, 이미지 및 텍스트 임베딩 손실에 대해 동일한 가중치($\lambda = 0.5$)를 부여할 경우, 다양한 데이터셋에서 안정적인 성능을 기록하며 하이퍼파rameter 조정에 대한 민감도가 매우 낮음을 확인하였다.
- VL2V-ADiP는 VLM이 블랙박스 인fer런스를 통해만 접근 가능한 상황에서도 강력한 성능을 유지하여, 벤더-클라이언트 환경에서의 실질적 구현 가능성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.