Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Zero-Shot Models with Label Distribution Priors

Jonathan Kahana, Niv Cohen|arXiv (Cornell University)|2022. 12. 01.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 레이블 데이터를 사용하지 않고 CLIP과 같은 제로샷 비전-언어 모델의 성능을 향상시키기 위해 레이블에 대한 사전 분포를 활용하는 CLIPPR를 제안한다. 이는 원래 CLIP의 제로샷 예측을 유지하면서 예측된 레이블 분포를 가정된 사전 분포와 일치시키는 것을 목표로 하는 어댑터 네트워크를 훈련함으로써 달성된다. 이로 인해 UTK 연령 회귀에서 평균 절대 오차(MAE)가 28% 감소했고, ImageNet 분류에서 정확도가 2.83% 향상되었다.

ABSTRACT

Labeling large image datasets with attributes such as facial age or object type is tedious and sometimes infeasible. Supervised machine learning methods provide a highly accurate solution, but require manual labels which are often unavailable. Zero-shot models (e.g., CLIP) do not require manual labels but are not as accurate as supervised ones, particularly when the attribute is numeric. We propose a new approach, CLIPPR (CLIP with Priors), which adapts zero-shot models for regression and classification on unlabelled datasets. Our method does not use any annotated images. Instead, we assume a prior over the label distribution in the dataset. We then train an adapter network on top of CLIP under two competing objectives: i) minimal change of predictions from the original CLIP model ii) minimal distance between predicted and prior distribution of labels. Additionally, we present a novel approach for selecting prompts for Vision & Language models using a distributional prior. Our method is effective and presents a significant improvement over the original model. We demonstrate an improvement of 28% in mean absolute error on the UTK age regression task. We also present promising results for classification benchmarks, improving the classification accuracy on the ImageNet dataset by 2.83%, without using any labels.

연구 동기 및 목표

  • 레이블 분포가 일치하지 않아 제로샷 모델(예: CLIP)이 회귀 과제에서 성능이 떨어지는 문제를 해결하기 위해.
  • 특히 연령과 같은 수치적 속성이나 장꼬리 분포를 띠는 속성에 대해 레이블 데이터가 부족한 문제를 해결하기 위해.
  • 정답 예측 예시 없이도 레이블 분포의 사전 지식을 통합하여 제로샷 분류 및 회귀 성능을 향상시키기 위해.
  • 레이블이 없는 데이터와 레이블의 분포 사전 지식만을 사용하여 사전 훈련된 V&L 모델을 적응시키는 방법을 개발하기 위해.
  • 초기 설정값에 대한 민감도를 최소화하고 원본 모델 예측의 정확성을 유지함으로써 다양한 데이터셋에 대해 강건한 적응을 가능하게 하기 위해.

제안 방법

  • CLIP과 같은 동결된 비전-언어(V&L) 모델 인코더 위에 어댑터 모듈을 훈련시키며, 레이블이 없는 이미지와 레이블 분포에 대한 사전 지식만을 사용한다.
  • 두 가지 경쟁적인 목적을 최적화함으로써 어댑터를 학습한다: (1) 원래 CLIP 제로샷 예측과의 편차를 최소화(로그릿 기반 L2 손실), (2) 예측된 레이블 분포와 사전 레이블 분포 간의 분포 거리 최소화(워샤르슈타인 거리 기반).
  • 두 목적의 가중 조합을 사용하며, 초수치 α가 원본 예측 유지와 사전 지식 적합성 간의 트레이드오프를 조절한다.
  • 레이블 사전 지식에 기반해 작업에 적합한 텍스트 프롬프트를 선택함으로써, 레이블 데이터 없이도 프롬프트 엔지니어링을 향상시킨다.
  • 다변량 회귀 확장을 위해 절삭된 워샤르슈타인 거리( sliced Wasserstein distance)를 사용한 분포 매칭을 적용하나, 이는 향후 연구 과제로 남겨둔다.
  • 외부 자료나 도메인 지식(예: 인구 통계 자료 또는 알려진 데이터 분포)에서 레이블 사전 지식을 추정한다.

실험 결과

연구 질문

  • RQ1레이블에 대한 사전 분포가 정답 예측 데이터가 전혀 없는 상황에서 제로샷 회귀 성능을 크게 향상시킬 수 있는가?
  • RQ2레이블에 접근할 수 없을 때, 비전-언어 모델이 목표 데이터셋의 진짜 레이블 분포를 더 잘 반영하도록 어떻게 적응시킬 수 있는가?
  • RQ3원본 제로샷 예측을 유지하면서도 레이블 사전 지식과 일치시키는 것이 다양한 작업에서 모델 정확도를 얼마나 향상시키는가?
  • RQ4제안된 방법이 최소한의 초수치 조정으로도 회귀 및 분류 과제에 일반화 가능한가?
  • RQ5기본 V&L 모델의 제로샷 예측에 오류가 있거나 레이블 사전 지식 추정에 오류가 있을 경우, 이 방법의 성능은 얼마나 견고한가?

주요 결과

  • CLIPPR는 UTK 연령 회귀 벤치마크에서 평균 절대 오차(MAE)를 7.99에서 5.73으로 낮혀 CLIP의 제로샷 성능 대비 28%의 상대적 향상을 달성했다.
  • 이 방법은 정답 예측 예제를 전혀 사용하지 않아도 ImageNet의 top-1 분류 정확도를 CLIP의 제로샷 기준보다 2.83% 향상시켰다.
  • 여러 데이터셋에서 일관된 향상이 이루어졌으며, 최적의 성능는 α = 1일 때 나타났고, 다양한 α 값(0.3, 1, 3)에서도 강건하게 유지되었다.
  • CLIPPR는 UTK 데이터셋에서 클래스당 32개의 샘플만을 사용하는 최첨단 소수의 예측 방법인 Tip-Adapter를 뛰어넘어 강력한 제로샷 일반화 성능을 보였다.
  • 이 방법은 회귀와 분류 모두에 효과적이며, 다양한 모odal리티에서 제로샷 성능 향상을 위해 분포 사전 지식을 활용할 수 있음을 보여주었다.
  • CLIP의 제로샷 예측이 본질적으로 잘못된(예: 무작위와 유사한) 경우 실패 케이스가 발생한다. 이는 방법이 기본 모델의 출력 결과를 기반으로 한 점에서 기인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.