Skip to main content
QUICK REVIEW

[논문 리뷰] What does a platypus look like? Generating customized prompts for zero-shot image classification

Sarah I. Pratt, Covert, Ian|arXiv (Cornell University)|2022. 09. 07.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 사용해 개별 카테고리에 맞는 풍부한 프롬프트를 생성하는 제로샷 방법인 CuPL(Customized Prompts via Language models)을 제안한다. 일반적인 템플릿 대신 '큰 눈을 가진 나무 개미핥이'처럼 기술적이고 구분 가능한 캡션을 사용함으로써, 다양한 벤치마크에서 제로샷 정확도를 향상시킨다. 미세조정이나 레이블이 없는 데이터를 사용하지 않음에도 불구하고 ImageNet에서 1.1%의 상위-1 정확도 향상을 기록했고, Describable Textures 데이터셋에서는 6% 이상의 향상을 기록한다.

ABSTRACT

Open-vocabulary models are a promising new paradigm for image classification. Unlike traditional classification models, open-vocabulary models classify among any arbitrary set of categories specified with natural language during inference. This natural language, called "prompts", typically consists of a set of hand-written templates (e.g., "a photo of a {}") which are completed with each of the category names. This work introduces a simple method to generate higher accuracy prompts, without relying on any explicit knowledge of the task domain and with far fewer hand-constructed sentences. To achieve this, we combine open-vocabulary models with large language models (LLMs) to create Customized Prompts via Language models (CuPL, pronounced "couple"). In particular, we leverage the knowledge contained in LLMs in order to generate many descriptive sentences that contain important discriminating characteristics of the image categories. This allows the model to place a greater importance on these regions in the image when making predictions. We find that this straightforward and general approach improves accuracy on a range of zero-shot image classification benchmarks, including over one percentage point gain on ImageNet. Finally, this simple baseline requires no additional training and remains completely zero-shot. Code available at https://github.com/sarahpratt/CuPL.

연구 동기 및 목표

  • 제로샷 오픈보이드 이미지 분류에서 수작업으로 만든 일반적인 프롬프트 템플릿의 한계를 해결하기 위해.
  • 세분화된 분류나 시각적으로 유사한 카테고리에서의 정확도 향상을 위해 프롬프트에 구분 가능한 시각적 특징을 통합함으로써.
  • 사용자 정의 프롬프트 엔지니어링이 필요 없도록 하기 위해 LLM을 활용해 자동으로 고품질의 카테고리별 프롬프트를 생성함으로써.
  • 모델의 미세조정이나 레이블이 없는 데이터를 사용하지 않음으로써 완전히 제로샷 설정을 유지함으로써.
  • 사전에 데이터셋의 표현 방식을 알고 있지 않아도 다양한 데이터셋에 적용 가능한 일반화 가능하고 확장 가능한 방법을 만들기 위해.

제안 방법

  • 각 이미지 카테고리에 대해 구분 가능한 시각적 특징에 중점을 두고, 대규모 언어 모델(LLM)을 사용해 여러 기술적 캡션을 생성한다.
  • LLM이 생성한 캡션을 카테고리 자리표시자(class placeholder)를 실제 클래스 이름으로 대체함으로써 프롬프트로 변환한다.
  • 이러한 맞춤형 프롬프트를 사전에 학습된 오픈보이드 이미지 분류기(예: CLIP)에 입력하여 이미지-텍스트 유사도 점수를 계산한다.
  • 유사도 점수가 가장 높은 프롬프트를 사용해 입력 이미지를 분류함으로써 제로샷 추론 파이프라인을 유지한다.
  • LLM의 세계 지식을 활용해 '나무 개미핥이'에 대해 '큰 눈'과 같은 구분 가능한 특징을 포함한 프롬프트를 생성함으로써, 데이터셋 전용 템플릿이 필요 없도록 한다.
  • 시각 모델을 재학습하거나 적응시키지 않으며, 프롬프트 생성만 LLM을 통해 수행함으로써 방법이 완전히 제로샷임을 보장한다.

실험 결과

연구 질문

  • RQ1표준 수작업 프롬프트 템플릿에 비해 LLM이 생성한 카테고리별 프롬프트가 제로샷 이미지 분류 정확도를 향상시킬 수 있는가?
  • RQ2예를 들어 '나무 개미핥이'에 대해 '큰 눈'과 같은 구분 가능한 시각적 특징을 프롬프트에 통합하면 세분화된 분류 작업에서 모델 성능이 향상되는가?
  • RQ3사전에 데이터셋의 내용을 알지 못한 채, 단일 고정된 LLM 프롬프트 지시사항이 다양한 데이터셋에 일반화 가능한가?
  • RQ4특히 시각적으로 모호하거나 유사한 카테고리에서, 프롬프트의 품질과 다양성은 제로샷 정확도에 어떤 영향을 미치는가?
  • RQ5ImageNet 및 Describable Textures와 같은 표준 벤치마크에서 LLM이 생성한 프롬프트의 성능은 수작업으로 캐리어한 프롬프트와 비교해 어떻게 되는가?

주요 결과

  • CuPL은 표준 수작업 프롬프트 템플릿에 비해 ImageNet에서 상위-1 정확도가 1.1% 향상되었다.
  • Describable Textures 데이터셋에서는 제로샷 정확도가 6% 이상 향상되어 세분화된 시각 인식에서 강력한 성과를 보였다.
  • 15개의 다양한 제로샷 이미지 분류 벤치마크에서 표준 프롬프트 템플릿보다 우수한 성능을 기록하여 광범위한 일반화 능력을 입증했다.
  • LLM이 생성한 프롬프트는 '코cker 스펜델의 긴 휘두르는 귀'와 같이 더 많은 구분 가능한 시각적 특징을 포함하여 시각 모델이 관련 이미지 영역에 집중하도록 돕는다.
  • 추가 학습이 필요 없으며, 완전한 제로샷 능력을 유지하면서도 인간의 노력이 최소한으로 필요한 방식으로 효율적으로 확장 가능하다. 단 몇 개의 프롬프트 지시사항만으로도 수천 개의 카테고리별 프롬프트를 생성할 수 있다.
  • 정성 분석 결과, CuPL 프롬프트는 '남부 검은 위도우의 빨간 모래시계 모양'과 같이 특징을 더 잘 포착하여, 모델이 핵심적인 구분 가능한 영역에 더 잘 집중하도록 도와주는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.