Skip to main content
QUICK REVIEW

[논문 리뷰] OrdinalCLIP: Learning Rank Prompts for Language-Guided Ordinal Regression

Wanhua Li, Xiaoke Huang|arXiv (Cornell University)|2022. 06. 06.
Domain Adaptation and Few-Shot Learning인용 수 10
한 줄 요약

OrdinalCLIP은 CLIP의 사전 훈련된 텍스트 인코더에서 순서별 언어 프로토타입을 학습함으로써 언어 기반의 순서 회귀 파라다임을 도입한다. 유연한 프롬프트와 학습 가능한 컨텍스트 토큰, 연속적 순서 임베딩을 사용하여 순서 구조를 유지한다. 이는 연령 추정, 역사적 이미지 연도 결정, 이미지 미학 평가에서 최신 기술 성능을 달성하며, 소수의 샘플 및 분포 이탈 설정에서도 성능 향상을 보이며, 풍부한 언어 프로토타입을 정제함으로써 추론 시 추가 계산 비용이 발생하지 않는다.

ABSTRACT

This paper presents a language-powered paradigm for ordinal regression. Existing methods usually treat each rank as a category and employ a set of weights to learn these concepts. These methods are easy to overfit and usually attain unsatisfactory performance as the learned concepts are mainly derived from the training set. Recent large pre-trained vision-language models like CLIP have shown impressive performance on various visual tasks. In this paper, we propose to learn the rank concepts from the rich semantic CLIP latent space. Specifically, we reformulate this task as an image-language matching problem with a contrastive objective, which regards labels as text and obtains a language prototype from a text encoder for each rank. While prompt engineering for CLIP is extremely time-consuming, we propose OrdinalCLIP, a differentiable prompting method for adapting CLIP for ordinal regression. OrdinalCLIP consists of learnable context tokens and learnable rank embeddings; The learnable rank embeddings are constructed by explicitly modeling numerical continuity, resulting in well-ordered, compact language prototypes in the CLIP space. Once learned, we can only save the language prototypes and discard the huge language model, resulting in zero additional computational overhead compared with the linear head counterpart. Experimental results show that our paradigm achieves competitive performance in general ordinal regression tasks, and gains improvements in few-shot and distribution shift settings for age estimation. The code is available at https://github.com/xk-huang/OrdinalCLIP.

연구 동기 및 목표

  • 훈련 데이터에서 순서 개념을 유일하게 학습하는 기존 순서 회귀 방법의 과적합 및 낮은 일반화 성능 문제를 해결하기 위해.
  • CLIP와 같은 사전 훈련된 시각-언어 모델의 풍부한 의미적 사전 지식을 활용하여 모델의 일반화 능력을 향상시키기 위해.
  • 언어 임베딩 공간에서 순서 레이블의 연속적인 순서적 성질을 명시적으로 모델링하기 위해.
  • 수동적인 프롬프트 엔지니어링에 의존하지 않고 순서별 프롬프트를 학습할 수 있는 기계 학습 가능한 프롬프팅 메커니즘을 개발하기 위해.
  • CLIP의 전체 언어 모델을 제거하고 정제된 언어 프로토타입만 유지함으로써 추론 시 추가 계산 부담을 제로로 만드는 것.

제안 방법

  • 대조적 손실을 사용하여 순서 회귀를 이미지-텍스트 매칭 작업으로 재정의하며, 이미지 특징을 학습된 언어 프로토타입과 매칭한다.
  • CLIP의 사전 훈련된 텍스트 인코더를 사용하여 자연어 기술인 '이 사람은 23세입니다'와 같은 기술에서 유도된 고정된 언어 프로토타입을 각 순서에 대해 추출한다.
  • 모든 순서에 공통적으로 사용되는 학습 가능한 컨텍스트 토큰을 도입하여 동적 프롬프트를 형성하고, 엔드 투 엔드 훈련을 가능하게 한다.
  • 기본 특징 간의 보간을 통해 순서 임베딩을 학습하여 임베딩 공간에서 수치적 연속성과 순서 유지 성질을 명시적으로 모델링한다.
  • 이미지 인코더와 프롬프트 파라미터를 대조 손실을 사용하여 엔드 투 엔드로 훈련하여 이미지 특징을 해당 언어 프로토타입과 정렬한다.
  • 추론 시 전체 CLIP 모델을 제거하고, 정제된 언어 프로토타입만 유지하여 추가 계산 비용 없이 작동한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 시각-언어 모델에서 유도된 언어 사전 지식이 순서 회귀 작업의 일반화 능력을 향상시킬 수 있는가?
  • RQ2사전 훈련된 언어 모델의 임베딩 공간에서 순서 레이블의 연속적인 순서적 성질을 어떻게 명시적으로 모델링할 수 있는가?
  • RQ3기계 학습 가능한 프롬프팅이 수동 프롬프트 엔지니어링의 필요성을 줄이고 순서 회귀 성능을 향상시킬 수 있는가?
  • RQ4언어 공간에서 순서 프로토타입을 학습하는 것이 순수히 데이터 기반 방법에 비해 과적합을 완화하는가?
  • RQ5이 방법은 특히 연령 추정에서 소수의 샘플 및 분포 이탈 설정에서도 일반화 가능한가?

주요 결과

  • OrdinalCLIP은 연령 추정 벤치마크에서 기존 최고 성능 기록을 갱신하여 평균 절대 오차(MAE) 0.280과 정확도 72.58%를 달성했다.
  • 역사적 이미지 연도 결정 데이터셋에서 OrdinalCLIP은 정확도 56.44%와 MAE 0.67을 기록했으며, CoOp(51.90%)와 0-샷 CLIP(26.08%)를 크게 앞서갔다.
  • 역사적 이미지 연도 결정 데이터셋에서 이전 최고 성능 방법 대비 정확도 4.45%p 향상 및 MAE 0.11 향상되었다.
  • OrdinalCLIP은 연령 추정의 모든 명목 범주에서 일관된 성능 향상을 보였으며, 이전 방법보다 표준편차가 낮았다.
  • 연령 추정의 소수 샘플 및 분포 이탈 설정에서, OrdinalCLIP은 베이스라인 및 CoOp 대비 더 높은 강건성과 일반화 능력을 보였다.
  • 제거 실험 결과, 연속적 보간을 사용하는 학습 가능한 순서 임베딩이 비연속적 대안보다 성능 향상에 크게 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.