Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Decompose Visual Features with Latent Textual Prompts

Feng Wang, Manling Li|arXiv (Cornell University)|2022. 10. 09.
Multimodal Machine Learning Applications인용 수 8
한 줄 요약

이 논문은 사전 학습된 가중치를 미세조정하지 않고도 zero-shot 및 선형 프로빙 정확도를 향상시키기 위해 하드한 텍스트 클래스 이름 대신 학습 가능한 분리된 텍스트 프롬프트를 사용하는 새로운 시각-언어 추론 프레임워크인 분해된 특징 프롬프팅(DeFo)을 제안한다. 시각적 특징과 의미적 클래스 레이블을 분리하고 학습 가능한 선형 분류기를 사용함으로써, DeFo는 ResNet-50 백본을 사용해 ImageNet에서 73.2%의 top-1 정확도를 달성한다—zero-shot CLIP보다 15.0个百分点 높고, 최신 프롬프팅 튜닝 방법보다 7.6个百分点 높으며, 사전 학습된 가중치를 미세조정하지 않는다.

ABSTRACT

Recent advances in pre-training vision-language models like CLIP have shown great potential in learning transferable visual representations. Nonetheless, for downstream inference, CLIP-like models suffer from either 1) degraded accuracy and robustness in the case of inaccurate text descriptions during retrieval-based inference (the challenge for zero-shot protocol); or 2) breaking the well-established vision-language alignment (the challenge for linear probing). To address them, we propose Decomposed Feature Prompting (DeFo). DeFo leverages a flexible number of learnable embeddings as textual input while maintaining the vision-language dual-model architecture, which enables the model to learn decomposed visual features with the help of feature-level textual prompts. We further use an additional linear layer to perform classification, allowing a scalable size of language inputs. Our empirical study shows DeFo's significance in improving the vision-language models. For example, DeFo obtains 73.2% test accuracy on ImageNet with a ResNet-50 backbone without tuning any pretrained weights of both the vision and language encoder, outperforming zero-shot CLIP by a large margin of 15.0%, and outperforming state-of-the-art vision-language prompt tuning method by 7.6%.

연구 동기 및 목표

  • CLIP 유사 모델에서 특정 클래스 이름 표현 방식에 민감하여 추론 정확도가 떨어지는 문제를 해결하기 위해.
  • 희귀 또는 분포 외 개념이 zero-shot 설정에서 잘 인식되지 않는 개념적 민감성 문제를 해결하기 위해.
  • 선형 프로빙 중에도 언어 인코더를 유지함으로써 시각-언어 정렬을 유지하여 소수의 샘플 및 전이 학습 성능을 향상시키기 위해.
  • 사전 학습된 시각 또는 언어 인코더를 미세조정하지 않고도 확장 가능하고 높은 정확도를 보이는 zero-shot 및 선형 프로빙 추론을 가능하게 하기 위해.
  • 시각적 특징 표현을 하드한 의미적 타깃에서 분리하는 이중 모델 프롬프팅 프레임워크를 개발하기 위해.

제안 방법

  • DeFo는 클래스 이름과 분리된 학습 가능한, 작업에 관계없는 텍스트 임베딩(프롬프트) 세트를 언어 인코더의 입력으로 도입한다.
  • 모델는 이중 인코더 아키텍처를 사용하여 사전 학습 기간 동안 학습된 시각-언어 정렬을 유지한다.
  • 시각 인코더에서 추출한 시각적 특징은 언어 인코더 출력 위에 있는 학습 가능한 선형 레이어를 통해 투사되고 분류된다.
  • 학습 가능한 프롬프트의 수(n)와 길이(m)는 하이퍼파라미터이며, 실험 결과 중간 범위의 변동에 대해 뛰어난 내구성을 보였다.
  • 동일한 동결된 시각 및 언어 인코더와 함께 학습 가능한 분류기를 사용함으로써 zero-shot 및 선형 프로빙 추론을 모두 가능하게 한다.
  • DeFo의 텍스트 프롬프트는 끝에서 끝까지 학습되어 시각적 특징을 의미적으로 유의미한 구성 요소로 분해함으로써 특징의 분리도를 향상시킨다.

실험 결과

연구 질문

  • RQ1사전 학습된 가중치를 미세조정하지 않고도 학습 가능한 분리된 텍스트 프롬프트 메커니즘이 시각-언어 모델의 zero-shot 정확도를 향상시킬 수 있는가?
  • RQ2시각적 특징을 하드한 클래스 이름 타깃에서 분리함으로써 CLIP 스타일 모델의 표현 민감성 문제를 완화할 수 있는가?
  • RQ3선형 프로빙 중 언어 인코더를 유지함으로써 시각-언어 정렬을 유지하고 소수의 샘플 및 전이 학습 성능을 향상시킬 수 있는가?
  • RQ4학습 가능한 프롬프트의 수와 길이가 DeFo의 성능과 내구성에 어떤 영향을 미치는가?
  • RQ5학습된 텍스트 프롬프트가 원래의 클래스 레이블을 초월해 의미적으로 의미 있는 의미 개념을 얼마나 잘 포착하는가?

주요 결과

  • DeFo는 사전 학습된 가중치를 미세조정하지 않고 ResNet-50 백본을 사용해 ImageNet에서 73.2%의 top-1 정확도를 달성했으며, zero-shot CLIP보다 15.0个百分点 높다.
  • 11개의 다양한 이미지 분류 벤치마크에서 DeFo는 평균 79.9%의 정확도를 기록했으며, zero-shot CLIP보다 21.0个百分点 높고 CoOp보다 6.2个百分点 높다.
  • 제거 실험 결과 DeFo가 하이퍼파라미터에 대해 뛰어난 내구성을 보였으며, 프롬프트 수를 2048에서 256으로 줄였을 때 정확도가 단지 0.7% 떨어졌다.
  • DeFo의 성능 향상은 추가적인 선형 분류기 덕분이 아니며, CLIP나 CoOp에 동일한 레이어를 추가해도 최대 4%의 향상에 그친다.
  • 정성적 분석 결과 DeFo는 색상(예: '빨간색'), 형태(예: '링'), 배경(예: '积雪')과 같은 의미적으로 의미 있는 특징을 학습했으며, '개'나 '해바라기'와 같은 부모 카테고리까지도 포착한다.
  • 언어 인코더를 유지함으로써 DeFo는 강력한 소수의 샘플 및 전이 학습 성능을 유지하며, 이는 시각적 특징 투사의 경계를 유지하고 정렬을 지속하는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.