[논문 리뷰] I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision
이 논문은 대조적 시각-언어 모델의 공유된 의미 임베딩 공간을 활용하여 시각 작업 모델을 텍스트 감독만으로 훈련하는 CLOSE라는 방법을 제안한다. 시각 및 언어 인코더를 고정하고 텍스트 데이터에 적응형 노이즈를 적용하여 훈련함으로써, 이미지 캡션, 시각적 함의, VQA, 시각 뉴스 캡션 등에서 최신 기술에 근접한 성능을 달성한다. 캡션 및 함의 작업에서는 이전의 텍스트 전용 방법보다 9점 이상 뛰어나고, 시각 뉴스 캡션에서는 30점 이상 뛰어나 성능을 확보한다.
Many high-level skills that are required for computer vision tasks, such as parsing questions, comparing and contrasting semantics, and writing descriptions, are also required in other domains such as natural language processing. In this paper, we ask whether it is possible to learn those skills from text data and then transfer them to vision tasks without ever training on visual training data. Key to our approach is exploiting the joint embedding space of contrastively trained vision and language encoders. In practice, there can be systematic differences between embedding spaces for different modalities in contrastive models, and we analyze how these differences affect our approach and study strategies to mitigate this concern. We produce models using only text training data on four representative tasks: image captioning, visual entailment, visual question answering and visual news captioning, and evaluate them on standard benchmarks using images. We find these models perform close to models trained on images, while surpassing prior work for captioning and visual entailment in this text-only setting by over 9 points, and outperforming all prior work on visual news by over 30 points. We also showcase a variety of stylistic image captioning models that are trained using no image data and no human-curated language data, but instead using readily-available text data from books, the web, or language models.
연구 동기 및 목표
- 고수준의 시각 이해 기술이 시각 훈련 데이터 없이도 텍스트 데이터만으로 학습되어 시각 작업으로 전이될 수 있는지 탐구한다.
- 대조 모델에서 이미지 및 텍스트 임베딩 간의 도메인 차이가 교차 모달 전이 성능을 저해할 수 있는 문제를 해결한다.
- 대조 미사전 훈련에서 유도된 공유된 의미 공간을 활용하여 영감 없는 교차 모달 전이를 가능하게 하는 방법을 개발한다.
- 책, 웹, 언어 모델에서 유래한 데이터만을 사용하여 스타일리스틱 이미지 캡션 모델을 훈련시킬 수 있는지의 가능성을 입증한다.
- 비용이 많이 들거나 복잡한 시각 데이터 수집 대신, 쉽게 확보 가능한 텍스트 데이터를 활용하여 스케일러블하고 저비용의 대체 방법을 확립한다.
제안 방법
- 대조적으로 사전 훈련된 시각-언어(V&L) 모델을 활용하여 이미지와 텍스트의 공유된 의미 임베딩 공간을 생성한다.
- 훈련 단계 동안 시각 및 언어 인코더를 고정하고, 텍스트 입력만을 사용하여 작업별 대응 표현을 학습한다.
- 추론 시 텍스트 임베딩을 이미지 임베딩으로 대체함으로써 텍스트에서 이미지로의 전이 전략을 적용하여 영감 없는 교차 모달 일반화를 가능하게 한다.
- 훈련 중 텍스트 임베딩에 적응형 노이즈(예: 가우시안 노이즈)를 도입하여 모odal 특화된 분포 이탈을 완화하고 강건성을 향상시킨다.
- 기본 모델의 백본을 재학습하지 않고도 작업별 적응이 가능한 헤드를 미세조정하기 위해 어댑터를 사용한다.
- 이미지-캡션 애너테이션을 포함하지 않은 다양한 텍스트 데이터 소스(예: 책, 웹 텍스트, LLM 생성 텍스트)에서 훈련을 수행한다.

실험 결과
연구 질문
- RQ1캡션, 시각적 질문 응답, 함의와 같은 고수준의 시각 이해 기술이 시각 훈련 데이터 없이도 텍스트 데이터만으로 학습되어 시각 작업으로 전이될 수 있는가?
- RQ2대조 모델에서 이미지와 텍스트의 임베딩 공간 간의 체계적인 차이가 교차 모달 전이 성능에 미치는 영향은 무엇이며, 이를 어떻게 완화할 수 있는가?
- RQ3텍스트 전용 데이터로 훈련된 모델가 표준 시각-언어 벤치마크에서 시각 데이터로 훈련된 모델과 유사한 성능을 달성할 수 있는가?
- RQ4책, 리뷰, LLM 출력 등 다양한 텍스트 소스에서 유래한 데이터만으로도 스타일리스틱 이미지 캡션 모델을 효과적으로 훈련시킬 수 있는가?
- RQ5시각 데이터 없이도 적응형 노이즈 또는 기타 도메인 불변 정규화 기법이 영감 없는 교차 모달 전이 성능을 크게 향상시키는가?
주요 결과
- 텍스트 데이터 전용으로 훈련된 CLOSE 모델은 이미지 캡션, 시각적 함의, VQA 작업에서 완전히 감독된 모델과 5~10점 이내의 성능을 기록하며, 강력한 영감 없는 전이 능력을 입증한다.
- 이전의 텍스트 전용 방법보다 이미지 캡션 작업에서 17 CIDEr 포인트(95.4 vs. 78.2) 뛰어나고, 시각적 함의 작업에서는 9포인트(75.9 vs. 66.6) 뛰어나 텍스트 전용 설정에서 새로운 최고 기록을 수립한다.
- 시각 뉴스 캡션 벤치마크에서 텍스트 전용 모델은 이전 최고 성능(시각 데이터로 훈련된 결과)보다 30.3 CIDEr 포인트(80.8 vs. 50.5) 뛰어나 성능 효과성을 입증한다.
- 대규모 언어 모델(GPT-3 등)이 생성한 텍스트 데이터로 훈련된 모델는 프롬프트 엔지니어링만으로도 강력한 성능을 기록하며, 인간이 애너테이션한 이미지 데이터가 필요 없다.
- 훈련 중 가우시안 노이즈를 도입함으로써 모달 분포 이탈에 대한 강건성이 크게 향상되어, 이러한 정규화 기법이 없는 기준 방법보다 뛰어난 성능을 기록한다.
- 다양한 텍스트 소스(예: 책, 리뷰, LLM 출력)에서 훈련된 스타일리스틱 캡션 모델은 어떤 이미지-캡션 쌍이 없더라도 정확하고 스타일이 일관된 캡션을 생성한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.