Skip to main content
QUICK REVIEW

[논문 리뷰] A Frustratingly Simple Approach for End-to-End Image Captioning

Ziyang Luo, Yadong Xi|arXiv (Cornell University)|2022. 01. 30.
Multimodal Machine Learning Applications인용 수 12
한 줄 요약

이 논문은 객체 검출기 없이도 작동하는 간단하면서도 효과적인 엔드 투 엔드 이미지 캡셔닝 프레임워크인 VC-GPT를 제안한다. 이는 사전 훈련된 CLIP-ViT 시각 인코더와 GPT2 언어 디코더를 자기 앙상블 다중모odal 융합 기법을 통해 연결하며, 객체 검출기의 필요성을 제거한다. 생성 과정에서 단일모달 및 다중모달 지식을 동시에 활용함으로써 MSCOCO, Flickr30k, NoCaps 벤치마크에서 최신 기술 수준 또는 그 이하 성능을 달성한다.

ABSTRACT

Image Captioning is a fundamental task to join vision and language, concerning about cross-modal understanding and text generation. Recent years witness the emerging attention on image captioning. Most of existing works follow a traditional two-stage training paradigm. Before training the captioning models, an extra object detector is utilized to recognize the objects in the image at first. However, they require sizeable datasets with fine-grained object annotation for training the object detector, which is a daunting task. In addition, the errors of the object detectors are easy to propagate to the following captioning models, degenerating models' performance. To alleviate such defects, we propose a frustratingly simple but highly effective end-to-end image captioning framework, Visual Conditioned GPT (VC-GPT), by connecting the pre-trained visual encoder (CLIP-ViT) and language decoder (GPT2). Different from the vanilla connection method that directly inserts the cross-attention modules into GPT2, we come up with a self-ensemble cross-modal fusion mechanism that comprehensively considers both the single- and cross-modal knowledge. As a result, we do not need extra object detectors for model training. Experimental results conducted on three popular image captioning benchmarks (MSCOCO, Flickr30k and NoCaps) demonstrate that our VC-GPT achieves either the best or the second-best performance across all evaluation metrics over extensive baseline systems.

연구 동기 및 목표

  • 객체 검출기를 필요로 하지 않고도 엔드 투 엔드 훈련이 가능한 이미지 캡셔닝 구조를 개발하기 위해.
  • 객체 검출기의 미세조정 없이도 시각과 언어 간의 다중모달 정렬을 향상시키기 위해.
  • 사전 훈련된 지식을 유지하면서도 다중모달 어텐션을 가능하게 하는 경량이면서도 효과적인 융합 기법을 개발하기 위해.
  • 사전 훈련된 시각 및 언어 모델만을 사용하여 표준 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • CLIP-ViT(시각 인코더)와 GPT2(언어 디코더)를 자기 앙상블 다중모달 융합 모듈을 통해 연결하여 엔드 투 엔드 훈련을 가능하게 한다.
  • 단일모달 GPT2 전문가와 다중모달 융합 전문가의 예측을 조합하는 자기 앙상블 기법을 도입하여 단일모달 및 다중모달 지식의 균형을 맞춘다.
  • 시각 패치와 언어 토큰 간의 어텐션 모듈을 사용하며, 해드 간 평균화된 특징 맵을 활용해 해석 가능성을 높인다.
  • 이중 단계 훈련 프로토콜을 적용한다: 다중모달 사전 훈련 → 이미지 캡셔닝 데이터셋에서의 미세조정.
  • 미세조정 중 이미지 해상도를 증가시킬 경우, 정렬을 유지하기 위해 위치 임베딩 보간법을 적용한다.
  • 사전 훈련 단계에서 CLIP-ViT와 GPT2의 동결 전략을 탐색하여 사전 훈련된 지식을 유지한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 시각 인코더와 언어 디코더 간의 단순한 융합 기법이 객체 검출기를 사용하지 않고도 최신 기술 수준의 이미지 캡셔닝 성능을 달성할 수 있는가?
  • RQ2단일모달 전문가와 다중모달 전문가의 자기 앙상블 융합 방식이 기존의 단순 다중모달 어텐션 삽입 방식보다 캡셔닝 품질을 얼마나 향상시키는가?
  • RQ3다중모달 사전 훈련 중 사전 훈련된 컴포onent들(CLIP-ViT와 GPT2)을 동결하는 최적의 전략은 무엇인가?
  • RQ4미세조정 단계에서 학습률과 이미지 해상도가 최종 캡셔닝 성능에 미치는 영향은 어떠한가?

주요 결과

  • VC-GPT는 MSCOCO, Flickr30k, NoCaps에서 모든 메트릭에서 최고 또는 2위 성능을 기록하며, 광범위한 베이스라인 시스템을 능가한다.
  • 사전 훈련 중 CLIP-ViT를 동결하면 다운스트림 성능이 향상되며, MSCOCO (val)에서 90.8 CIDEr, 24.3 B@4, 28.7 M, 23.6 S를 기록한다.
  • GPT2와 융합 모듈에 동일한 학습률(3e-5)을 적용할 경우 최고의 성능을 기록한다: MSCOCO (val)에서 126.7 CIDEr, 37.6 B@4, 30.0 M, 23.6 S.
  • 미세조정 중 이미지 해상도를 증가시키면 성능이 일정 수준까지 향상되지만, 너무 높은 해상도에서는 도메인 이탈로 인해 성능 저하가 발생할 수 있다.
  • 어텐션 맵을 통해 VC-GPT가 시각적 기반을 학습하고 있음을 확인할 수 있으며, 'boy'과 'cat' 같은 객체를 정확히 어텐션하고, 'ball'과 'bat' 같은 관계를 포착한다.
  • 자기 앙상블 기법은 단일모달 및 다중모달 지식을 효과적으로 균형 잡아, 더 정확하고 다양한 캡셔닝 결과를 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.