Skip to main content
QUICK REVIEW

[논문 리뷰] GIT: A Generative Image-to-text Transformer for Vision and Language

Jianfeng Wang, Zhengyuan Yang|arXiv (Cornell University)|2022. 05. 27.
Multimodal Machine Learning Applications인용 수 209
한 줄 요약

GIT는 객체 탐지기나 OCR 없이 0.8B 이미지-텍스트 쌍에서 사전 학습된 단일 인코더 이미지 및 단일 디코더 텍스트 생성기로 이미지/비디오 자막 작성과 VQA를 통합하여 새로운 최첨단 결과를 달성합니다. 또한 생성 기반 이미지 분류와 강력한 현장 텍스트 능력을 보여줍니다.

ABSTRACT

In this paper, we design and train a Generative Image-to-text Transformer, GIT, to unify vision-language tasks such as image/video captioning and question answering. While generative models provide a consistent network architecture between pre-training and fine-tuning, existing work typically contains complex structures (uni/multi-modal encoder/decoder) and depends on external modules such as object detectors/taggers and optical character recognition (OCR). In GIT, we simplify the architecture as one image encoder and one text decoder under a single language modeling task. We also scale up the pre-training data and the model size to boost the model performance. Without bells and whistles, our GIT establishes new state of the arts on 12 challenging benchmarks with a large margin. For instance, our model surpasses the human performance for the first time on TextCaps (138.2 vs. 125.5 in CIDEr). Furthermore, we present a new scheme of generation-based image classification and scene text recognition, achieving decent performance on standard benchmarks. Codes are released at \url{https://github.com/microsoft/GenerativeImage2Text}.

연구 동기 및 목표

  • 비전-언어 태스크를 위한 간단하고 통합된 Generative Image-to-text Transformer (GIT) 아키텍처를 demonstrate한다.
  • 감지기/OCR 없이 대규모 이미지-텍스트 데이터로 사전 학습하면 자막 작성, QA, 비디오 태스크에서 SOTA를 달성할 수 있음을 보여준다.
  • 같은 모델을 사용하여 생성 기반 이미지 분류와 현장 텍스트 인식을 탐구한다.
  • VL 태스크 성능에 미치는 모델 크기 및 데이터 규모의 영향을 조사한다.
  • 임의로 초기화되고 끝까지 학습된 디코더를 사용할 때의 학습 dynamics에 대한 통찰을 제공한다.

제안 방법

  • 큰 이미지-텍스트 쌍으로 사전 학습된 Swin과 유사한 비전 인코더 하나를 이미지 인코더로 사용한다.
  • 이미지 특징으로부터 설명을 생성하기 위해 언어 모델링 목표로 학습된 변환기 텍스트 디코더를 사용한다.
  • LM 손실(MLM 없음)로 2 에폭 동안 0.8B 이미지-텍스트 쌍을 사전 학습한다.
  • 자 targets를 생성된 텍스트로 간주하여 captioning, VQA, 비디오 태스크를 미세 조정한다(질문은 VQA의 프롬프트로 사용).
  • 다중 프레임을 샘플링하여 각각 독립적으로 인코딩하고 학습 가능한 시간적 임베딩으로 연결하여 비디오를 처리한다.
  • 고정 어휘 없이 캡션과 같은 출력으로 클래스 이름을 예측함으로써 생성 기반 이미지Net 분류를 평가한다.]
  • 연구 질문
  • 키 발견
  • 표 헤더
  • 표 행

실험 결과

연구 질문

  • RQ1감지기, 태그 또는 OCR에 의존하지 않고도 이미지-텍스트 태스크 across VL에서 최첨단 결과를 달성할 수 있는 최소 아키텍처(하나의 이미지 인코더와 하나의 텍스트 디코더)인가?
  • RQ2사전 학습 데이터 규모와 모델 크기를 확장할 때 이미지, 비디오, QA 벤치마크에서 VL 태스크 성능에 어떤 영향을 미치는가?
  • RQ3생성 기반 학습이 미리 정의된 어휘 없이 현장 텍스트 이해 및 이미지 분류에서 경쟁력 있거나 최첨단 결과를 달성할 수 있는가?
  • RQ4단일 생성 모델이 최소한의 아키텍처 변화로 이미지 자막 작성에서 비디오 자막 작성 및 VQA로 얼마나 잘 전이될 수 있는가?

주요 결과

  • GIT는 다수의 이미지/비디오 자막 작성 및 QA 벤치마크에서 새로운 최첨단을 달성한다.
  • TextCaps에서 GIT가 인간 성능을 처음으로 능가한다(CIDEr: 138.2 vs 125.5).
  • GIT는 외부 감지기나 OCR 없이 0.7B 파라미터 모델로 여러 벤치마크에서 이전 최첨단을 능가한다.
  • 비디오 태스크도 같은 아키텍처로 이익을 보는 강력한 결과를 보여주며, 전용 비디오 인코더가 필요 없다.
  • 캡션 유사 출력으로 이루어진 ImageNet 분류 생성 방식이 강력한 Top-1 정확도(88.79%)를 달성한다.
  • 사전 학습 데이터 규모와 모델 크기의 확장은 많은 태스크에서 상당한 이득을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.