[논문 리뷰] Injecting Semantic Concepts into End-to-End Image Captioning
이 논문은 객체 검출기 없이도 작동하는 비전 트랜스포머 기반의 이미지 캡션 생성 모델인 ViTCAP을 제안한다. 이 모델은 새로운 개념 토큰 네트워크(CTN)를 통해 의미적 개념을 통합함으로써 캡션 품질을 향상시킨다. 이미지 특징에서 개념 토큰을 예측하고 이를 캡션 생성 디코더에 통합함으로써, ViTCAP은 객체 검출기를 사용하지 않고도 COCO, nocaps, Google-CC 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성한다.
Tremendous progress has been made in recent years in developing better image captioning models, yet most of them rely on a separate object detector to extract regional features. Recent vision-language studies are shifting towards the detector-free trend by leveraging grid representations for more flexible model training and faster inference speed. However, such development is primarily focused on image understanding tasks, and remains less investigated for the caption generation task. In this paper, we are concerned with a better-performing detector-free image captioning model, and propose a pure vision transformer-based image captioning model, dubbed as ViTCAP, in which grid representations are used without extracting the regional features. For improved performance, we introduce a novel Concept Token Network (CTN) to predict the semantic concepts and then incorporate them into the end-to-end captioning. In particular, the CTN is built on the basis of a vision transformer and is designed to predict the concept tokens through a classification task, from which the rich semantic information contained greatly benefits the captioning task. Compared with the previous detector-based models, ViTCAP drastically simplifies the architectures and at the same time achieves competitive performance on various challenging image captioning datasets. In particular, ViTCAP reaches 138.1 CIDEr scores on COCO-caption Karpathy-split, 93.8 and 108.6 CIDEr scores on nocaps, and Google-CC captioning datasets, respectively.
연구 동기 및 목표
- 객체 검출기를 사용하지 않는 검출기 없는 이미지 캡션 생성 모델을 개발하여 객체 검출기의 계산 및 아키텍처적 오버헤드를 제거한다.
- 다중모odal 융합 과정에 풍부한 의미적 개념을 통합하여 캡션 생성 성능을 향상시킨다.
- 이미지 캡션에서 유도된 개념 토큰과 객체 검출기 태그를 각각 감독 신호로 사용했을 때의 효과를 탐구한다.
- 순수한 비전 트랜스포머 백본과 경량 CTN이 기존의 검출기 기반 및 검출기 없는 모델보다 뛰어난 성능을 내는지 입증한다.
제안 방법
- 입력 이미지에서 격자 특징을 생성하기 위해 비전 트랜스포머(ViT)를 시각 인코더로 사용하여 객체 검출기가 필요 없도록 한다.
- ViT 위에 위치한 경량 헤드인 개념 토큰 네트워크(CTN)를 도입하여 분류 작업을 통해 의미적 개념 토큰을 예측한다.
- CTN은 텍스트에서 추출한 의사 진짜 신호(pseudo-ground-truth signal)를 사용하여 이미지 캡션에서 유도된 개념 토큰을 예측하도록 훈련된다.
- 다중모달 트랜스포머 디코더에서 상위-K 예측된 개념 토큰을 격자 특징과 통합하여 엔드 투 엔드 캡션 생성을 수행한다.
- 대규모 사전 훈련 시 이중 타워 훈련 체계를 적용하여, CTN이 먼저 모든 이미지에 대해 개념을 예측하고 이를 사전에 준비된 태그로 사용한다.
- fine-tuning 동안 학생 모델의 성능을 향상시키기 위해 사전 훈련된 시각-언어 모델(선생 모델)에서 지식 정복을 적용한다.
![Figure 1 : Comparisons of different image captioning models . Top: A general image captioning pipeline. Bottom: (a). Prevailing conventional models [ 39 , 79 , 25 ] which are based on an object detector to extract regional features. Object tags [ 38 , 79 ] can be optionally used to assist the text g](https://ar5iv.labs.arxiv.org/html/2112.05230/assets/x1.png)
실험 결과
연구 질문
- RQ1비전 트랜스포머 기반의 검출기 없는 이미지 캡션 생성 모델이 객체 검출기를 사용하지 않고도 경쟁 가능한 성능을 달성할 수 있는가?
- RQ2이미지 캡션에서 유도된 의미적 개념 토큰을 도입할 경우, 객체 검출기 태그보다 캡션 품질 향상에 더 효과적인가?
- RQ3개념 토큰 네트워크(CTN)가 캡션 생성을 위해 풍부한 의미 정보를 얼마나 잘 캡처하고 활용하는가?
- RQ4순수한 비전 트랜스포머 아키텍처에 경량 CTN 브랜치를 추가하면 기존의 검출기 기반 및 검출기 없는 모델보다 표준 벤치마크에서 뛰어난 성능을 낼 수 있는가?
주요 결과
- ViTCAP은 COCO-캡션 카르파티 스플릿에서 CIDEr 점수 138.1을 기록하여 대부분의 기존 검출기 기반 모델을 능가하고 검출기 없는 모델 중 최신 기술 수준(SOTA)을 달성한다.
- nocaps 데이터셋에서 ViTCAP은 CIDEr 점수 95.4를 기록하여 오픈 어휘 및 다양한 이미지 설명에 대한 강력한 일반화 능력을 보여준다.
- Google-CC 데이터셋에서 ViTCAP은 CIDEr 점수 108.6을 기록하여 대규모, 오픈 도메인 이미지 캡션에서 뛰어난 성능을 보인다.
- 절단 실험을 통해 이미지 캡션에서 추출한 개념 토큰이 CTN의 감독 신호로써 객체 검출기 태그보다 우수한 성능을 내는 것으로 확인된다.
- 대규모 사전 훈련 없이도 ViTCAP은 SMURF 점수 0.55를 기록하여 인간 평가와 잘 일치하는 성능을 보여준다.
- 시각화 결과에서 다양한 트랜스포머 블록의 어텐션 맵이 서로 다른 이미지 영역에 집중하고 평균화된 맵은 종합적인 내용을 커버함을 확인하여 약한 감독 기반 그라운딩 잠재력이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.