[논문 리뷰] CPTR: Full Transformer Network for Image Captioning
CPTR는 CNN 인코더를 전체 트랜스포머로 대체하여 원시 이미지를 패치 토큰으로 순차화하고, 첫 번째 인코더 층부터 글로벌 컨텍스트 모델링을 가능케 하며 MSCOCO에서 강력한 결과를 달성한다.
In this paper, we consider the image captioning task from a new sequence-to-sequence prediction perspective and propose CaPtion TransformeR (CPTR) which takes the sequentialized raw images as the input to Transformer. Compared to the "CNN+Transformer" design paradigm, our model can model global context at every encoder layer from the beginning and is totally convolution-free. Extensive experiments demonstrate the effectiveness of the proposed model and we surpass the conventional "CNN+Transformer" methods on the MSCOCO dataset. Besides, we provide detailed visualizations of the self-attention between patches in the encoder and the "words-to-patches" attention in the decoder thanks to the full Transformer architecture.
연구 동기 및 목표
- 전체 트랜스포머 인코더를 사용하여 이미지 캡션화를 시퀀스-투-시퀀스 작업으로 재고한다.
- 인코더에서 합성곱을 제거하고 이미지 패치를 순차적으로 처리한다.
- 모든 인코더 층에서 글로벌 컨텍스트 모델링을 구현하고 어텐션 패턴을 분석한다.
- 디코더의 단어-패치 교차 어텐션이 캡션 생성을 효과적으로 안내하는지 보여준다.
제안 방법
- 입력 이미지를 고정 크기의 패치(예: 16x16)로 나누고 패치 시퀀스로 펼친다.
- 선형 패치 임베딩과 학습 가능한 1D 위치 임베딩을 적용하여 트랜스포머 인코더에 feed한다.
- 패치 시퀀스로부터 장기 의존성을 모델링하기 위해 self-attention과 feed-forward 층이 쌓인 인코더를 사용한다.
- 디코더에서 마스킹된 자기-어텐션과 인코더 출력에 대한 교차 어텐션을 사용하고 단어 위치를 사인파로 표현한다.
- 교차 엔트로피 손실로 학습하고 자기-크리티컬 트레이닝으로 미세조정하여 캡션 성능을 향상한다.
- MSCOCO에서 표준 지표(BLEU, METEOR, ROUGE, CIDEr)로 평가하고 사전 학습, 이미지 해상도, 디코더 설정에 대한 절차를 보고한다.
실험 결과
연구 질문
- RQ1완전한 트랜스포머 기반 인코더(합성곱 없음)가 패치 시퀀스를 직접 처리하여 캡션 생성을 위한 이미지 컨텍스트를 효과적으로 모델링할 수 있는가?
- RQ2자체-어텐션으로 원시 이미지 패치를 처리하는 것이 CNN 기반 인코더보다 이미지 캡션에서 더 나은 글로벌 컨텍스트 모델링을 가능하게 하는가?
- RQ3패치 수준의 자체-어텐션과 단어-패치 교차 어텐션이 캡션 품질에 어떤 영향을 미치는가?
- RQ4사전 학습, 입력 해상도, 그리고 디코더 구성은 CPTR의 성능에 어떤 영향을 미치는가?
주요 결과
- CPTR은 MSCOCO Karpathy 테스트 분할에서 많은 CNN 기반 및 CNN+트랜스포머 기반 기준선보다 높은 CIDEr 점수(CIDEr 129.4)를 달성한다.
- 온라인 COCO 테스트 서버에서 CPTR은 CIDEr 129.4를 달성하여 여러 CNN+RNN 및 CNN+트랜스포머 방법을 능가한다.
- ViT(ImageNet-21K)로 인코더를 사전 학습하고 ImageNet 2012에서 미세조정하면 처음부터 학습했을 때보다 CIDEr 이점이 커진다.
- 입력 해상도를 224x224에서 384x384로 증가시키고 16x16 패치를 사용하면 미세조정 시 CIDEr가 크게 향상된다(예: 사전 학습으로 미세조정된 경우 116.5).
- 모델은 모든 층의 인코더 자체 어텐션이 초기 층에서도 로컬 및 글로벌 컨텍스트를 포착할 수 있음을 어텐션 맵으로 시각화하여 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.