Skip to main content
QUICK REVIEW

[논문 리뷰] More Grounded Image Captioning by Distilling Image-Text Matching Model

Yuanen Zhou, Meng Wang|arXiv (Cornell University)|2020. 04. 01.
Multimodal Machine Learning Applications참고 문헌 70인용 수 12
한 줄 요약

이 논문은 비용이 많이 드는 단어-영역 정렬 애너테이션 없이도 이미지 캡션 생성 모델의 시각적 주의 분석을 향상시키기 위해 품사 정보를 통합한 이미지-텍스트 매칭 모델인 POS-SCAN을 제안한다. SCAN을 약한 지도 학습 기반의 교사 모델로 사용하고, 품사 태깅을 통해 형용사 외의 단어를 필터링함으로써 주의 분석 정확도를 크게 향상시키면서도 캡션 품질을 유지하거나 향상시켰다. 이는 Flickr30k Entities 및 MS-COCO 벤치마크에서 최신 기술 수준의 성능을 달성하였다.

ABSTRACT

Visual attention not only improves the performance of image captioners, but also serves as a visual interpretation to qualitatively measure the caption rationality and model transparency. Specifically, we expect that a captioner can fix its attentive gaze on the correct objects while generating the corresponding words. This ability is also known as grounded image captioning. However, the grounding accuracy of existing captioners is far from satisfactory. To improve the grounding accuracy while retaining the captioning quality, it is expensive to collect the word-region alignment as strong supervision. To this end, we propose a Part-of-Speech (POS) enhanced image-text matching model (SCAN \cite{lee2018stacked}): POS-SCAN, as the effective knowledge distillation for more grounded image captioning. The benefits are two-fold: 1) given a sentence and an image, POS-SCAN can ground the objects more accurately than SCAN; 2) POS-SCAN serves as a word-region alignment regularization for the captioner's visual attention module. By showing benchmark experimental results, we demonstrate that conventional image captioners equipped with POS-SCAN can significantly improve the grounding accuracy without strong supervision. Last but not the least, we explore the indispensable Self-Critical Sequence Training (SCST) \cite{Rennie_2017_CVPR} in the context of grounded image captioning and show that the image-text matching score can serve as a reward for more grounded captioning \footnote{https://github.com/YuanEZhou/Grounded-Image-Captioning}.

연구 동기 및 목표

  • 비용이 많이 드는 단어-영역 정렬 애너테이션에 의존하지 않고도 이미지 캡션 생성 모델의 시각적 주의 분석을 향상시키기 위해.
  • 더 나은 주의 분석 국소화를 통해 신경망 기반 이미지 캡션 생성 모델의 해석 가능성과 투명성을 높이기 위해.
  • 이미지-텍스트 매칭 모델이 캡션 생성에서의 주의 분석을 위한 효과적인 약한 지도 학습 신호로 기능할 수 있는지 탐색하기 위해.
  • 매칭 점수를 강화 학습 보상으로 사용할 때 캡션 품질과 주의 분석 성능 사이의 상충 관계를 조사하기 위해.

제안 방법

  • 품사 태거를 사용해 비명사어를 필터링함으로써 주의 분석 정확도를 향상시키기 위해 수정된 SCAN 이미지-텍스트 매칭 모델인 POS-SCAN을 제안한다.
  • 캡션 생성 모델의 시각적 주의 모듈에 주의 분석 정복 손실을 통해 POS-SCAN 모델을 교사로 활용하여 지식 정복을 수행한다 (예: Up-Down 모델).
  • 학생 캡션 생성 모델과 교사 POS-SCAN 모델 간의 주의 맵 차이를 최소화함으로써 지식 정복을 구현한다.
  • 이미지-텍스트 매칭 점수 (SCAN 또는 POS-SCAN) 를 Self-Critical Sequence Training (SCST) 의 보상 함수로 통합하여 주의 분석을 최적화한다.
  • 두 단계 학습을 적용한다: 교차 엔트로피 손실을 통한 사전 학습 후, 매칭 점수를 보상으로 사용하여 SCST로 미세 조정한다.
  • 바닥에서부터 시각적 특징을 사용하고, 주의 정확도 외에도 표준 평가 지표 (BLEU, METEOR, CIDEr, SPICE) 를 함께 평가한다.

실험 결과

연구 질문

  • RQ1약한 지도 학습 기반의 이미지-텍스트 매칭 모델이 단어-영역 애너테이션 없이도 이미지 캡션 생성 모델의 주의 분석을 향상시킬 수 있는가?
  • RQ2매칭 점수에서 비명사어를 필터링하면 이미지-텍스트 매칭 모델의 주의 분석 성능이 향상되는가?
  • RQ3이미지-텍스트 매칭 점수가 SCST에서 효과적인 보상으로 기능할 수 있는가? 이는 캡션 품질과 주의 분석 간의 균형을 맞출 수 있는가?
  • RQ4다른 매칭 점수를 보상으로 사용할 경우, 캡션 품질과 주의 분석 성능 사이에 상충 관계가 존재하는가?

주요 결과

  • POS-SCAN은 Flickr30k Entities에서 19.83%의 주의 정확도를 기록하여 원본 SCAN(17.63%)을 초월하고 Up-Down 캡션 생성 모델과 유사한 성능을 보이며, 강력한 지도 학습 없이도 주의 분석 성능 향상을 입증하였다.
  • POS-SCAN을 보상으로 사용하여 미세 조정한 캡션 생성 모델은 Flickr30k Entities에서 17.49%의 F1_loc 성능을 기록하여, 오직 CIDEr만을 보상으로 사용한 모델보다 유의미하게 뛰어난 성능을 보였다.
  • 기본 모델 대비 SPICE 점수를 1.5점 (66.2에서 69.3으로) 향상시키고, F1_loc 점수를 1.7점 (15.79에서 17.49로) 향상시켰으며, 이는 지도 학습 기반 주의 분석 애너테이션 없이도 성능 향상을 달성했다는 것을 의미한다.
  • MS-COCO Karpathy 테스트 세트에서 모델은 80.2 B@1, 38.0 B@4, 28.5 M의 성능을 기록하였고, F1_loc는 22.2로 다양한 지표에서 뛰어난 성능을 보였다.
  • SCST에서 SCAN을 보상으로 사용할 경우 CIDEr 전용 보상보다 주의 분석 성능이 향상되었으며, POS-SCAN는 캡션 품질과 주의 분석 간의 균형을 더 잘 유지하였다.
  • 정성적 분석 결과, 이 방법은 더 정확한 주의 맵을 생성하여 "men"과 "shirt"와 같은 단어를 해당 이미지 영역에 정확히 대응시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.