Skip to main content
QUICK REVIEW

[논문 리뷰] MAT: A Multimodal Attentive Translator for Image Captioning

Chang Liu, Fuchun Sun|arXiv (Cornell University)|2017. 02. 18.
Multimodal Machine Learning Applications참고 문헌 21인용 수 13
한 줄 요약

이 논문은 시각 언어—검출된 객체의 시퀀스로 표현된—를 자연어로 번역하는 것으로 이미지 캡션 생성을 재정의하는 다중모달 주의 메커니즘을 갖춘 순차적-시퀀스 RNN 모델인 MAT(Multimodal Attentive Translator)을 제안한다. 객체 특징에 대한 순차적 주의 메커니즘을 활용함으로써 MAT는 시각적 표현의 균형을 향상시키고, MS COCO에서 최신 기준 성능을 달성하며, CIDEr 점수 1.064(c40)와 SPICE 점수 18.9(c5)를 기록한다.

ABSTRACT

In this work we formulate the problem of image captioning as a multimodal translation task. Analogous to machine translation, we present a sequence-to-sequence recurrent neural networks (RNN) model for image caption generation. Different from most existing work where the whole image is represented by convolutional neural network (CNN) feature, we propose to represent the input image as a sequence of detected objects which feeds as the source sequence of the RNN model. In this way, the sequential representation of an image can be naturally translated to a sequence of words, as the target sequence of the RNN model. To represent the image in a sequential way, we extract the objects features in the image and arrange them in a order using convolutional neural networks. To further leverage the visual information from the encoded objects, a sequential attention layer is introduced to selectively attend to the objects that are related to generate corresponding words in the sentences. Extensive experiments are conducted to validate the proposed approach on popular benchmark dataset, i.e., MS COCO, and the proposed model surpasses the state-of-the-art methods in all metrics following the dataset splits of previous work. The proposed approach is also evaluated by the evaluation server of MS COCO captioning challenge, and achieves very competitive results, e.g., a CIDEr of 1.029 (c5) and 1.064 (c40).

연구 동기 및 목표

  • RNN 기반 이미지 캡션 생성에서 시각 인코딩과 언어 디코딩 간의 균형을 개선하기 위해 작업을 다중모달 순차적-시퀀스 번역으로 재정의한다.
  • 단일 이미지 CNN 특징을 검출된 객체 특징의 시퀀스로 대체하여 이미지 캡션 생성에서 시각적 표현을 향상시킨다.
  • 어휘 생성 중에 관련 객체를 동적으로 주시할 수 있도록 순차적 주의 레이어를 도입하여 주의 메커니즘을 개선한다.
  • 더 균형 잡히고 정보가 풍부한 시각적 콘텐츠 인코딩을 통해 벤치마크 데이터셋에서 뛰어난 성능을 달성한다.

제안 방법

  • 객체 검출 및 특징 추출을 통해 입력 이미지를 검출된 객체의 시퀀스로 표현하여 단일 CNN 특징 표현 방식을 대체한다.
  • 객체 특징의 시퀀스를 인코더-RNN에 입력하여 맥락 기반의 시각적 표현을 생성한다.
  • 각 디코딩 타임스텝에서 모든 객체 특징에 대해 주의 가중치를 계산하는 순차적 주의 메커니즘을 도입하여 관련 시각 요소에 대한 동적 집중을 가능하게 한다.
  • 순차적 주의에서 생성된 컨텍스트 벡터에 조건을 붙인 디코더-RNN을 사용하여 토큰 단위로 자연어 캡션을 생성한다.
  • 학습 안정성을 향상시키기 위해 스케줄링 샘플링을 사용한 교차 엔트로피 손실을 활용해 엔드 투 엔드 모델을 훈련시킨다.
  • 성능 검증을 위해 MS COCO 평가 서버와 SPICE 메트릭을 활용해 인간 평가와의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1단일 CNN 특징을 사용하는 것과 비교해 이미지를 검출된 객체의 시퀀스로 표현함으로써 이미지 캡션 모델의 성능 향상이 가능할까?
  • RQ2디코딩 중에 다수의 객체 특징을 대상으로 주의를 기울이는 순차적 주의 메커니즘이 캡션 품질에 어떤 영향을 미칠까?
  • RQ3제안된 다중모달 순차적-시퀀스 번역 프레임워크가 표준 벤치마크에서 기존의 CNN+RNN 및 주의 기반 베이스라인을 초월할 수 있을까?
  • RQ4SPICE 메트릭으로 측정했을 때 모델의 성능이 인간 평가와 얼마나 관련이 깊을까?

주요 결과

  • MAT는 MS COCO 평가 서버에서 CIDEr 점수 1.064(c40)와 1.029(c5)를 기록하여 이전 최신 기준 성능을 크게 앞서간다.
  • MS COCO 5000 테스트 분할에서 MAT는 SPICE 점수 18.9(c5)를 기록하여 인간 평가와의 높은 일치도를 보였다.
  • 제거 실험 결과, 순차적 객체 표현과 순차적 주의 메커니즘이 베이스라인 모델 대비 성능 향상에 기여한다는 게 확인되었다.
  • 정성적 결과 분석에서 MAT는 기존 베이스라인 대비 더 정확하고 맥락적으로 적절한 캡션을 생성하는 것으로 나타났으며, 특히 다수의 객체와 동작을 정확히 식별하는 데서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.