Skip to main content
QUICK REVIEW

[논문 리뷰] "Factual" or "Emotional": Stylized Image Captioning with Adaptive Learning and Attention

Tianlang Chen, Zhongping Zhang|arXiv (Cornell University)|2018. 07. 10.
Multimodal Machine Learning Applications참고 문헌 47인용 수 9
한 줄 요약

이 논문은 사실성과 감정적 스타일 생성을 결합하기 위해 새로운 스타일-사실 LSTM과 적응형 주의 메커니즘, 참조 기반 적응형 학습 전략을 사용하는 스타일화된 이미지 캡션 생성 모델을 제안한다. 이 모델은 이미지-캡션 쌍 외에 추가적인 참조 지도 데이터가 없어도 유머/로맨틱 및 긍정/부정 캡션 생성 벤치마크에서 최신 기술을 초월한다.

ABSTRACT

Generating stylized captions for an image is an emerging topic in image captioning. Given an image as input, it requires the system to generate a caption that has a specific style (e.g., humorous, romantic, positive, and negative) while describing the image content semantically accurately. In this paper, we propose a novel stylized image captioning model that effectively takes both requirements into consideration. To this end, we first devise a new variant of LSTM, named style-factual LSTM, as the building block of our model. It uses two groups of matrices to capture the factual and stylized knowledge, respectively, and automatically learns the word-level weights of the two groups based on previous context. In addition, when we train the model to capture stylized elements, we propose an adaptive learning approach based on a reference factual model, it provides factual knowledge to the model as the model learns from stylized caption labels, and can adaptively compute how much information to supply at each time step. We evaluate our model on two stylized image captioning datasets, which contain humorous/romantic captions and positive/negative captions, respectively. Experiments shows that our proposed model outperforms the state-of-the-art approaches, without using extra ground truth supervision.

연구 동기 및 목표

  • 의미적으로 정확하고 스타일적으로 적절한(예: 유머러스, 로맨틱, 긍정적, 부정적) 고품질의 스타일화된 이미지 캡션을 생성하는 것.
  • 이미지 캡션 생성에서 사실성 정확성과 스타일적 표현 간의 균형을 맞추는 과제를 해결하는 것.
  • 추가적인 애너테이션(예: 감정 강도)이 아닌, 스타일화된 캡션 레이블에서 사실 지식을 유지하면서 학습하는 방법을 개발하는 것.
  • 맥락에 따라 사실성 또는 스타일적 구성 요소에 동적으로 주의를 기울일 수 있도록 하여 생성 품질을 향상시키는 것.

제안 방법

  • 사실성과 스타일화된 지식을 별도로 인코딩하기 위해 두 개의 독립적인 행렬 그룹을 사용하는 스타일-사실 LSTM을 제안하며, 각 타임스텝에서 이러한 구성 요소에 대한 주의 기반 가중치를 적용한다.
  • 사전에 훈련된 사실성 캡션 생성 모델을 기준으로 삼아 훈련을 안내하는 적응형 학습 메커니즘을 도입하여, 각 단계에서 얼마나 많은 사실 지식을 통합할지 동적으로 조정한다.
  • 모델의 예측을 기준 모델의 출력과 일치시키기 위해 유사도 기반 손실 함수를 사용하여, 스타일화된 캡션 생성 중 사실성 일관성을 확보한다.
  • 숨겨진 상태 맥락을 기반으로 사실성과 스타일화된 구성 요소 간의 동적 주의 가중치를 계산하기 위해 자기주도 주의(self-attention)를 활용하여 맥락 인식 스타일 전환을 가능하게 한다.
  • 단어 수준의 감정 강도와 같은 추가 애너테이션에 의존하지 않고, 이미지-캡션 쌍만을 사용하여 모델을 종합적으로 훈련한다.
  • 관련 시각적 특징에 집중하고, 이를 사실성 및 스타일화된 언어 구성 요소와 정렬하기 위해 주의 메커니즘을 적용한다.

실험 결과

연구 질문

  • RQ1추가적인 감시 없이도 통합 모델이 사실성 정확성과 스타일적 표현을 효과적으로 균형 잡는 데 성공할 수 있는가?
  • RQ2맥락에 따라 캡션 생성 중 사실성 구성 요소와 스타일화된 구성 요소에 동적으로 주의를 기울일 수 있는가?
  • RQ3기본 사실 모델이 스타일화된 캡션 훈련 중 사실 내용의 유지에 효과적인가?
  • RQ4사실 지식을 적응형으로 통합하면 스타일화된 캡션 벤치마크에서 성능 향상이 이루어지는가?

주요 결과

  • 제안된 모델은 유머/로맨틱 및 긍정/부정 스타일화된 캡션 데이터셋에서 최신 기술을 초월하는 성능을 달성하였으며, 추가적인 애너테이션 없이도 성능을 냈다.
  • 감정 캡션 데이터셋에서, 음성 세트에 대해 BLEU-1/2/3/4 점수는 각각 50.5/31.0/20.1/13.3이며, 긍정 세트에 대해 50.3/31.0/20.1/13.3를 기록하여 Senticap 및 기타 기준 모델을 뛰어넘었다.
  • 긍정 세트에서 CIDEr 점수는 60.0, 음성 세트에서 59.7을 기록하여 Senticap(각각 54.4 및 61.8) 및 기타 기준 모델을 크게 앞서며 성능을 뛰어넘었다.
  • 시각화 결과는 모델이 사실성과 스타일화된 구성 요소를 자동으로 구분하며, 맥락에 따라 적절하게 주의 가중치를 조정함을 확인했다.
  • 적응형 학습 메커니즘이 스타일화된 캡션 훈련 중 사실 내용의 유지에 효과적이었으며, 기준 모델과의 성능 향상 및 주의 정렬을 통해 이를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.