Skip to main content
QUICK REVIEW

[논문 리뷰] Similar Scenes arouse Similar Emotions: Parallel Data Augmentation for Stylized Image Captioning

Guodun Li, Yuchen Zhai|arXiv (Cornell University)|2021. 08. 26.
Multimodal Machine Learning Applications참고 문헌 46인용 수 5
한 줄 요약

이 논문은 감정적 유사성과 맥락적 유사성을 장면 간에 활용하여 스타일화된 이미지 캡션 생성에서의 데이터 부족 문제를 해결하기 위해 새로운 추출-검색-생성(ERG) 데이터 증강 프레임워크를 제안한다. 소규모 스타일화된 캡션에서 스타일 품질 어휘를 추출하고, 대규모 사실 기반 데이터에서 의미적이고 시각적으로 유사한 장면을 검색하며, 감정 인식 생성을 통해 다양하고 유창한 스타일화된 캡션을 생성함으로써, 모델의 캡션 관련성과 스타일리시함을 크게 향상시킨다. 이는 지도 학습 및 비지도 학습 설정에서 최신 기술을 초월한다.

ABSTRACT

Stylized image captioning systems aim to generate a caption not only semantically related to a given image but also consistent with a given style description. One of the biggest challenges with this task is the lack of sufficient paired stylized data. Many studies focus on unsupervised approaches, without considering from the perspective of data augmentation. We begin with the observation that people may recall similar emotions when they are in similar scenes, and often express similar emotions with similar style phrases, which underpins our data augmentation idea. In this paper, we propose a novel Extract-Retrieve-Generate data augmentation framework to extract style phrases from small-scale stylized sentences and graft them to large-scale factual captions. First, we design the emotional signal extractor to extract style phrases from small-scale stylized sentences. Second, we construct the plugable multi-modal scene retriever to retrieve scenes represented with pairs of an image and its stylized caption, which are similar to the query image or caption in the large-scale factual data. In the end, based on the style phrases of similar scenes and the factual description of the current scene, we build the emotion-aware caption generator to generate fluent and diversified stylized captions for the current scene. Extensive experimental results show that our framework can alleviate the data scarcity problem effectively. It also significantly boosts the performance of several existing image captioning models in both supervised and unsupervised settings, which outperforms the state-of-the-art stylized image captioning methods in terms of both sentence relevance and stylishness by a substantial margin.

연구 동기 및 목표

  • 대규모 쌍체 스타일화된 이미지-캡션 데이터셋이 희귀하고 구축에 비용이 많이 들기 때문에, 스타일화된 이미지 캡션 생성에서의 데이터 부족 문제를 해결하기 위함이다.
  • 비지도 학습에 대한 보완적인 접근으로 데이터 증강을 탐색하여, 쌍체가 아닌 텍스트나 복잡한 스타일 분리 기법에만 의존하지 않고도 모델 성능을 향상시키기 위함이다.
  • 심리학적 원리—특히 '맥락 효과'—를 활용하여 유사한 장면들이 유사한 감정을 유도하고, 그로 인해 유사한 표현 스타일 어휘가 유도된다는 점을 고려한다.
  • 기존의 이미지 캡션 모델을 최소한의 아키텍처 변경으로도 쉽게 향상시킬 수 있는 플러그 앤 플레이형 모듈러 프레임워크를 개발하기 위함이다.
  • 특히 저자원 및 비지도 설정에서 문장의 관련성과 스타일리시함을 모두 향상시키기 위함이다.

제안 방법

  • 감정 신호 추출기(Emotional Signal Extractor)는 자연어 처리 기법을 사용하여 소규모 스타일화된 캡션에서 언어적 스타일 어휘(예: '자연의 아름다움을 즐기세요')를 식별하고 분리한다.
  • 플러그 앤 플레이 다중모달 장면 검색기(Multi-modal Scene Retriever)는 사전 학습된 시각-언어 트랜스포머를 활용하여 이미지-이미지, 이미지-텍스트, 텍스트-이미지, 텍스트-텍스트 간의 교차 모odal 유사도를 계산하여 대규모 사실 기반 이미지-캡션 데이터셋에서 의미적으로나 시각적으로 유사한 장면을 찾는다.
  • 감정 인식 캡션 생성기(Emotion-aware Caption Generator)는 쿼리 이미지의 사실 기반 기술과 유사 장면에서 검색된 스타일 어휘를 조합하여 자연스럽고 다양하며 스타일적으로 일관된 캡션을 생성한다.
  • 프레임워크는 추출-검색-생성의 3단계 파이프라인으로 작동한다: 소규모 스타일화된 데이터에서 스타일 어휘를 추출하고, 다중모달 임베딩을 사용해 유사한 장면을 검색하며, 조건부 생성을 통해 새로운 스타일화된 캡션을 생성한다.
  • 이 방법은 다양한 사전 학습된 모델(예: GPT-2, T5)과 호환되며, 쌍체가 아닌 스타일화된 텍스트와 사실 기반 이미지-캡션 쌍이 존재하는 경우에도 기능할 수 있다.
  • 검색 및 생성 과정에서 발생하는 노이즈에 대해 강건함을 입증하였으며, 예시를 통해 생성기가 검색된 스타일 어휘의 미세한 오류를 수정하는 것으로 확인되었다.

실험 결과

연구 질문

  • RQ1대규모 쌍체 데이터가 필요 없이도 장면 간 감정적 유사성과 맥락적 유사성을 활용하여 고품질이고 다양한 스타일화된 캡션을 생성할 수 있는가?
  • RQ2시각적 및 텍스트 임베딩 기반의 다중모달 검색 시스템이 서로 다른 데이터셋 간에 의미적으로 유사한 장면을 얼마나 잘 식별할 수 있는가?
  • RQ3유사한 장면에서 유래한 스타일 어휘의 통합이 생성된 캡션의 관련성과 스타일리시함을 얼마나 향상시키는가?
  • RQ4제안된 프레임워크는 지도 학습 및 비지도 학습 설정 모두에서 성능 향상을 이끌 수 있으며, 특히 최신 사전 학습된 모델과 조합했을 때 효과적인가?
  • RQ5노이즈가 있는 또는 완벽하지 않은 검색 결과에 대해 강건하며, 문법적으로 올바르고 맥락에 적절한 캡션을 생성할 수 있는가?

주요 결과

  • ERG 프레임워크는 스타일화된 이미지 캡션 생성에서의 데이터 부족 문제를 크게 완화하며, 다양한 벤치마크에서 성능 향상을 이룬다.
  • 이 방법은 지도 학습 및 비지도 학습 설정에서 최신 기술을 초월하여 CIDEr 점수(최대 45.97)와 스타일리시함(cls) 점수에서 뛰어난 성능을 보인다.
  • i2i, i2t, t2i, t2t 검색 방법을 조합하여 사용할 경우, 단일 검색 유형보다 더 나은 성능을 내며, 유용한 증강 샘플의 수를 증가시킨다.
  • 프레임워크는 하이퍼파라미터 선택(예: 증강 데이터 비율)에 대해 강건하며, 합리적인 범위(예: 0.05에서 0.5) 내에서 성능이 안정적으로 유지된다.
  • GPT-2와 T5 기반 생성기 모두 강력한 성능을 보이며, 이는 프레임워크가 다양한 사전 학습된 아키텍처와의 유연성과 호환성을 확인한다.
  • 쌍체가 아닌 스타일화된 텍스트와 사실 기반 이미지-캡션 데이터가 존재하는 경우에도 프레임워크가 효과적으로 기능함을 입증하여, 실세계의 저자원 상황에서의 실용성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.