Skip to main content
QUICK REVIEW

[논문 리뷰] Equal But Not The Same: Understanding the Implicit Relationship Between Persuasive Images and Text

Mingda Zhang, Rebecca Hwa|arXiv (Cornell University)|2018. 09. 01.
Language, Metaphor, and Cognition인용 수 10
한 줄 요약

이 논문은 광고에서 설득적 이미지와 텍스트 사이의 비문학적, 암묵적인 관계를 조사하며, 이미지-텍스트 쌍이 평행(비문학적으로 동일한 메시지를 전달함)인지 여부를 분류하는 방법을 제안한다. 인터넷을 통한 데이터 수집 및 이미지 창의성과 텍스트의 구체성/모호성에 대한 특징을 활용하여, 표준 이미지-텍스트 정렬 방법보다 평행성 예측에서 뛰어난 성능을 보인다.

ABSTRACT

Images and text in advertisements interact in complex, non-literal ways. The two channels are usually complementary, with each channel telling a different part of the story. Current approaches, such as image captioning methods, only examine literal, redundant relationships, where image and text show exactly the same content. To understand more complex relationships, we first collect a dataset of advertisement interpretations for whether the image and slogan in the same visual advertisement form a parallel (conveying the same message without literally saying the same thing) or non-parallel relationship, with the help of workers recruited on Amazon Mechanical Turk. We develop a variety of features that capture the creativity of images and the specificity or ambiguity of text, as well as methods that analyze the semantics within and across channels. We show that our method outperforms standard image-text alignment approaches on predicting the parallel/non-parallel relationship between image and text.

연구 동기 및 목표

  • 문자 그대로의 일치를 넘어서 광고에서 설득적 이미지와 텍스트 사이의 복잡한 비문학적 관계를 이해하기 위해.
  • 기존의 이미지 캡션 생성 방법이 단지 중복적이고 문자 그대로의 이미지-텍스트 쌍만 모델링한다는 한계를 해결하기 위해.
  • 광고에서 평행(비문학적 유사성)과 비평행 이미지-텍스트 관계를 구분할 수 있는 분류 프레임워크를 개발하기 위해.
  • 암묵적인 의미적 연결을 포착하기 위해 인간이 애너테이션한 이미지-슬로건 관계에 대한 해석 데이터셋을 수집하고 분석하기 위해.

제안 방법

  • 아마존 메카니컬 터크를 통해 광고에 대한 해석 데이터셋을 수집하고, 이미지-슬로건 쌍을 평행 또는 비평행으로 레이블링한다.
  • 이미지의 창의성과 텍스트의 구체성 또는 모호성을 캡처하는 특징을 설계하여 비문학적 관계를 모델링한다.
  • 의미 분석 기법을 적용하여 이미지 및 텍스트 모odal 간 및 내부의 의미를 분석한다.
  • 이러한 특징을 사용하여 이미지-슬로건 쌍이 평행 관계를 형성하는지 예측하는 분류 모델을 훈련시킨다.
  • 표현의 내용 일치를 넘어서, 이미지 및 텍스트 표현을 비교하고 정렬하기 위해 다중 모odal 의미 임베딩을 사용한다.

실험 결과

연구 질문

  • RQ1사람들은 문자 그대로의 내용 일치를 넘어서 광고에서 설득적 이미지와 슬로건 사이의 관계를 어떻게 인식하는가?
  • RQ2광고에서 이미지와 텍스트 사이의 암묵적 비문학적 연결을 가장 잘 캡처하는 특징는 무엇인가?
  • RQ3기계 학습 모델이 의미적 및 스타일적 특징을 기반으로 이미지-슬로건 쌍을 평행 또는 비평행으로 효과적으로 분류할 수 있는가?
  • RQ4제안된 방법은 평행성 예측에서 표준 이미지-텍스트 정렬 방법과 비교해 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 방법은 표준 이미지-텍스트 정렬 기법에 비해 평행 대 비평행 이미지-텍스트 관계 예측에서 뛰어난 성능을 보였다.
  • 이미지의 창의성과 텍스트의 구체성/모호성을 캡처하는 특징가 분류 성능 향상에 크게 기여했다.
  • 인간이 애너테이션한 해석을 통해 평행 관계는 종종 문자 그대로의 내용이 아니라 은유적 또는 상징적 의미에 기반하는 것으로 드러났다.
  • 애너테이션된 이미지-슬로건 쌍의 데이터셋은 광고에서 암묵적인 이미지-텍스트 관계를 연구하는 데 있어 귀중한 자원을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.