Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Joking Machine : Humorous image captioning

Kota Yoshida, Munetaka Minoguchi|arXiv (Cornell University)|2018. 05. 30.
Video Analysis and Summarization참고 문헌 1인용 수 12
한 줄 요약

이 논문은 Bokete 웹 서비스에서 수집한 대규모 이미지-캡션 쌍 데이터셋인 BoketeDB를 활용해 미세조정된 CNN+LSTM 모델을 기반으로 한 유머 있는 이미지 캡션 생성 시스템인 Neural Joking Machine(NJM)을 제안한다. 사용자 별점 평가(1–3점)를 기반으로 가중치를 적용하는 Funny Score라는 손실 함수를 도입함으로써, 모델은 웃음을 유도하는 데 최적화되어 있으며, 기준 모델보다 높은 인간 평가 순위를 기록하고, MS COCO 캡션의 일본어 번역 버전보다 실제 사용자 평가에서 뛰어난 성능을 보였다.

ABSTRACT

What is an effective expression that draws laughter from human beings? In the present paper, in order to consider this question from an academic standpoint, we generate an image caption that draws a "laugh" by a computer. A system that outputs funny captions based on the image caption proposed in the computer vision field is constructed. Moreover, we also propose the Funny Score, which flexibly gives weights according to an evaluation database. The Funny Score more effectively brings out "laughter" to optimize a model. In addition, we build a self-collected BoketeDB, which contains a theme (image) and funny caption (text) posted on "Bokete", which is an image Ogiri website. In an experiment, we use BoketeDB to verify the effectiveness of the proposed method by comparing the results obtained using the proposed method and those obtained using MS COCO Pre-trained CNN+LSTM, which is the baseline and idiot created by humans. We refer to the proposed method, which uses the BoketeDB pre-trained model, as the Neural Joking Machine (NJM).

연구 동기 및 목표

  • 인공지능에서 웃음을 측정하는 데 어려운 과제를 해결하기 위해, 웃음을 유도하도록 설계된 캡션을 생성하는 계산 프레임워크를 개발하는 것.
  • Bokete 웹 서비스에서 유래한 실제 세계의 대규모 유머러스한 이미지-캡션 쌍 데이터셋을 구축하여 훈련 및 평가를 지원하는 것.
  • 사용자가 제공한 별점 평가(1–3점)를 기반으로 캡션 품질을 가중치화하는 새로운 손실 함수인 Funny Score를 설계하여 유머에 더 잘 최적화된 학습을 가능하게 하는 것.
  • 인간이 생성한 캡션과 사전 훈련된 MS COCO 기반 기준 모델을 대비로 하여 인간 평가 및 Bokete에서의 실시간 배포를 통해 모델 성능을 평가하는 것.

제안 방법

  • 시스템은 Show and Tell 모델에서 유도된 CNN+LSTM 아키텍처를 사용하며, 이미지 특징 추출에 ResNet-152를, 순차적 캡션 생성에 LSTM을 활용한다.
  • Funny Score는 사용자 별점 평가에 기반한 커스터마이징된 손실 함수로, 100점 이상의 별점을 받은 캡션에는 높은 페널티(L−1.0)를 적용하고, 낮은 평가를 받은 캡션은 손실(L)을 정규화함으로써 훈련 중에 더 재치 있는 출력을 우선순위로 삼는다.
  • BoketeDB는 Bokete Ogiri 웹사이트에서 999,571개의 이미지-캡션 쌍을 크롤링하여 구축된 대규모 사용자 평가 기반 데이터셋으로, 유머러스한 캡션 생성에 적합하다.
  • 모델는 표준 교차 엔트로피 손실 대신 Funny Score를 주요 최적화 목표로 삼아 BoketeDB에서 미세조정된다.
  • 인간 평가는 세 가지 출처의 캡션(인간이 생성한, NJM이 생성한, STAIR-caption(번역된 MS COCO))을 블라인드 설문지로 순위 매김하는 방식으로 수행된다.
  • 또한 Bokete에 시스템을 배포하여 사용자 별점 평가를 통해 실시간 사용자 피드백을 수집함으로써, 실시간 SNS 환경에서의 성능을 검증한다.

실험 결과

연구 질문

  • RQ1사용자가 제공한 별점 평가만을 지도로 사용하여 딥 러닝 모델이 효과적으로 유머러스한 이미지 캡션을 생성하도록 훈련시킬 수 있는가?
  • RQ2일반 데이터셋에서 미세조정된 표준 이미지 캡션 모델 대비 유머에 최적화된 모델의 성능은 어떻게 다른가?
  • RQ3자체 수집한 사용자 평가 기반 데이터셋(BoketeDB)이 MS COCO와 같은 기존 벤치마크를 능가하여 더 재치 있는 캡션을 생성할 수 있는가?
  • RQ4Funny Score 손실 함수는 표준 교차 엔트로피 손실보다 더 효과적인 유머 최적화를 이끌 수 있는가?

주요 결과

  • 인간이 생성한 캡션은 전체의 67.99% 비중에서 가장 재치 있는 것으로 평가되었으며, NJM과 STAIR 캡션 기준 모델보다 뚜렷이 높은 성능을 보였다.
  • NJM가 생성한 캡션은 22.59% 비중에서 가장 재치 있는 것으로 평가되었으며, STAIR 캡션 기준 모델보다 높은 순위를 기록했고, STAIR 캡션은 유일하게 가장 높은 순위를 기록한 비중이 9.41%에 그쳤다.
  • Bokete에서의 실시간 배포 결과, NJM가 생성한 캡션의 평균 별점은 3.23점이었고, STAIR 캡션은 1.71점이었으며, 이는 더 높은 사용자 참여도와 더 높은 유머 인식을 의미한다.
  • Funny Score 손실 함수는 훈련 중에 높은 평가를 받은 캡션을 우선순위로 삼아, 표준 훈련 목표 대비 명백한 유머 품질 향상을 이끌어냈다.
  • 999,571개의 이미지-캡션 쌍을 포함한 BoketeDB는 MS COCO보다 이미지 수가 적지만, 캡션의 유머 감각에서 뛰어난 성능을 보이며, 유머 인식 모델 훈련에 유용하고 확장 가능한 자원임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.