Skip to main content
QUICK REVIEW

[논문 리뷰] "President Vows to Cut Hair": Dataset and Analysis of Creative Text Editing for Humorous Headlines

Nabil Hossain, John Krumm|arXiv (Cornell University)|2019. 06. 01.
Humor Studies and Applications참고 문헌 27인용 수 34
한 줄 요약

논문은 Humicroedit를 소개합니다. 15,095개의 편집된 뉴스 헤드라인을 유머로 의도하고, 유머 생성 전략을 분석하며 기본 유머 탐지 모델을 구축합니다.

ABSTRACT

We introduce, release, and analyze a new dataset, called Humicroedit, for research in computational humor. Our publicly available data consists of regular English news headlines paired with versions of the same headlines that contain simple replacement edits designed to make them funny. We carefully curated crowdsourced editors to create funny headlines and judges to score a to a total of 15,095 edited headlines, with five judges per headline. The simple edits, usually just a single word replacement, mean we can apply straightforward analysis techniques to determine what makes our edited headlines humorous. We show how the data support classic theories of humor, such as incongruity, superiority, and setup/punchline. Finally, we develop baseline classifiers that can predict whether or not an edited headline is funny, which is a first step toward automatically generating humorous headlines as an approach to creating topical humor.

연구 동기 및 목표

  • 유머를 유도하는 헤드라인의 짧고 단일 단어 편집을 공개적으로 이용 가능한 데이터셋으로 만든다.
  • 마이크로 에디트가 고전 유머 이론(불일치, 설정/펀치라인, 우월성)과 어떻게 관련되는지 분석한다.
  • 유머 잠재력을 최대화하는 편집 전략과 단어 군집을 식별한다.
  • 편집된 헤드라인이 유머러스한지 예측하기 위한 기본 분류기를 개발한다.
  • 자동 유머 헤드라인 생성 및 개인화에 대한 시사점을 탐구한다.

제안 방법

  • 학습된 편집자를 사용하여 원래의 Reddit 기반 헤드라인을 수집하고 작은 단어 편집(마이크로 에디트)을 적용한다.
  • 편집된 헤드라인에 다섯 명의 심판으로 주석을 달아 평균 재미 점수를 얻는다.
  • 이론 및 단어 거리, 설정/펀치라인 위치, 단어 군집 분석을 통해 유머를 정량적으로 분석한다.
  • 편집된 헤드라인을 사용하여 재미 여부를 예측하기 위해 비신경망(로지스틱 회귀, 랜덤 포레스트, SVM) 및 신경망(양방향 LSTM) 기반의 기본선을 학습시킨다.
  • 극단치와 전반적 성능을 평가하기 위해 다양한 데이터 분할에서 분류기를 평가한다.

실험 결과

연구 질문

  • RQ1어떤 유형의 마이크로 에디트가 신뢰할 수 있게 유머러스한 헤드라인을 만들어 내는가?
  • RQ2유머 이론(불일치, 설정/펀치라인, 우월성)이 마이크로 편집된 헤드라인에서 어떻게 나타나는가?
  • RQ3헤드라인 텍스트만으로 편집된 헤드라인이 유머러스한지 여부를 기계 학습 모델이 예측할 수 있는가?
  • RQ4다른 품사(명사/동사)의 교체가 엔티티와 비교하여 유머 탐지 성능에 어떤 영향을 미치는가?
  • RQ5헤드라인에서 유머 데이터셋을 구축하는 데 있어서의 한계와 도전 과제는 무엇이며 편집자/심판은 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • Humicroedit에는 다섯 명의 심판 평균 재미 점수를 가진 15,095개의 편집된 헤드라인이 포함되어 있다.
  • 더 긴 헤드라인이 매우 짧은 헤드라인보다 유머 가능성이 더 큰 경향을 보인다.
  • 대체된 단어와 추가된 단어 간의 불일치가 유머와 상관관계가 있으며, 특히 극단적으로 재미있는 경우에 그렇다.
  • 편집자들이 더 나중 단어를 바꾸는 것을 선호하여 더 재미있는 결과를 낳는 설정/펀치라인 패턴이 나타난다.
  • 대체 단어의 군집은 의상, 성, 식품, 모욕 등의 범주에서 유머 전략을 드러낸다.
  • GloVe 임베딩을 사용하는 기본 LSTM 모델이 특정 분할에서 총 68.54%의 정확도로 재미있는/재미없음 분류를 달성하여 비신경망 기본선보다 우수하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.