Skip to main content
QUICK REVIEW

[논문 리뷰] Humor Detection: A Transformer Gets the Last Laugh

Orion Weller, Kevin Seppi|arXiv (Cornell University)|2019. 08. 31.
Humor Studies and Applications참고 문헌 18인용 수 4
한 줄 요약

이 논문은 레딧 업보트 점수를 약한 지도 신호로 활용하여 빌드된 트랜스포머 기반 모델을 제안하며, 농담을 유머러스한지 여부로 분류한다. 약 16,000개의 레딧 레이블이 부여된 농담으로 훈련된 모델는 숏 재미있는 농담 데이터셋에서 98.6%의 F1 점수를 기록하며 최신 기술 수준을 달성했고, 패러디 데이터셋에서는 93.1%를 기록하여 이전의 컨볼루션 신경망 기반 방법들을 능가하며, 레딧 전용 농담에 대해 인간 수준의 일致도에 가까워졌다.

ABSTRACT

Much previous work has been done in attempting to identify humor in text. In this paper we extend that capability by proposing a new task: assessing whether or not a joke is humorous. We present a novel way of approaching this problem by building a model that learns to identify humorous jokes based on ratings gleaned from Reddit pages, consisting of almost 16,000 labeled instances. Using these ratings to determine the level of humor, we then employ a Transformer architecture for its advantages in learning from sentence context. We demonstrate the effectiveness of this approach and show results that are comparable to human performance. We further demonstrate our model's increased capabilities on humor identification problems, such as the previously created datasets for short jokes and puns. These experiments show that this method outperforms all previous work done on these tasks, with an F-measure of 93.1% for the Puns dataset and 98.6% on the Short Jokes dataset.

연구 동기 및 목표

  • 레딧에서 사용자들이 업로드한 실제 평가 점수를 활용하여 농담의 유머를 식별하는 기계 학습 모델을 개발하는 것.
  • 트랜스포머 아키텍처가 이전의 신경망 모델들보다 농담 탐지 작업에서 뛰어난 성능을 보일 수 있는지 조사하는 것.
  • 모델의 일반화 능력을 다양한 농담 유형(예: 패러디, 짧은 일문선)에 대해 평가하는 것.
  • 특히 레딧 사용자와 일반 청중 간의 일致도를 구분할 때, 모델 예측이 인간의 공감에 비해 어떻게 비교되는지 평가하는 것.
  • 자기주의 기반 메커니즘이 농담을 정의하는 미묘한 언어적 특징을 효과적으로 포착할 수 있음을 보여주는 것.

제안 방법

  • 모델는 15,984개의 레딧 농담으로 구성된 데이터셋에 대해 사전 학습된 BERT 기반 트랜스포머 인코더를 미세조정하여 사용한다.
  • 업보트 수가 200 이상인 농담은 유머러스한 것으로 분류하고, 200 미만인 농담은 유머러스하지 않다고 레이블링하여 이진 분류 작업을 수행한다.
  • 모델는 농담 본문만, 핵심 전개만, 전체 농담(본문 + 핵심 전개)의 세 가지 변형으로 훈련 및 평가된다.
  • 전이 학습을 위해 세 가지 벤치마크 데이터셋을 사용한다: 숏 재미있는 농담(231만 개의 농담), 패러디의 날(16,000개의 패러디), 레딧 자체의 농담 데이터셋.
  • 인간 평가에서는 아마존 메카니컬 터크를 통해 199명의 참가자가 각각 30개의 농담을 평가하였고, 다수결 투표를 통해 진실 레이블을 결정하였다.
  • 모델의 성능는 컨볼루션 신경망에 하이웨이 레이어를 적용한 모델과 인간의 성능을 동일한 작업에서 비교하였다.

실험 결과

연구 질문

  • RQ1레딧 업보트 점수를 약한 지도 신호로 사용하여 트랜스포머 기반 모델이 농담 탐지 작업을 효과적으로 학습할 수 있는가?
  • RQ2이전 최신 기술 수준의 모델들, 특히 컨볼루션 신경망 기반 접근 방식과 비교하여 모델의 농담 탐지 성능는 어떠한가?
  • RQ3패러디나 짧은 일문선 같은 다양한 농담 유형에 대해 모델의 일반화 능력은 얼마나 우수한가?
  • RQ4특히 레딧 사용자와 일반 청중 간의 차이를 고려할 때, 모델의 예측은 인간의 공감과 어떻게 비교되는가?
  • RQ5농담의 어떤 부분—본문인지 핵심 전개인지—유머로 인식되는 데 더 큰 영향을 미치는가?

주요 결과

  • 트랜스포머 모델은 숏 재미있는 농담 데이터셋에서 98.6%의 F1 점수를 기록하였으며, 이는 이전 최고 성능을 기록한 컨볼루션 신경망 기반 방법보다 8퍼센트 포인트 향상된 것이다.
  • 패러디의 날 데이터셋에서는 93.1%의 정확도를 기록하였고, 이는 이전 최고의 컨볼루션 신경망 모델보다 4퍼센트 포인트 향상된 성과이다.
  • 레딧 테스트 세트에서 모델은 72.4%의 정확도를 기록하였으며, 컨볼루션 신경망 베이스라인(고작 60대 중반)을 능가하였고, 일반 인간 평가자들의 66.3% 일치율에 가까워졌다.
  • 모든 모델, 인간을 포함하여 농담 분류 작업에서 핵심 전개보다 본문에 더 큰 영향을 미치는 경향을 보였으며, 이는 핵심 전개가 더 높은 예측적 가중치를 지닌다는 것을 시사한다.
  • 레딧 데이터셋에서의 성능 결과는 모델이 r/Jokes 커뮤니티의 특정한 유머 선호도를 학습하고 있음을 시사하며, 청중 기반의 유머 탐지가 가능하다는 것을 보여준다.
  • 결과적으로 트랜스포머의 자기주의 기반 메커니즘이 짧고 맥락 의존적인 농담에서 농담을 정의하는 언어적 특징을 매우 효과적으로 포착할 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.