Skip to main content
QUICK REVIEW

[論文レビュー] Dutch Humor Detection by Generating Negative Examples

Thomas Winters, Pieter Delobelle|arXiv (Cornell University)|Oct 26, 2020
Humor Studies and Applications参考文献 28被引用数 4
ひとこと要約

本稿では、テキスト生成アルゴリズムを用いて現実的でないジョークでない例を生成することで、より挑戦的なベンチマークを構築する、オランダ語のユーモア検出のための新規手法を提案する。従来の研究とは異なり、ドメイン外の非ジョーク(例:ニュース記事、格言)ではなく、これらの生成された否定例を用いてモデルを訓練および評価する。ロバストなモデル(RobBERT)が、従来のモデルを著しく上回り、ジョーク検出で98.8%の正確性を達成した。これは、低リソース環境における文脈を考慮したトランスフォーマーの効果を示している。

ABSTRACT

Detecting if a text is humorous is a hard task to do computationally, as it usually requires linguistic and common sense insights. In machine learning, humor detection is usually modeled as a binary classification task, trained to predict if the given text is a joke or another type of text. Rather than using completely different non-humorous texts, we propose using text generation algorithms for imitating the original joke dataset to increase the difficulty for the learning algorithm. We constructed several different joke and non-joke datasets to test the humor detection abilities of different language technologies. In particular, we compare the humor detection capabilities of classic neural network approaches with the state-of-the-art Dutch language model RobBERT. In doing so, we create and compare the first Dutch humor detection systems. We found that while other language models perform well when the non-jokes came from completely different domains, RobBERT was the only one that was able to distinguish jokes from generated negative examples. This performance illustrates the usefulness of using text generation to create negative datasets for humor recognition, and also shows that transformer models are a large step forward in humor detection.

研究の動機と目的

  • オランダ語における堅牢で文脈に配慮したユーモア検出システムの不足を補うために、より挑戦的なベンチマークを構築すること。
  • ドメイン固有の語彙に依存する従来のモデルが、ジョークの構造的・語彙的特徴を模倣する非ジョークによってだまされるかどうかを調査すること。
  • 特にRobBERTを含む最新のトランスフォーマー基盤モデルが、新規でより難しいユーモア検出ベンチマークでどのように性能を発揮するかを評価すること。
  • テキスト生成を用いて低リソースNLPタスク(例:ユーモア検出)における現実的な否定例を生成する有効性を示すこと。

提案手法

  • 著者らは、オランダ語のジョークコーパスの語彙的・文法的パターンを模倣する動的テンプレート(DT)アルゴリズムを用いて、非ジョーク例を生成する。
  • 彼らは3つの異なるデータセットを構築した:生成された非ジョークを含むデータセット、ニュース記事を含むデータセット、および格言を含むデータセット。これらすべては、実際のジョークとペairedされている。
  • 彼らは複数のモデル(ナイーブベイズ、LSTM、CNN、RobBERT)を、これらのデータセット上で二値分類(ジョーク/非ジョーク)にファインチューニングする。
  • ペairワイズ分類では、ジョークとその生成された非ジョークの対を比較し、モデルにどちらが面白いと判断させる。
  • RobBERTは、[SEP]トークンで区切られた1つの入力シーケンスに2つのテキストを処理するシーケンス分類ヘッドでファインチューニングされる。
  • 評価には、ホールドアウトされたテストセット上で95%信頼区間を用いた正確性(accuracy)とF1スコアが用いられた。

実験結果

リサーチクエスチョン

  • RQ1ドメイン外の非ジョーク(例:ニュース記事、格言)で訓練されたユーモア検出モデルは、ジョークに類似した構造的・語彙的特徴を持つ非ジョークにだまされるおそれがあるか?
  • RQ2ジョークに類似した構造的特徴を持つ非ジョークを含む、より難しいドメイン内否定例データセットにおいて、最新の文脈的言語モデル(例:RobBERT)は、従来のニューラルネットワーク(LSTM、CNN)をどの程度上回るか?
  • RQ3テキスト生成アルゴリズムを用いて否定例を生成することは、ユーモア検出システムの評価に、より効果的なベンチマークを提供するか?
  • RQ4ジョークと生成された非ジョーク、それともドメイン外の非ジョークとを比較して分類する際、モデルの性能はどのように変化するか?

主な発見

  • RobBERTは生成された非ジョークデータセットで98.8%の正確性と98.8%のF1スコアを達成し、他のすべてのモデルを著しく上回った。
  • LSTMとCNNモデルはニュースおよび格言データセットで94%を超える正確性を示したが、生成された非ジョークセットでは約47%に低下し、これらモデルがドメインの手がかりに依存していることが示された。
  • ナイーブベイズはすべてのデータセットで低い性能を示し、正確性が60%未満にとどまり、bag-of-wordsアプローチの限界が浮き彫りになった。
  • ペアワイズ分類タスクでは、RobBERTは82.5%の正確性を維持したが、単一分類設定よりわずかに低く、おそらく入力長の制約によるものと推測された。
  • 生成された非ジョークデータセットは、従来のドメイン外非ジョークよりも著しく困難であることが判明した。特に、語彙的またはドメイン固有の特徴に依存するモデルにとっては顕著だった。
  • 他のモデルに比べて、RobBERTは生成された非ジョークセットで89.2%の正確性を示し、文脈理解の能力が優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。