Skip to main content
QUICK REVIEW

[論文レビュー] Duluth at SemEval-2017 Task 6: Language Models in Humor Detection

Xinru Yan, Ted Pedersen|arXiv (Cornell University)|Apr 27, 2017
Humor Studies and Applications参考文献 5被引用数 3
ひとこと要約

この論文では、N-gram モデルを用いてツイートおよびニュースコーパス上で訓練された言語モデルを用い、冗談の可能性をランク付けすることで、ソーシャルメディアにおける冗談検出のための言語モデルベースのアプローチを提示している。システムは強力な性能を示した。特に、後期評価の段階でニュースデータ上で訓練された trigram モデルが、ツイートで訓練されたモデルを上回り、コーパス選択が冗談検出の精度に顕著な影響を与えることが示された。

ABSTRACT

This paper describes the Duluth system that participated in SemEval-2017 Task 6 #HashtagWars: Learning a Sense of Humor. The system participated in Subtasks A and B using N-gram language models, ranking highly in the task evaluation. This paper discusses the results of our system in the development and evaluation stages and from two post-evaluation runs.

研究の動機と目的

  • 統計的言語モデルを用いて、ソーシャルメディアデータから冗句の感覚を学ぶシステムを開発すること。
  • 多様なコーパス上で訓練された言語モデルが、短い形式のテキストにおける冗句コンテンツを効果的に検出できるかどうかを調査すること。
  • ツイートデータと一般ニュースデータ上で訓練された N-gram 言語モデル(bigram, trigram)の性能を比較し、冗句検出に用いること。
  • フィルタリング、トークナイゼーション、キャセル・センシティブ性といった前処理の選択がモデル性能に与える影響を評価すること。
  • なぜ特定のハッシュタグが他のハッシュタグよりも著しく優れた結果をもたらしたのかを理解すること、特に #BreakUpIn5Words について。

提案手法

  • KenLM を用いて、#HashtagWars から得た冗句ツイートおよび News Commentary と News Crawl コーパスから得た一般ニュースデータの2つのコーパス上で、bigram および trigram 言語モデルを訓練した。
  • 未知語の処理を改善するため、修正された Kneser-Ney スムージングを用い、バックオフを適用し、プルーニングは行わなかった。
  • URL、@メンション、および #ハッシュタグをフィルタリングし、空白および句読点でトークン化することで、ツイートを前処理した。
  • 各ツイートのログ確率スコアを、ツイートで訓練されたモデルとニュースで訓練されたモデルの両方を用いて計算し、「一般的な言語」からの逸脱度を評価した。
  • 標準的な言語パターンから逸脱するほど冗句であると考え、ニュース言語モデルからの低い確率スコアを冗句の代理指標として用いた。
  • 言語モデルのログ確率スコアに基づき、Subtask B についてツイートをランク付けし、Subtask A についてペアを比較した。

実験結果

リサーチクエスチョン

  • RQ1N-gram 言語モデルは、短いソーシャルメディアテキストにおける冗句検出にどの程度効果的か?
  • RQ2一般ニュースコーパス上で訓練された言語モデルは、冗句ツイートコーパス上で訓練されたモデルよりも、冗句検出において優れているか?
  • RQ3URL や @メンション、#ハッシュタグのフィルタリング、トークナイゼーション、キャセル・センシティブ性といった、さまざまな前処理戦略がモデル性能にどのように影響するか?
  • RQ4なぜシステムは #BreakUpIn5Words に対して他のハッシュタグよりも著しく優れた結果を出したのか?
  • RQ5bigram モデルと trigram モデルの選択が、冗句検出の性能に顕著な影響を与えるか?

主な発見

  • 開発段階では、ツイートデータ上で訓練された trigram モデルが Subtask B で F1 スコア 0.887 の最高値を記録したが、bigram モデルは Subtask A で 0.548 の精度をわずかに上回った。
  • 公式評価では、ニュースデータ上で訓練されたモデルがツイートデータ上で訓練されたモデルを上回った。特に、後期評価の段階でニュースベースの trigram モデルが最良の結果を出した。
  • 開発段階の結果とは対照的に、評価および後期評価の段階では bigram 言語モデルが trigram モデルを上回った。これは、より単純なモデルが未学習データに対してより良い一般化性能を示す可能性を示唆している。
  • ハッシュタグ #BreakUpIn5Words では、Subtask A の精度が 0.913、Subtask B の距離スコアが 0.636 に達し、この特定のハッシュタグでは他のすべてのシステムを上回った。
  • ツイートで訓練されたモデルとニュースで訓練されたモデルの性能差は、訓練コーパスのサイズと多様性がモデルの有効性に顕著に影響することを示しており、ドメインの類似性が低くても、より大きなニュースコーパスがより良い結果をもたらす傾向にある。
  • 本研究は、コーパス選択とモデルの複雑さ(bigram 対 trigram)がモデルタイプよりもより大きな影響を与えることを示しており、今後の研究では unigram モデルおよび文字レベルのモデルの検討が望ましい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。