[論文レビュー] Humor Detection: A Transformer Gets the Last Laugh
本論文では、Redditのいいね数を弱い教師信号として用い、ジョークをユーモラスまたはそうでないか分類するTransformerベースのモデルを提案する。約16,000件のRedditラベル付きジョークで訓練されたモデルは、ショートジョークデータセットで98.6%のF1スコア、パロディジョークデータセットで93.1%のF1スコアを達成し、先行するCNNベースの手法を上回り、Reddit固有のユーモアにおいて人間水準の合意に近づいている。
Much previous work has been done in attempting to identify humor in text. In this paper we extend that capability by proposing a new task: assessing whether or not a joke is humorous. We present a novel way of approaching this problem by building a model that learns to identify humorous jokes based on ratings gleaned from Reddit pages, consisting of almost 16,000 labeled instances. Using these ratings to determine the level of humor, we then employ a Transformer architecture for its advantages in learning from sentence context. We demonstrate the effectiveness of this approach and show results that are comparable to human performance. We further demonstrate our model's increased capabilities on humor identification problems, such as the previously created datasets for short jokes and puns. These experiments show that this method outperforms all previous work done on these tasks, with an F-measure of 93.1% for the Puns dataset and 98.6% on the Short Jokes dataset.
研究の動機と目的
- Redditのユーザーがアップロードしたレーティングを実世界のデータとして用い、ユーモラスなジョークを識別する機械学習モデルを開発すること。
- Transformerアーキテクチャが、ユーモア検出タスクにおいて、従来のニューラルネットワークモデルを上回る性能を示すかどうかを調査すること。
- モデルの汎化性能を、パロディジョークや短いワンライナーを含む多様なジョークタイプに対して評価すること。
- 特にRedditユーザーと一般大衆の両者における人間の合意と比較して、モデルの予測がどのように異なるかを評価すること。
- 自己注意機構が、ユーモアを特徴付ける微細な言語的特徴をどのように捉えられるかを示すこと。
提案手法
- モデルは、15,984件のRedditジョークを含むデータセット上で、事前学習済みのBERTベースのTransformerエンコーダーを微調整して使用する。
- いいね数が200以上であるジョークは「ユーモラス」と分類し、200未満のものは「非ユーモラス」とラベル付けすることで、二値分類タスクを構築する。
- モデルは、ジョーク本文のみ、パンチャインのみ、およびフルジョーク(本文+パンチャイン)の3つのバージョンで訓練および評価される。
- 転移学習は、ショートジョーク(23万件)、パロディ・オブ・ザ・デイ(16,000件のパロディジョーク)、Reddit独自のジョークデータセットの3つのベンチマークデータセットを用いて実施される。
- 人間評価は、Amazon Mechanical Turkを介して199名の参加者が各30件のジョークを評価し、多数決によって真のラベルを決定した。
- モデルの性能は、ハイウェイ層を備えたCNNと比較された。
実験結果
リサーチクエスチョン
- RQ1Redditのいいね数という弱い教師信号を用いて、Transformerベースのモデルが効果的にユーモア検出を学習できるか。
- RQ2特にCNNベースのアプローチと比較して、本モデルのユーモア検出性能は、先行するSOTAモデルを上回るか。
- RQ3本モデルは、パロディジョークや短いワンライナーなど、多様なジョークタイプに適応できるか。
- RQ4特にRedditユーザーと一般大衆の両者における人間の合意と比較して、モデルの予測はどのように異なるか。
- RQ5ジョークのどの部分—本文かパンチャインか—が、ユーモアの認識により大きな影響を与えるか。
主な発見
- Transformerモデルはショートジョークデータセットで98.6%のF1スコアを達成し、以前の最良のCNNベースの手法よりも8ポイントの改善を示した。
- パロディ・オブ・ザ・デイデータセットでは93.1%の正答率を達成し、最良の先行CNNモデルよりも4ポイントの改善を示した。
- Redditテストセットでは72.4%の正答率を達成し、CNNベースライン(60数%台)を上回り、一般の人間評価者による66.3%の合意率に近づいた。
- 人間を含むすべてのモデルが、ユーモア分類において本文よりもパンチャインに強く依存しており、パンチャインがより高い予測的重みを持つことが示された。
- Redditデータセットにおけるモデルの性能は、r/Jokesコミュニティ特有のユーモア好みを学習していることを示しており、聴衆に特化したユーモア検出が可能であることを示している。
- 結果から、特に短く文脈依存性の高いジョークにおいて、Transformerの自己注意機構が、ユーモアを特徴付ける言語的特徴を非常に効果的に捉えられることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。