[論文レビュー] "President Vows to Cut Hair": Dataset and Analysis of Creative Text Editing for Humorous Headlines
この論文は Humicroedit を紹介する。Humicroedit は humorous になることを意図した 15,095 件の編集済みニュース見出しのデータセットであり、ユーモア生成戦略を分析し、 baseline のユーモア検出モデルを構築する。
We introduce, release, and analyze a new dataset, called Humicroedit, for research in computational humor. Our publicly available data consists of regular English news headlines paired with versions of the same headlines that contain simple replacement edits designed to make them funny. We carefully curated crowdsourced editors to create funny headlines and judges to score a to a total of 15,095 edited headlines, with five judges per headline. The simple edits, usually just a single word replacement, mean we can apply straightforward analysis techniques to determine what makes our edited headlines humorous. We show how the data support classic theories of humor, such as incongruity, superiority, and setup/punchline. Finally, we develop baseline classifiers that can predict whether or not an edited headline is funny, which is a first step toward automatically generating humorous headlines as an approach to creating topical humor.
研究の動機と目的
- 見出しの短く、単語1語の編集を公開データとして提供し、 humor を誘発するようにする。
- マイクロ編集が古典的なユーモア理論(不整合、 setup/punchline、優越感)とどのように関連するかを分析する。
- ユーモアの潜在力を最大化する編集戦略と語のクラスタを特定する。
- edited 見出しが面白いかどうかを予測するベースライン分類器を開発する。
- 自動的な面白い見出し生成とパーソナライズに対する影響を探る。
提案手法
- 訓練済みエディターを用いて、元の Reddit ベースの見出しを収集し、小さな単語編集(マイクロエディット)を適用する。
- 5 名のジャッジで編集済み見出しを注釈し、平均面白さスコアを取得する。
- 理論と語の距離、 setup/punchline の配置、語のクラスタ分析を通じてユーモアを定量的に分析する。
- edited 見出しを用いて、ロジスティック回帰、ランダムフォレスト、SVM の非ニューラルベースラインと、双方向 LSTM のニューラルベースラインを訓練して面白さを予測する。
- 極端なデータ分割と全体的な性能を評価するために、分類器を様々な分割で評価する。
実験結果
リサーチクエスチョン
- RQ1どのタイプのマイクロエディットが信頼性高く面白い見出しを生み出すのか。
- RQ2不整合、 setup/punchline、優越感といったユーモア理論がマイクロ編集済み見出しにどのように現れるのか。
- RQ3見出しテキストだけを用いて、機械学習モデルは edited 見出しが面白いか否かを予測できるか。
- RQ4品詞の置換(名詞/動詞 vs. 実体)によってユーモア検出性能はどう変わるか。
- RQ5見出しからユーモアデータセットを構築する際の限界と課題、編集者/判定者が信頼性に与える影響は何か。
主な発見
- Humicroedit には五名の判定者の平均的な面白さスコアを持つ 15,095 件の編集見出しが含まれる。
- 長い見出しは非常に短いものよりもユーモアの潜在力が高い傾向がある。
- 置換された語と追加された語の間の不整合は、特に極端な面白さケースでユーモアと相関する。
- setup/punchline のパターンが、編集者が後半の語置換を好み、より面白い結果を生む傾向に現れる。
- 置換語のクラスタは、衣料、性的表現、食べ物、侮辱などのカテゴリにまたがるユーモア戦略を明らかにする。
- Glove 埋め込みを使用したベースライン LSTM モデルは、特定の分割で funny/not-funny 分類において約 68.54% の精度を達成し、非ニューラルベースラインを上回る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。