Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Satire in the News with Machine Learning

Andreas Stöckl|arXiv (Cornell University)|Oct 1, 2018
Humor Studies and Applications参考文献 11被引用数 3
ひとこと要約

本稿では、主流メディアおよび風刺メディアのドイツ語記事約60,000件から成るコーパスを用いて、ロジスティック回帰および線形SVMを用いた機械学習的手法により、風刺を検出する手法を提案している。既知の出版者で学習した場合、ランダムなテストセットで98.7%の精度と95.2%の再現率を達成し、高い性能を示すが、完全に未知の出典でテストした場合、正答率が88.2%に低下し、F1スコアが76.3%にまで下がることから、出版者固有の特徴に依存していることが示唆される。

ABSTRACT

We built models with Logistic Regression and linear Support Vector Machines on a large dataset consisting of regular news articles and news from satirical websites, and showed that such linear classifiers on a corpus with about 60,000 articles can perform with a precision of 98.7% and a recall of 95.2% on a random test set of the news. On the other hand, when testing the classifier on "publication sources" which are completely unknown during training, only an accuracy of 88.2% and an F1-score of 76.3% are achieved. As another result, we showed that the same algorithm can distinguish between news written by the news agency itself and paid articles from customers. Here the results had an accuracy of 99%.

研究の動機と目的

  • テキストコンテンツのみを用いて、風刺的でないニュースと風刺ニュースを区別する機械学習モデルの開発。
  • モデルが風刺を検出する際に、言語的パターンに依存しているのか、それとも出版者固有の特徴を学習しているのかを評価すること。
  • トレーニング中に含まれなかった出版者からのニュースに対して、モデルの汎化性能を評価すること。
  • 同じニュース機関からの編集コンテンツと有料広告コンテンツを区別できるかを検討すること。
  • 手動で設計された言語的特徴を必要としない状況で、大規模なトレーニングコーパスが分類器の性能に与える影響を特定すること。

提案手法

  • 主流メディアおよび風刺メディアのドイツ語ニュース記事60,000件のデータセットを用いて、ロジスティック回帰および線形サポートベクターマシン(SVM)を学習した。
  • 小文字に変換したunigramおよびbigram特徴量を用い、80%以上の文書に出現する語彙は除外し、20回以上出現する語彙のみを保持した。
  • ロジスティック回帰にはC=1,000、SVMにはC=100のL2正則化を適用し、過学習を避けるために非線形カーネルは使用しない。
  • 全コーパスに対して80/20のトレーニング・テスト分割を実施し、さらに完全に未知の出版者を対象とした別々の評価も行った。
  • 従来のストップワードフィルタリングではなく、高頻度語の除外を実施したTF-IDFベクトル化を適用した。
  • インドメインおよびアウトオブドメインの両テストセットに対して、精度、再現率、F1スコア、混同行列を用いて性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1大規模なドイツ語ニュースコーパスを用いて学習した線形分類器は、テキスト特徴量のみを用いて風刺的コンテンツを高い正確性で検出できるか?
  • RQ2モデルが風刺検出にあたって、言語的手がかりよりも、出版者固有の特性にどれほど依存しているか?
  • RQ3トレーニングデータに含まれない出版者からのニュースに対して、モデルの性能がどの程度低下するか?
  • RQ4同じニュース機関からの編集コンテンツと有料広告コンテンツを、同モデルが区別できるか?
  • RQ5複雑な特徴工学を必要としない状況で、トレーニングデータ量の増加が性能に顕著に与える影響はあるか?

主な発見

  • 11,892件の通常記事および882件の風刺記事から成るランダムなテストセットにおいて、モデルは99.6%の正答率、98.7%の精度、95.2%の再現率、F1スコア96.9%を達成した。
  • 完全に未知の出版者(『Kleine Zeitung』(通常)および『Die Tagespresse』(風刺)を除く)に対してテストした場合、正答率は88.2%に低下し、F1スコアは76.3%にまで下がった。
  • 6つの異なる出版者の出典を識別するタスクで98.4%の正答率を達成したため、モデルが出版者固有の特徴に強く依存していることが示された。
  • 『Pressetext Austria』の有料広告記事と編集コンテンツを99%の正答率で正しく分類できた。
  • 非線形SVMカーネル(RBFおよびシグモイド)は過学習のため失敗したが、C値を100~1,000に設定した線形モデルが最良の結果をもたらした。
  • トレーニングデータ量をある閾値を超えて増加させても、F1スコアは約85%で頭打ちとなり、収益の逓減が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。