Skip to main content
QUICK REVIEW

[論文レビュー] Using Neural Network for Identifying Clickbaits in Online News Media

Amin Omidvar, Hui Jiang|arXiv (Cornell University)|Jun 20, 2018
Misinformation and Its Impacts参考文献 16被引用数 5
ひとこと要約

この論文では、ニュース投稿テキストからテキスト表現を自動で学習する双方向GRUベースのニューラルネットワークモデルを提案し、クリックベイトヘッドラインを検出する。2017年のClickbait Challengeで平均二乗誤差0.0315を達成し、特徴工学や外部データソースに依存せずに、最初の順位を獲得した。

ABSTRACT

Online news media sometimes use misleading headlines to lure users to open the news article. These catchy headlines that attract users but disappointed them at the end, are called Clickbaits. Because of the importance of automatic clickbait detection in online medias, lots of machine learning methods were proposed and employed to find the clickbait headlines. In this research, a model using deep learning methods is proposed to find the clickbaits in Clickbait Challenge 2017's dataset. The proposed model gained the first rank in the Clickbait Challenge 2017 in terms of Mean Squared Error. Also, data analytics and visualization techniques are employed to explore and discover the provided dataset to get more insight from the data.

研究の動機と目的

  • オンラインニュースのヘッドラインにおけるクリックベイト自動検出のためのエンドツーエンドのディープラーニングモデルの開発。
  • クリックベイト予測に最も情報を与えるテキスト特徴(postText, targetTitle, targetDescription)を特定すること。
  • 外部データを一切使用せず、生のテキスト入力のみで、既存のモデルを上回る性能を達成すること。
  • マルチクラスのアノテーション分布ではなく、二値のクリックベイト確率予測に簡素化することで分類タスクを簡素化すること。

提案手法

  • 双方向ゲート付き再帰ユニット(GRU)ネットワークが、前向きおよび後向きの両方向で入力テキストを処理し、文脈的依存関係を捉える。
  • 入力トークンを表すために、事前学習済みのGloVeベクトル(100次元)で初期化された単語埋め込みが使用される。
  • 前向きおよび後向きのGRUからの最終隠れ状態が連結され、各シーケンスごとに256次元のコンテキストベクトルが形成される。
  • シグモイド活性化関数を用いた1層のパーセプトロンが、最終的なクリックベイト確率スコアを計算する。
  • 過学習を防ぐためにドロップアウト正則化(埋め込み用0.2、GRU入力用0.2、GRU出力用0.5)が適用される。
  • モデル学習にはミニバッチ勾配降下法が使用され、バッチサイズは64、損失関数として平均二乗誤差が用いられる。

実験結果

リサーチクエスチョン

  • RQ1postText, targetTitle, targetDescription のうち、どのテキストフィールドがクリックベイト検出に最も判別力のある信号を提供するか?
  • RQ2手動による特徴工学を一切行わずに、ディープラーニングモデルがクリックベイト検出で最先端の性能を達成できるか?
  • RQ3Clickbait Challenge 2017において、系列ベースのRNNモデルは、より複雑なアンサンブルモデルやマルチソースモデルと比較してどのように性能を発揮するか?
  • RQ4予測タスクを二値のクリックベイト確率推定に簡素化することで、モデルの効率性と一般化性能が向上するか?

主な発見

  • モデルは、平均二乗誤差0.03152を達成し、他のすべての提出物を上回り、Clickbait Challenge 2017で最初の順位を獲得した。
  • postTextフィールドのみで学習した場合が最も高い性能を示し、これは人間のアノテーターにとって最も関連性の高い情報が含まれていたためである。
  • 100次元のGloVe埋め込みが、テストされた他の埋め込み次元と比較して、最小の平均二乗誤差を達成した。
  • テストセットでは中央絶対誤差が0.122、F1スコアが0.670、適合率が0.732、再現率が0.619を達成した。
  • 正解率が85.5%、R²スコアが0.571を達成し、強力な予測性能を示した。
  • モデルはたったの1分10秒で実行され、コンテストで最も速い提出物であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。