Skip to main content
QUICK REVIEW

[論文レビュー] Identifying Clickbait Posts on Social Media with an Ensemble of Linear Models

А. В. Григорьев|arXiv (Cornell University)|Oct 1, 2017
Misinformation and Its Impacts参考文献 7被引用数 10
ひとこと要約

本論文では、ツイート本文、ターゲットタイトル、説明文、メタデータからのテキスト特徴量を活用して、ソーシャルメディア上のクリックベイト投稿を検出するための線形サポートベクターレグレッション(SVR)モデルのアンサンブルを提案する。この手法は、Clickbait Challenge 2017で3位を獲得し、テストMSEが0.0362に達した。特徴量の重要度分析により、'shocker' や 'wat' といった言語的キーワードがクリックベイト行動の強力な指標であることが示された。

ABSTRACT

The purpose of a clickbait is to make a link so appealing that people click on it. However, the content of such articles is often not related to the title, shows poor quality, and at the end leaves the reader unsatisfied. To help the readers, the organizers of the clickbait challenge (http://www.clickbait-challenge.org/) asked the participants to build a machine learning model for scoring articles with respect to their "clickbaitness". In this paper we propose to solve the clickbait problem with an ensemble of Linear SVM models, and our approach was tested successfully in the challenge: it showed great performance of 0.036 MSE and ranked 3rd among all the solutions to the contest.

研究の動機と目的

  • ソーシャルメディア投稿の「クリックベイト度スコア」を正確に予測できる機械学習モデルの開発を目的とする。
  • 好奇心をあおり、誤解を招く低品質なコンテンツがトラフィックを増加させる問題に対処することを目的とする。
  • Twitterのようなプラットフォームでクリックベイトコンテンツを同定・フィルタリングすることで、読者の体験を向上させることを目的とする。
  • スケーラブルで解釈可能な線形モデルのアンサンブルを用いて、パブリックチャレンジで高い性能を達成することを目的とする。

提案手法

  • 投稿本文(postText)、ターゲットタイトル(targetTitle)、ターゲット説明文(targetDescription)、ターゲットキーワード(targetKeywords)、ターゲット段落(targetParagraphs)、ターゲットキャプション(targetCaptions)などのテキスト特徴量を用いて、個々のLinearSVRモデルを訓練した。
  • 平均クリックベイト度予測と標準偏差推定の両方の性能を評価するため、5分割交差検証を実施した。
  • 外部のFacebookデータを用いたバイナリSVM分類器を適用し、アンサンブル用の追加特徴量を生成した。
  • 個々のモデル出力をスタッキングにより統合し、メタラーナーとしてExtraTreeRegressorを用いて一般化性能を向上させた。
  • 検証性能に基づき、シンプルさと再現可能性を重視して、最良のアンサンブル構成を選定した。
  • ExtraTreeモデルからの特徴量重要度分析を用いて、予測に最も寄与した入力特徴量を解釈した。

実験結果

リサーチクエスチョン

  • RQ1シンプルな線形モデルのアンサンブルは、ソーシャルメディア投稿におけるクリックベイト度の予測に有効に機能するか?
  • RQ2投稿本文、ターゲットタイトル、メタデータなどのテキスト特徴量のうち、どの特徴量がクリックベイト行動と最も強く相関しているか?
  • RQ3複数の線形モデルの予測を組み合わせることで、個々のモデルに比べて性能がどのように向上するか?
  • RQ4類似プラットフォーム(例:Facebook)からの外部データを用いることで、トランスファーラーニングの文脈でクリックベイト検出がどの程度向上するか?
  • RQ5どの言語的パターンやトークンがクリックベイトを示す最も強い兆候であり、モデルの係数から同定可能か?

主な発見

  • アンサンブルモデルはテストMSE 0.0362を達成し、Clickbait Challenge 2017で5チーム中3位となった。
  • postTextにのみ依存するモデルが、交差検証でMSE 0.039を記録し、個々のモデルの中で最高の性能を示した。
  • 標準偏差予測の組み込みによりモデルのロバスト性が向上し、平均値と標準偏差の特徴量を用いた最終アンサンブルは、追加のFacebookデータを含むモデルよりも優れた性能を示した。
  • 特徴量重要度分析から、'shocker'、'wat'、'n'(数字を表す)といったトークンが、クリックベイト度の強い正の予測要因であることが判明した。
  • 最も優れた性能を示したモデルは、個々のLinearSVRモデルからの平均値と標準偏差の予測のみを用いており、このタスクでは複雑さよりもシンプルさと特徴量工学の重要性が顕著に表れた。
  • モデルの係数から、'you won't believe'、'shocker'、'whoa' といった言語的キーワードがクリックベイトを示す強力な指標であることが同定され、これらが好奇心を刺激する役割を果たすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。