Skip to main content
QUICK REVIEW

[論文レビュー] Heuristic Feature Selection for Clickbait Detection

Matti Wiegmann, Michael Völske|arXiv (Cornell University)|Feb 4, 2018
Sentiment Analysis and Opinion Mining参考文献 3被引用数 3
ひとこと要約

本稿では、回帰タスクにおけるクリックバイト検出のための特徴量サブセット最適化を目的としたヒューリスティックなラッパー法、leave-many-out 特徴選択を提案する。繰り返し特徴量グループを除外し、平均二乗誤差(MSE)を用いて性能への影響を測定することで、ベースラインモデルの性能を20%向上させ、ディープラーニングを用いないにもかかわらず、Clickbait Challenge 2017 で2位を達成した。

ABSTRACT

We study feature selection as a means to optimize the baseline clickbait detector employed at the Clickbait Challenge 2017. The challenge's task is to score the "clickbaitiness" of a given Twitter tweet on a scale from 0 (no clickbait) to 1 (strong clickbait). Unlike most other approaches submitted to the challenge, the baseline approach is based on manual feature engineering and does not compete out of the box with many of the deep learning-based approaches. We show that scaling up feature selection efforts to heuristically identify better-performing feature subsets catapults the performance of the baseline classifier to second rank overall, beating 12 other competing approaches and improving over the baseline performance by 20%. This demonstrates that traditional classification approaches can still keep up with deep learning on this task.

研究の動機と目的

  • 従来のディープラーニング手法に比べて性能が劣るベースラインのクリックバイト回帰モデルの性能向上を図ること。
  • 従来のフィルタ法や埋め込み手法が失敗する、ソーシャルメディアデータにおけるスパースな特徴の課題に対処すること。
  • 高次元でスパースなクリックバイト特徴空間に効果的なヒューリスティックラッパー法を開発すること。
  • 将来的な特徴量設計のための、高影響度の特徴量および潜在的な特徴量相互作用を同定すること。
  • 知的特徴量選択を通じて、従来の機械学習モデルがディープラーニングと同等の性能を発揮できることを示すこと。

提案手法

  • 本手法は、繰り返し特徴量グループを除外し、平均二乗誤差(MSE)の変化を測定することで、性能への影響を評価するleave-many-out戦略を採用する。
  • ベースラインモデルとしてリッジ回帰を用い、MSEを特徴量サブセット選択のフィtness関数として使用する。
  • 特徴量カテゴリには、文字n-gram、単語n-gram、単語リスト特徴量、および語数や標点符号の頻度といったエンジニアリング特徴量が含まれる。
  • 予測誤差への影響に基づいて特徴量を体系的にランク付けし、識別的・紛らわしい・重複する特徴量を特定する。
  • 高影響度の特徴量を分析し、-ly や -ing で終わる語の数といった、識別力の高い新たなエンジニアリング特徴量の候補を提案する。
  • 本手法は、学習用に19,538件、テスト用に18,979件のラベル付きツイートを含むClickbait Challenge 2017データセットに適用された。

実験結果

リサーチクエスチョン

  • RQ1スパースで回帰ベースのクリックバイト検出タスクにおいて、ヒューリスティックラッパー特徴選択は、χ² などの標準的なフィルタ法を上回ることができるか?
  • RQ2どの特徴量カテゴリがクリックバイトスコアの予測に最も寄与しているか?
  • RQ3繰り返し特徴量グループを除外することで、特徴量相互作用や重複特徴量を同定できるか?
  • RQ4エンジニアリング特徴量は、元の特徴量セットに比べて、モデル性能をどの程度向上させることができるか?
  • RQ5知的特徴量選択を通じて、従来の機械学習モデルがディープラーニングと同等の性能を発揮できるか?

主な発見

  • leave-many-out 特徴選択手法により、ベースラインモデルのMSE性能が20%向上し、Clickbait Challenge 2017 で2位を達成した。
  • エンジニアリング特徴量のうち、特に「時間帯」(スコア:4.74)と「ピリオドの数」(スコア:7.18)が最も高い影響を示した。
  • -ly や -ing で終わる語の数は、個々のn-gramの識別力が高いため、新たなエンジニアリング特徴量の有力候補とされた。
  • 文字レベル特徴量として、'@'(スコア:0.73)と'.'(スコア:0.53)が顕著に識別的であり、'!' も0.82の高い影響を示した。
  • 語彙リスト特徴量「Easy Words」は強い正の影響(スコア:2.60)を示し、語彙の単純さがクリックバイトの指標である可能性を示唆した。
  • 本手法により、 '@' が文字n-gramで顕著に識別的である一方で、対応する語レベル特徴量(「メンション数」)は影響が薄いことが同定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。