[論文レビュー] #Bieber + #Blast = #BieberBlast: Early Prediction of Popular Hashtag Compounds
本稿では、ツイッター上でのハッシュタグ複合語(2つ以上の既存ハッシュタグを組み合わせて形成されたもの)が人気を獲得するかどうかを予測する機械学習モデルを提案する。n-gramや語の重複などのツイートレベルの特徴を用いて、その予測精度は10か月先まで79.13%に達し、人間のベースライン精度48.7%を著しく上回る。
Compounding of natural language units is a very common phenomena. In this paper, we show, for the first time, that Twitter hashtags which, could be considered as correlates of such linguistic units, undergo compounding. We identify reasons for this compounding and propose a prediction model that can identify with 77.07% accuracy if a pair of hashtags compounding in the near future (i.e., 2 months after compounding) shall become popular. At longer times T = 6, 10 months the accuracies are 77.52% and 79.13% respectively. This technique has strong implications to trending hashtag recommendation since newly formed hashtag compounds can be recommended early, even before the compounding has taken place. Further, humans can predict compounds with an overall accuracy of only 48.7% (treated as baseline). Notably, while humans can discriminate the relatively easier cases, the automatic framework is successful in classifying the relatively harder cases.
研究の動機と目的
- ツイッター上でのハッシュタグ複合語の人気を左右する社会的・言語的要因および行動的要因を解明すること。
- 新しく形成されたハッシュタグ複合語が、その構成要素を上回る使用頻度を記録するかどうかを早期に予測する課題に取り組むこと。
- 人間の判断を上回る予測精度を達成する機械学習フレームワークを構築すること。
- 伝播パターンと統計的性質に基づいて、自発的(イディオム的)なハッシュタグ複合語と、強制的・影響を受けて形成されたものとを区別すること。
提案手法
- 1%のランダムサンプルによる歴史的ツイートを用いて、大規模なハッシュタグ複合語データセットを収集する。
- n-gramの重複、語の重複、メンション頻度、リツイート数、共起パターンなどのツイートレベル特徴を抽出する。
- これらの特徴を用いて、分類モデルを教師あり学習で訓練し、複合語が構成要素を上回る人気を獲得するかどうかを予測する。
- 長期予測戦略を採用し、複合化後T = 2か月、6か月、10か月の各時点で性能を評価する。
- 制御された評価研究を通じて、モデルの予測と人間の判断を比較する。
- 対応分析を用いて、容易なケースと困難なケースの両方において、人間と機械の予測の相補性を検証する。
実験結果
リサーチクエスチョン
- RQ1どのような社会的・言語的要因および行動的特徴が、人気のあるハッシュタグ複合語とそうでないものとを区別するか?
- RQ2機械学習モデルは、人間の判断よりも早く、ハッシュタグ複合語の将来的な人気を予測できるか?
- RQ3自発的(イディオム的)なハッシュタグ複合語と、強制的・影響を受けて形成されたものの間で、伝播パターンにどのような差が生じるか?
- RQ4どのツイートレベル特徴が、ハッシュタグ複合語の人気の将来的な予測において最も予測的か?
- RQ5人間と機械は、ハッシュタグ複合語の人気予測の難易度分類において、どの程度相補的か?
主な発見
- 提案されたモデルは、複合化後2か月では77.07%の精度で人気ハッシュタグ複合語を予測し、6か月後には77.52%、10か月後には79.13%まで精度が向上する。
- ツイートの内容特徴、特にn-gramおよび語の重複が、複合語の人気を予測する上で最も特徴的な予測変数である。
- 人間のベースライン精度は48.7%にとどまり、このタスクの難易度の高さを示している。
- モデルは全体の予測精度において人間の判断を約58%上回っており、特に困難なケースの分類において顕著な優位性を示す。
- 自発的(イディオム的)なハッシュタグ複合語は、強制的・影響を受けて形成されたものと比較して、メンション頻度が低く、共起の数も少なく、初期段階での伝播が遅い傾向にある。
- 対応分析の結果、人間は頻度差が大きい容易なケースで優れた性能を発揮するが、モデルはより曖昧で困難なケースで優れた性能を発揮することが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。