[論文レビュー] Polarized User and Topic Tracking in Twitter
本稿では、初期のシードハッシュタグを活用して、Twitterストリーム内の偏ったユーザーを特定し、特徴的なハッシュタグを発見する反復的アルゴリズムであるPTR(Polarization TRacker)を提案する。2回の反復後、k-meansベースラインに比べて最高で71%高いF-measureを達成し、安定したパフォーマンスと高い再現率(IT13では85.3%)を示しており、政治的イベント中の偏ったコミュニティおよびトピックの効果的トラッキングを可能にする。
Digital traces of conversations in micro-blogging platforms and OSNs provide information about user opinion with a high degree of resolution. These information sources can be exploited to under- stand and monitor collective behaviors. In this work, we focus on polarization classes, i.e., those topics that require the user to side exclusively with one position. The proposed method provides an iterative classification of users and keywords: first, polarized users are identified, then polarized keywords are discovered by monitoring the activities of previously classified users. This method thus allows tracking users and topics over time. We report several experiments conducted on two Twitter datasets during political election time-frames. We measure the user classification accuracy on a golden set of users, and analyze the relevance of the extracted keywords for the ongoing political discussion.
研究の動機と目的
- ユーザーが少数の事前定義された位置に一つに分類されるソーシャルメディアストリームにおいて、偏ったユーザーを特定すること。
- 各偏りのクラスを特徴付ける最も関連性が高く、区別性のあるハッシュタグを発見すること。
- 動的かつ変化し続けるソーシャルメディア環境において、ユーザーコミュニティと進化する議論トピックを継続的にトラッキングできること。
- 政治的選挙期間中の実際のTwitterデータセットを用い、ラベル付きユーザーのゴールデンセットを用いて評価すること。
提案手法
- PTRアルゴリズムは、各偏りのクラスごとに1つのシードハッシュタグから開始し、反復的にこれらのハッシュタグを頻繁に使用するユーザーを特定する。
- 各反復で偏ったと分類されたユーザーのツイートから、より特徴的で区別性の高い新しいハッシュタグを抽出する。
- 発見されたハッシュタグの集合が進化するに従い、各反復でユーザー分類を更新することで、正確性と再現率を向上させる。
- 時系列バージョンであるTPTRは、データを1日ごとに処理し、ユーザーの再分類とハッシュタグの更新を繰り返すことで、コンセプトドリフトや新規トレンドに適応する。
- 最小限の初期監視情報(クラス数と各クラスのキーワード1つ)のみを必要とする、準教師ありクラスタリング手法として動作する。
- F-measure、精度、再現率、カバレッジ(γ)を用いて、ラベル付きユーザーのゴールデンセットとの比較により分類品質を評価する。
実験結果
リサーチクエスチョン
- RQ1初期知識が最小限(例:各クラスごとに1つのキーワード)である状況下で、どのようにしてTwitterストリーム内の偏ったユーザーを効果的に特定できるか?
- RQ2反復的ハッシュタグ発見が、偏ったコミュニティにおけるユーザー分類の正確性とカバレッジに与える影響は何か?
- RQ3動的かつ変化し続けるソーシャルメディア環境において、この手法は進化するユーザーコミュニティと議論トピックをどれほど効果的にトラッキングできるか?
- RQ4ハッシュタグの反復的最適化は、偏ったユーザークラスタ内での関連トピック検出にどの程度寄与するか?
主な発見
- PTRアルゴリズムは、4回の反復後、IT13データセットでF-measure 0.588、EU14データセットでF-measure 0.662を達成し、k-meansベースラインに比べて顕著な改善を示した。
- 2回の反復後、IT13では84.5%(γ)のカバレッジ、EU14では83.0%のカバレッジを達成し、k-meansに比べてF-measureがそれぞれ+71%、+7%向上した。
- 2回目の反復で最大のパフォーマンス向上が見られ、新しい特徴的ハッシュタグの発見により再現率が顕著に向上した。
- TPTRバージョンでは、IT13で1日目はF-measure 0.177、9日目は0.391に上昇し、EU14では1日目が0.155から9日目は0.635に上昇し、時間経過とともに分類精度が向上した。
- 有名な政治家、政党名、政治的スローガンといった意味のあるキーワードを効果的に抽出でき、発見されたトピックの関連性を裏付けた。
- アルゴリズムは素早く安定化し、2回目の反復以降は性能向上が最小限にとどまり、高品質な分類には2回の反復で十分であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。