[論文レビュー] Author Clustering and Topic Estimation for Short Texts
本稿では、ドキュメント内での単語の共起をモデル化し、階層的事前分布を介してユーザー間でトピック分布を共有することで、短いテキストにおける著者を同時にクラスタリングし、トピックを推定する新しいベイジアントピックモデルを提案する。このモデルは、トピックの整合性とクラスタ回復性能において、既存手法を上回り、特に2020年のパンデミック期における米国上院議員のツイートから、政党的イデオロギーを検出する点で優れた性能を示す。
Analysis of short text, such as social media posts, is extremely difficult because of their inherent brevity. In addition to classifying topics of such posts, a common downstream task is grouping the authors of these documents for subsequent analyses. We propose a novel model that expands on the Latent Dirichlet Allocation by modeling strong dependence among the words in the same document, with user-level topic distributions. We also simultaneously cluster users, removing the need for post-hoc cluster estimation and improving topic estimation by shrinking noisy user-level topic distributions towards typical values. Our method performs as well as -- or better -- than traditional approaches, and we demonstrate its usefulness on a dataset of tweets from United States Senators, recovering both meaningful topics and clusters that reflect partisan ideology. We also develop a novel measure of echo chambers among these politicians by characterizing insularity of topics discussed by groups of Senators and provide uncertainty quantification.
研究の動機と目的
- 単語の共起が疎である短いテキスト(例:SNS投稿)におけるトピックモデリングの課題に取り組むこと。特に、従来のLDAでは性能が劣る状況を想定する。
- 事後的なクラスタリングに依存せずに、著者とトピックを同時にクラスタリングすることで、ノイズの多いユーザー単位の分布を収縮させ、トピック推定の精度を向上させること。
- 著者間の類似性を捉える階層的事前分布を用いて、ユーザー単位のトピック分布をモデル化することで、データが少ない状況でも安定した推定を実現すること。
- ユーザークラスタごとのトピックの閉鎖性を測定することで、イデオロギー的分離を反映する、エコーチェンバー効果の新たな測定指標を開発すること。
- 実世界のデータセット(2020年初期の米国上院議員のツイート)を用いて、本手法の有効性を実証し、クラスタが既知のイデオロギー的分断と一致することを示すこと。
提案手法
- 短いテキストごとにドキュメントレベルのトピック割り当てを導入することで、Latent Dirichlet Allocation (LDA) を拡張し、同じドキュメント内での単語間の強い依存関係を可能にする。
- ユーザー単位のトピック分布に階層的事前分布を導入することで、ユーザー間で推定の強みを共有し、データが疎な状況での推定を安定化させる。
- 大規模なSNSコーパス(米国上院議員の61,241件のツイートからなるデータセット)にスケーリング可能な変分ベイジアン推論手順を用いる。
- ユーザー-トピック分布にディリクレ過程混合事前分布を適用することで、クラスタ数を自動的に検出するユーザークラスタリングを実現する。
- トピック推定およびクラスタ推定の両方に不確実性の定量化を組み込み、後続の推論の信頼性を向上させる。
- 特定のクラスタがすべてのトピックを言及するために必要なツイート数に基づく、エコーチェンバー効果の新たな指標を開発する。
実験結果
リサーチクエスチョン
- RQ12段階的手法よりも、統合型モデルが短いテキストにおいてトピックと著者を同時に推定する効果が高いか?
- RQ2ドキュメント内での単語の共起をモデル化することで、疎な短いテキストデータにおけるトピックの整合性がどの程度向上するか?
- RQ3階層的事前分布を用いてユーザー単位のトピック分布をクラスタリングすることで、現実のイデオロギー的グループ構造をどの程度反映できるか?
- RQ4本モデルは、SNS上の政治的議論におけるイデオロギー的分離(エコーチェンバー効果)を検出し、定量的に測定できるか?
- RQ5変動するデータ条件のもとで、本モデルの性能は最先端手法と比較して、トピックの整合性およびクラスタ回復性能においてどの程度優れているか?
主な発見
- シミュレーションデータにおいて、本モデルはstLDA-Cおよびベースライン手法を上回る高いトピック整合性を達成しており、真のトピック分布でさえわずかに上回る性能を示した。
- クラスタ回復のシミュレーションでは、本モデルは明確に分離されたクラスタを正しく特定し、1つのトピックの差異しか持たないクラスタのみを統合する。この点で、stLDA-Cおよび他の手法よりも再現率(TPR)と誤検出率(FPR)の両面で優れた性能を示した。
- 米国上院議員のツイートデータセットにおいて、本モデルは上院議員をイデオロギー的に一貫性のあるグループにクラスタリングに成功しており、中道的共和党員と進歩的民主党員が明確に分離されたクラスタを形成した。
- 本モデルは、リベラル民主党員と全国的視点を持つ共和党員が広範なトピックカバレッジを持つことを特定したが、個々の民主党員は共和党員よりも速やかにトピックをカバーしていた。
- 新規に開発したエコーチェンバー指標は、共和党員のほうがトピックの閉鎖性(insularity)が高く、より速く多様なトピックをカバーしない傾向にあることを示した。
- 本モデルのクラスタリング結果は、理論的イデオロギー指標(例:PooleとRosenthal, 2017)と強く一致しており、実世界の政治的文脈における妥当性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。