Skip to main content
QUICK REVIEW

[論文レビュー] Topic words analysis based on LDA model

Xi Qiu, Christopher Stewart|arXiv (Cornell University)|May 15, 2014
Complex Network Analysis Techniques参考文献 4被引用数 4
ひとこと要約

この論文は、オハイオ州コロンバス在住の受信者を対象にしたObama.comからのメール本文を分析するため、ギブスサンプリングを用いたラティントディレクレット配分(LDA)モデルを用いたトピックモデリング手法を提案する。炭素排出ゼロのDatagreening.comサーバーを活用し、BashReduceを用いた並列処理により、30%の高速化を達成した。また、トピック語リストのサイズを適切に選択した場合、LDAはTF-IDFに比べてターゲット政治的トピック語の特定において53.96%高い正確性を示した。

ABSTRACT

Social network analysis (SNA), which is a research field describing and modeling the social connection of a certain group of people, is popular among network services. Our topic words analysis project is a SNA method to visualize the topic words among emails from Obama.com to accounts registered in Columbus, Ohio. Based on Latent Dirichlet Allocation (LDA) model, a popular topic model of SNA, our project characterizes the preference of senders for target group of receptors. Gibbs sampling is used to estimate topic and word distribution. Our training and testing data are emails from the carbon-free server Datagreening.com. We use parallel computing tool BashReduce for word processing and generate related words under each latent topic to discovers typical information of political news sending specially to local Columbus receptors. Running on two instances using paralleling tool BashReduce, our project contributes almost 30% speedup processing the raw contents, comparing with processing contents on one instance locally. Also, the experimental result shows that the LDA model applied in our project provides precision rate 53.96% higher than TF-IDF model finding target words, on the condition that appropriate size of topic words list is selected.

研究の動機と目的

  • オハイオ州コロンバスの地域住民を対象にしたObama.comからの政治的メールコンテンツを分析すること。
  • LDAとギブスサンプリングを用いたトピックモデリングにより、送信者の好みをモデル化すること。
  • LDAとTF-IDFの比較を通じて、関連する政治的トピック語を同定する際の予測性能を評価すること。
  • 炭素排出ゼロのサーバー上でBashReduceを用いた並列処理により、語の処理を高速化すること。
  • ソーシャルネットワーク分析のため、メールコーパスからの代表的トピック語の可視化と抽出を行うこと。

提案手法

  • Obama.comからコロンバス在住の受信者に送信されたメールコーパス全体に対して、ラティントディレクレット配分(LDA)モデルを用いて潜在的トピックを推定した。
  • 期待最大化(EM)法の計算負荷を回避するため、効率的なトピックおよび語の分布推定にギブスサンプリングを用いた。
  • Pythonを用いて前処理を実施:トークン化、ステミング、ストップワードフィルタリング、語数カウント。
  • BashReduceフレームワークを活用し、2つのコンピューティングインスタンスに語数カウント処理を分散させ、約30%の高速化を達成した。
  • トピック-語分布をマッピングして、各トピックごとの代表的キーワード(例:「健康保険」、「選挙活動」、「ガバナー」)を特定した。
  • 精度を指標として用い、LDAとTF-IDFの両モデルがトピック語リスト一致に対して示す性能を比較評価した。

実験結果

リサーチクエスチョン

  • RQ1ターゲットメール通信における関連政治的トピック語の同定において、LDAモデルはどの程度有効であるか?
  • RQ2BashReduceを用いた並列処理は、大規模なメールコーパス処理において、どの程度のパフォーマンス向上をもたらすか?
  • RQ3トピック語リストのサイズを変化させた場合、LDAのトピック語検出精度はTF-IDFに比べてどの程度異なるか?
  • RQ41通のメールに複数の潜在的トピックを捉えることで、LDAは政治的アプローチにおける送信者の好みを効果的にモデル化できるか?
  • RQ5政治的メール分析におけるトピック語同定の正確性に、トピック語リストのサイズが与える影響は何か?

主な発見

  • トピック語リストサイズを15に設定した場合、LDAはTF-IDFに比べて53.96%高い正確性を示し、優れた予測性能を確認した。
  • BashReduceを用いた並列処理により、単一インスタンスでのローカル処理に比べて語数カウント処理時間が約30%短縮された。
  • LDAはメールコーパスにおいて4つの主要なトピックを効果的に同定した:健康保険、新たな寄付、地域ニュース、大統領情報。
  • LDAとTF-IDFの両モデルとも、ターゲット語リストサイズが大きくなるに従い正確性が向上したが、リストサイズが十分に大きい場合にはLDAが一貫してTF-IDFを上回った。
  • 実験結果から、LDAは政治的メールコンテンツにおいて意味的で文脈に即したトピック語を、TF-IDFよりも効果的に捉えられると確認された。
  • 本研究は、LDAとギブスサンプリングを組み合わせたスケーラブルで効率的なトピックモデリングが、政治的コミュニケーションのソーシャルネットワーク分析に実現可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。