Skip to main content
QUICK REVIEW

[論文レビュー] Social-LLM: Modeling User Behavior at Scale using Language Models and Social Network Data

Julie Jiang, Emilio Ferrara|arXiv (Cornell University)|Dec 31, 2023
Complex Network Analysis Techniques被引用数 4
ひとこと要約

Social-LLM は、大規模言語モデル(LLM)から得られるユーザーのコンテンツ特徴と一次的なソーシャルネットワーク相互作用(例:リツイート、メンション)を組み合わせることで、スケーラブルで帰納的(inductive)なユーザー表現モデルを提案する。これにより、多様な計算的社会科学タスクにおいて効率的なユーザー検出が可能になる。ソーシャルハモフィリー(同質性)を活用し、直接的なエッジのみをモデル化することで、7つの実世界データセットで最先端の性能を達成するとともに、再訓練なしでアウトオブサンプルのユーザーに対しても推論が可能である。

ABSTRACT

The proliferation of social network data has unlocked unprecedented opportunities for extensive, data-driven exploration of human behavior. The structural intricacies of social networks offer insights into various computational social science issues, particularly concerning social influence and information diffusion. However, modeling large-scale social network data comes with computational challenges. Though large language models make it easier than ever to model textual content, any advanced network representation methods struggle with scalability and efficient deployment to out-of-sample users. In response, we introduce a novel approach tailored for modeling social network data in user detection tasks. This innovative method integrates localized social network interactions with the capabilities of large language models. Operating under the premise of social network homophily, which posits that socially connected users share similarities, our approach is designed to address these challenges. We conduct a thorough evaluation of our method across seven real-world social network datasets, spanning a diverse range of topics and detection tasks, showcasing its applicability to advance research in computational social science.

研究の動機と目的

  • 大規模なソーシャルネットワークデータにおけるグラフ表現学習のスケーラビリティの制限を解決すること。
  • LLM とソーシャルネットワーク構造を統合することで、アウトオブサンプルのユーザーにも適用可能な帰納的ユーザー検出を可能にすること。
  • 異なるソーシャル相互作用タイプ(例:リツイート、メンション)およびエッジの性質(方向性、重み)がユーザー表現に与える影響を評価すること。
  • 学習された埋め込み表現が、ソーシャルネットワーク分析における可視化と解釈可能性にどのように寄与するかを示すこと。
  • 政治的極化、嫌がらせ発言、アカウント停止など、多様なトピックをカバーする、堅牢で汎用的なユーザー検出手法を確立すること。

提案手法

  • Social-LLM は、LLMで埋め込まれたユーザーのプロフィール記述と一次的なソーシャルネットワークエッジ(例:リツイート、メンション)を組み合わせることでユーザー表現を構築する。
  • 接続されたユーザーが言語的・行動的類似性を共有すると仮定することで、ソーシャルネットワークのハモフィリーをモデル化し、効果的な表現学習を実現する。
  • 単純だが効果的なグラフ近似を用いる——直接エッジのみを信号とみなすことで、複雑なグラフニューラルネットワークの学習を回避し、帰納的推論を可能にする。
  • 性能向上が見込まれる場合には、エッジタイプを無差別に統合(例:リツイート + メンションを1つのエッジタイプとして扱う)し、エッジの方向性が性能に顕著な影響を及ぼすことが示された。
  • エッジの重みを追加して相互作用の強度を反映することが可能であり、利用可能な場合はユーザーのツイート埋め込みも統合して表現品質を向上させる。
  • 最終的なユーザー埋め込みは、下流の分類タスクに使用され、t-SNE を用いて可視化され、クラスタリング能と解釈可能性を評価する。

実験結果

リサーチクエスチョン

  • RQ1LLM と一次的ソーシャルネットワークエッジを活用するシンプルでスケーラブルな手法が、ユーザー検出タスクにおいて最先端のモデルを上回る性能を発揮できるか?
  • RQ2リツイートとメンションといった異なるタイプのソーシャル相互作用をまとめてまたは別々にモデル化した場合、モデル性能にどのような影響を与えるか?
  • RQ3エッジの方向性と重み付けが、ユーザー表現の質と検出精度をどの程度向上させるか?
  • RQ4Social-LLM の埋め込み表現は、政治的極化やアカウント停止のパターンといった意味のある社会的構造を効果的に可視化できるか?
  • RQ5多様なトピックと検出タスクをカバーするさまざまなデータセットにおいて、モデルの頑健性はどの程度か?

主な発見

  • Social-LLM は、7つの実世界のソーシャルメディアデータセットすべてで最先端の性能を達成し、コンテンツのみ、ネットワークのみのベースラインを6/7のデータセットで上回った。
  • ベースラインより統計的に有意な改善を示し、最も有利なデータセットでは平均マクロF1スコアで最大4.1%の向上を達成した。
  • リツイートとメンションを1つのエッジタイプとして統合すると、個別に扱うよりも性能が向上した。これは、検出タスクにおいて相互作用タイプの違いがそれほど重要ではないことを示唆している。
  • エッジの方向性を組み込むことで、一貫して性能が向上した。これは、ソーシャルネットワークにおける情報の流れの重要性を示している。
  • エッジの重み付けを追加すると、一部のケースで性能がさらに向上した。これは、相互作用の強度が意味のある信号を含んでいることを示している。
  • 利用可能な場合、ユーザーのツイート埋め込みを組み込むことで、平均して4%のマクロF1スコア向上が得られ、ユーザーの全コンテンツを統合する価値が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。