[論文レビュー] Social Discrete Choice Models
本論文は、社会的ネットワーク構造と潜在的ユーザー群を統合することで、個人の選択を予測するのを改善する2つのスケーラブルなグラフ正則化離散選択モデル—ローカルロジスティックグラフ正則化(LLGR)と潜在的クラスグラフ正則化(LCGR)—を提案する。これらのモデルは、合成データ、実世界のデータ、大規模な社会的ネットワークデータにおいて、標準的手法を上回る性能を示し、選択が観察可能な特徴だけでなく、同僚の行動に影響を受ける場合に特に優れた結果を達成する。
Human decision making underlies data generating process in multiple application areas, and models explaining and predicting choices made by individuals are in high demand. Discrete choice models are widely studied in economics and computational social sciences. As digital social networking facilitates information flow and spread of influence between individuals, new advances in modeling are needed to incorporate social information into these models in addition to characteristic features affecting individual choices. In this paper, we propose two novel models with scalable training algorithms: local logistics graph regularization (LLGR) and latent class graph regularization (LCGR) models. We add social regularization to represent similarity between friends, and we introduce latent classes to account for possible preference discrepancies between different social groups. Training of the LLGR model is performed using alternating direction method of multipliers (ADMM), and training of the LCGR model is performed using a specialized Monte Carlo expectation maximization (MCEM) algorithm. Scalability to large graphs is achieved by parallelizing computation in both the expectation and the maximization steps. The LCGR model is the first latent class classification model that incorporates social relationships among individuals represented by a given graph. To evaluate our two models, we consider three classes of data to illustrate a typical large-scale use case in internet and social media applications. We experiment on synthetic datasets to empirically explain when the proposed model is better than vanilla classification models that do not exploit graph structure. We also experiment on real-world data, including both small scale and large scale real-world datasets, to demonstrate on which types of datasets our model can be expected to outperform state-of-the-art models.
研究の動機と目的
- 従来の離散選択モデルが意思決定における社会的影響やネットワーク構造を無視するという限界に対処すること。
- 社会的ネットワークデータと個人特徴を統合し、選択を予測するスケーラブルで計算的に効率的なモデルを開発すること。
- 潜在的クラスが社会的ネットワークにおけるグループレベルの好みの違いをどのように捉えるかを調査すること。
- 合成データ、小規模な実世界データ、大規模なインターネットデータの多様なデータセット上でモデルを評価し、最先端の手法を上回る堅牢性と優位性を示すこと。
提案手法
- ロジスティック回帰にグラフベースの正則化項を追加することで、社会的ネットワーク内で接続された個々の個人の類似性を強制する、ローカルロジスティックグラフ正則化(LLGR)を提案する。
- LLGRモデルのスケーラブルで並列化可能な学習を実現するため、交替方向乗数法(ADMM)を採用し、大規模グラフ上で効率的な最適化を可能にする。
- パラメトリック選択モデルと潜在的クラス構造を組み合わせた混合モデルとして、潜在的クラスグラフ正則化(LCGR)を導入し、グループ固有の好みを捉える。
- LCGRの学習に、ブロックMCMCサンプリングを用いた特別なモンテカルロ期待値最大化(MCEM)アルゴリズムを採用し、グラフをコミュニティに分割することで計算を高速化する。
- MCEMのEステップおよびMステップの両方で並列化を適用し、LCGRを大規模グラフにスケーリングし、計算効率を向上させる。
- 効率的なブロックワイズMCMCサンプリングを可能にするために、コミュニティ検出の前処理ステップを組み込み、潜在変数の周辺化にかかる計算負荷を低減する。
実験結果
リサーチクエスチョン
- RQ1社会的ネットワーク構造を組み込むことで、個々の特徴のみに依存する場合と比較して、いつどのように離散選択予測が顕著に向上するのか。
- RQ2LCGRモデルにおける潜在的クラスが、個々のレベルのモデルでは見えないグループレベルの好みのパターンをどのように捉えているのか。
- RQ3高連結性と大きな連結成分を有する大規模な実世界ネットワークにおいて、提案手法が最先端の半教師付きグラフベース分類手法を上回るか。
- RQ4クラス接続性(β)や選択好み(w)といったハイパーパrameterが、理想化された状況および実世界の設定においてモデルの性能にどのように影響を与えるか。
- RQ5同僚の行動といった社会的影響が、ネットワーク構造を無視するモデルと比較して、モデルの予測精度にどの程度顕著に現れるか。
主な発見
- 合成データにおいて、特徴空間では分離不可能なラベルがグラフ空間ではクラスタリングされている場合、提案手法はヴァニラ分類モデルを上回ることを示し、社会的構造の価値を裏付けた。
- 1995年から1997年の思春期の喫煙データセットでは、LCGRモデルが社会的要因が喫煙行動に支配的となった1997年において、非社会的モデルを顕著に上回った。
- オンライン小売アカウントのグラフにおける大規模な不正検出タスクでは、平均次数が高く、大きな連結成分を有するグラフにおいて、他の半教師付きグラフ手法と比較して本手法が優れたロバストネスを示した。
- LLGRモデルはADMMに基づく並列化により高いスケーラビリティを達成し、大規模グラフに適した一方、LCGRは計算複雑性の高いがより優れた性能を提供した。
- コミュニティ分割に基づくブロックMCMCサンプリングにより計算時間が顕著に短縮され、Facebookエゴネットでは標準的およびブロックのみのMCMCと比較して、並列ブロックMCMCが顕著な高速化を達成した。
- モデルは、喫煙、自転車利用、過食といったライフスタイル選択において、個々の特徴を超えて同僚の行動が意思決定を形作るという社会的影響と潜在的グループ構造が、モデル化に不可欠であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。