[論文レビュー] Reciprocal versus Parasocial Relationships in Online Social Networks
本稿は、大規模なGoogle+およびFlickrデータセットを用いて、オンラインソーシャルネットワークにおける相互的関係とパラソーシャル関係を調査し、相互的エッジ予測を教師あり/半教師あり学習ではなく、外れ値検出問題としてモデル化することがより適切であると提唱する。相互的エッジは類似度の高いユーザー同士に多く、パラソーシャルエッジは人気のあるユーザーと一般的なユーザーを結ぶ傾向にあり、構造的・行動的・属性的特徴が相互性に顕著な影響を与えることが判明。提案手法の外れ値検出アプローチは、先行手法を上回る性能を示した。
Many online social networks are fundamentally directed, i.e., they consist of both reciprocal edges (i.e., edges that have already been linked back) and parasocial edges (i.e., edges that haven't been linked back). Thus, understanding the structures and evolutions of reciprocal edges and parasocial ones, exploring the factors that influence parasocial edges to become reciprocal ones, and predicting whether a parasocial edge will turn into a reciprocal one are basic research problems. However, there have been few systematic studies about such problems. In this paper, we bridge this gap using a novel large-scale Google+ dataset crawled by ourselves as well as one publicly available social network dataset. First, we compare the structures and evolutions of reciprocal edges and those of parasocial edges. For instance, we find that reciprocal edges are more likely to connect users with similar degrees while parasocial edges are more likely to link ordinary users (e.g., users with low degrees) and popular users (e.g., celebrities). However, the impacts of reciprocal edges linking ordinary and popular users on the network structures increase slowly as the social networks evolve. Second, we observe that factors including user behaviors, node attributes, and edge attributes all have significant impacts on the formation of reciprocal edges. Third, in contrast to previous studies that treat reciprocal edge prediction as either a supervised or a semi-supervised learning problem, we identify that reciprocal edge prediction is better modeled as an outlier detection problem. Finally, we perform extensive evaluations with the two datasets, and we show that our proposal outperforms previous reciprocal edge prediction approaches.
研究の動機と目的
- 有向オンラインソーシャルネットワークにおける相互的エッジとパラソーシャルエッジの構造的および進化的性質を体系的に比較すること。
- 相互的エッジ形成に影響を与える要因(ユーザー行動、ノード属性、エッジ属性)を特定すること。
- テスト時における正例のシフト(test-time positive shift)に起因するデータ漏洩の問題を抱える従来の教師あり/半教師ありアプローチの限界を是正すること。
- 実世界の制約(正例のみ観測可能)をより適切にモデル化するため、相互的エッジ予測のための新しい外れ値検出フレームワークを提唱・評価すること。
- 実世界のGoogle+およびFlickrデータセットを用いた広範な評価を通じて、提案手法の有効性を示すこと。
提案手法
- 著者らは、自らクロールしたGoogle+データセットと、公開済みのFlickrソーシャルネットワークデータセットの2つを分析した。
- 度の類似性、クラスタリング、近隣接続性といった構造的特性を、相互的エッジとパラソーシャルエッジで比較した。
- ユーザー行動(例:共通の学校、相互インタラクション)、ノード属性(例:次数、プロファイルデータ)、エッジ属性(例:エッジの年齢、作成からの経過時間)から特徴を抽出した。
- 相互的エッジ予測を二値分類タスクとして扱う代わりに、パラソーシャルエッジを、それが逆転する可能性がある場合に外れ値とみなす外れ値検出問題としてモデル化した。
- 一様クラスSVMや隔離フォレストなどの既存の外れ値検出技術を適用し、逆転の可能性が最も高いパラソーシャルエッジを同定した。
- 時間的ネットワークスナップショット上で、標準的な指標(例:AUC、適合率、再現率)を用いて性能を評価し、教師ありおよび半教師ありベースラインと比較した。
実験結果
リサーチクエスチョン
- RQ1オンラインソーシャルネットワークにおいて、相互的エッジとパラソーシャルエッジの構造的および進化的パターンにはどのような相違があるか?
- RQ2ユーザー行動、ノード属性、エッジ属性のうち、パラソーシャルエッジが相互的になる可能性を高める要因は何か?
- RQ3従来の教師ありおよび半教師あり学習アプローチが、動的ネットワークにおいて一般化性能に劣る理由は何か?
- RQ4相互的エッジ予測を分類問題としてではなく、外れ値検出問題としてモデル化することで、より効果的に予測できるか?
- RQ5提案された外れ値検出フレームワークは、従来の教師ありおよび半教師あり手法を上回り、相互的エッジ形成を予測する上で有効か?
主な発見
- 相互的エッジは類似度の高いユーザー同士に多く、パラソーシャルエッジは主に低次数のユーザーと高次数のユーザー(例:有名人)を結ぶ傾向にある。
- 一般ユーザーと人気ユーザーを結ぶ相互的エッジがネットワーク構造に与える影響は、時間経過とともにゆっくりと変化するため、こうしたリンクの統合は段階的であることが示唆された。
- 共通の学校を共有するというユーザー行動は、パラソーシャルエッジが相互的になる確率を3倍に高めることが判明し、社会的同質性(homophily)の重要性が浮き彫りになった。
- エッジの年齢やその他のエッジ属性が相互性に顕著に影響を与えることから、時間的ダイナミクスがリンク形成に重要な役割を果たすことが示された。
- 提案された外れ値検出フレームワークは、Google+およびFlickrの両データセットにおいて、従来の教師ありおよび半教師あり手法を上回る性能で相互的エッジ形成を予測した。
- 本研究では、相互的エッジ予測を教師あり学習問題として扱うことで、将来のスナップショットでサンプルされた負例が正例に変わることがあり、モデルの一般化性能が低下するというデータ漏洩が生じることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。