Skip to main content
QUICK REVIEW

[論文レビュー] Collective Semi-Supervised Learning for User Profiling in Social Media

Richard J. Oentaryo, Ee‐Peng Lim|arXiv (Cornell University)|Jun 24, 2016
Spam and Phishing Detection参考文献 26被引用数 4
ひとこと要約

本稿では、複数のソーシャル関係(例:フォロー、リツイート)とラベルなしデータを統合して、ソーシャルメディアにおけるユーザープロファイリングを向上させる、新しいフレームワークであるコラボラティブ・セミスーパービズド・ラーニング(CSL)を提案する。マーコフ確率的フィールドを用いて関係特徴を統合し、CD正則化を適用した凸最適化を実行することで、ラベル付きデータが限られた状況下でも、アカウントタイプや婚姻状態といったユーザ属性の高精度で、かつ耐障害性・解釈可能性に優れた推論を実現する。

ABSTRACT

The abundance of user-generated data in social media has incentivized the development of methods to infer the latent attributes of users, which are crucially useful for personalization, advertising and recommendation. However, the current user profiling approaches have limited success, due to the lack of a principled way to integrate different types of social relationships of a user, and the reliance on scarcely-available labeled data in building a prediction model. In this paper, we present a novel solution termed Collective Semi-Supervised Learning (CSL), which provides a principled means to integrate different types of social relationship and unlabeled data under a unified computational framework. The joint learning from multiple relationships and unlabeled data yields a computationally sound and accurate approach to model user attributes in social media. Extensive experiments using Twitter data have demonstrated the efficacy of our CSL approach in inferring user attributes such as account type and marital status. We also show how CSL can be used to determine important user features, and to make inference on a larger user population.

研究の動機と目的

  • 単一のデータタイプに依存し、ラベル付きデータが限られる既存のユーザープロファイリング手法の限界を解消すること。
  • 多様なソーシャル関係と大規模なラベルなしデータを統合する、統一的かつ計算的に整合性のあるフレームワークを構築すること。
  • アカウントタイプや婚姻状態といった潜在的ユーザ属性を推定する際の予測精度と耐障害性を向上させること。
  • 学習済みモデルを用いて、これまでにない大規模なユーザープーリングに対しても推論を可能にすること。
  • 重要な寄与要因である特徴量と関係タイプを特定することで、解釈可能性を提供すること。

提案手法

  • マルコフ確率的フィールド(MRF)に基づく特徴量を構築し、フォロー、リツイートなど複数の種類のソーシャル関係を統一的な表現でモデル化する。
  • ユーザの接続関係とコンテンツから導出される関係特徴量を用いて、入力空間を拡張する。
  • ラベル付きデータとラベルなしデータに対して、CD正則化を適用した凸最適化を用いて半教師あり学習を実行する。
  • 複数の関係タイプとラベルなしインスタンスを同時に最適化する統合学習フレームワークを採用する。
  • 関係的事前知識を用いてユーザ間の依存関係を捉える構造的予測アプローチを採用する。
  • ラベルなしデータを活用して決定境界を洗練させ、ラベル付きデータを超えた一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1複数種類のソーシャル関係を効果的に統合することで、ユーザ属性の推論性能をどのように向上させられるか?
  • RQ2原理的かつ整合的な方法でラベルなしデータを活用することで、モデルの耐障害性と精度を向上させられるか?
  • RQ3提案手法は、より大規模で未観測のユーザープーリングにどのように一般化するか?
  • RQ4どの特徴量と関係タイプが予測性能に最も寄与しているか?
  • RQ5ラベル付き学習データに存在しない新しいユーザータイプを、モデルが同定・予測できるか?

主な発見

  • CSLは、組織アカウントの予測においてトップ100内予測で90%の精度を達成し、個人アカウントでは100%の精度(偽陽性なし)を記録した。
  • 婚姻状態の予測では、トップ60内予測で92.31%の精度を達成し、トップ100内予測の33%が正しい「既婚」分類として識別された。
  • ラベルなしSGTwitterユーザーポピュレーションにおける予測ラベル分布(個人88%、組織12%)は、ラベル付きデータよりも著しく不均衡であった。これは、実世界の分布への一般化を示唆している。
  • ラベル付き学習セットに存在しなかったドメインサフィックス(例:.sg)を持つ新たな組織アカウントを、CSLが正しく予測した。これは、分布外ケースに対しても耐障害性があることを示している。
  • 定性的な分析から、キーワード一致がなくても、コンテンツと関係的ヒントに基づいて、モデルが婚姻状態を正しく推定していることが明らかになった。
  • 本手法は、予測に最も寄与する特徴量と関係タイプを特定することで、解釈可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。