Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic Generative Model of Social Network Based on Web Features

Mahyuddin K. M. Nasution, Shahrul Azman Mohd Noah|arXiv (Cornell University)|2012. 07. 17.
Advanced Text Analysis Techniques참고 문헌 27인용 수 7
한 줄 요약

이 논문은 검색 스니펫, URL, 명시적 실체와 같은 웹 특징에서 사회적 네트워크를 구성하는 확률적 생성 모델을 제안한다. 베이지안 추론과 기대값 최대화(EM) 알고리즘을 사용하여 잠재 주제를 통해 관계를 모델링함으로써, 비정형 웹 데이터에서 동적이고 속성 기반의 사회적 네트워크 탐색을 가능하게 한다.

ABSTRACT

In this paper, we develop a dynamic framework for the modeling and analysis of social networks to work with web documents. We illustrate the model with features of web, design a form to analyze relationships of attributes as a modality of social structure, and create the optimization of generative model based on Bayes Theorem.

연구 동기 및 목표

  • 웹 기반 문서와 특징을 사용하여 동적이고 생성적인 사회적 네트워크 모델링 프레임워크를 개발하기.
  • 웹 스니펫, 명시적 실체, 어휘 빈도를 확률적 사회 구조 모델에 통합하기.
  • 검색 결과의 단어 클러스터에서 유도된 잠재 주제를 통해 주체 간 관계를 모델링하기.
  • 베이즈 정리와 기대값 최대화(EM) 알고리즘을 사용하여 생성 모델을 최적화하기.
  • 명시적 링크나 메타데이터에만 의존하지 않고 비정형 웹 데이터에서 사회적 네트워크 추론을 가능하게 하기.

제안 방법

  • 잠재 주제 $ z \in \mathcal{Z} $ 를 사용하여 문서, 주체(이름), 단어의 공동 확률 분포로 사회적 네트워크를 모델링한다.
  • 생성 모델을 $ P(S,a,w) = \sum_{z \in \mathcal{Z}} P(z)P(S|z)P(w|z)P(a|z) $ 로 정의하며, 여기서 $ S $ 는 스니펫 목록, $ a $ 는 주체, $ w $ 는 단어이다.
  • 웹 검색 결과에서 조건부 확률 $ P(w|a) $, $ P(w|S) $, $ P(a|z) $ 를 추정하기 위해 베이지안 추론을 적용한다.
  • 웹 스니펫과 명시적 실체 발생 빈도에서 모델 파라미터를 학습하기 위해 기대값 최대화(EM) 알고리즘을 적용한다.
  • 각 주체의 맥락을 스니펫에서 추출한 단어의 백으로 표현하며, 주제 모델링을 통해 잠재적 속성을 식별한다.
  • 유사도 및 관계 모델링 향상을 위해 싱글턴 및 듀얼턴 텀을 특징으로 도입한다.

실험 결과

연구 질문

  • RQ1비정형 웹 문서와 검색 엔진 스니펫에서 사회적 네트워크 관계는 어떻게 유추할 수 있는가?
  • RQ2잠재 주제를 사용하여 주체, 단어, 문서의 공동 분포를 모델링할 수 있는 확률적 프레임워크는 무엇인가?
  • RQ3베이지안 추론과 EM 최적화는 웹 특징에서의 사회적 네트워크 재구성 정확도를 어떻게 향상시킬 수 있는가?
  • RQ4웹 스니펫과 명시적 실체 발생은 주체의 속성과 사회적 유대를 모델링하는 데 어떤 기여를 하는가?
  • RQ5단어 클러스터에서 유도된 잠재 주제가 사회적 구조와 관계를 효과적으로 표현할 수 있는가?

주요 결과

  • 제안된 모델은 잠재 주제를 사용하여 문서, 주체, 단어에 대한 생성 과정으로서 사회적 네트워크를 성공적으로 표현한다.
  • 공동 확률 모델 $ P(S,a,w) = \sum_{z} P(z)P(S|z)P(w|z)P(a|z) $ 는 공통 주제를 통해 주체 간 관계 추론을 가능하게 한다.
  • 웹 스니펫은 단어의 백으로 모델링되며, 조건부 확률 $ P(w|a) $ 와 $ P(w|S) $ 는 맥락 기반 주체-단어 연관성을 포착한다.
  • 스니펫의 단어 클러스터에서 유도된 잠재 변수 $ z $ 는 사회적 속성과 역할의 대체 척도가 되며, 주제 기반 주체 클러스터링을 가능하게 한다.
  • 웹 콘텐츠 내 공통 주제와 단어 동시 발생 패tern을 통해 주체를 연결함으로써 동적 네트워크 구축을 지원한다.
  • 모델는 이론적으로 베이지안 확률과 주제 모델링에 기반한 EM 알고리즘을 통해 파rameter화되고 최적화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.