Skip to main content
QUICK REVIEW

[논문 리뷰] Link Prediction Using Supervised Machine Learning based on Aggregated and Topological Features

Mohammad Raeini|arXiv (Cornell University)|2020. 06. 29.
Complex Network Analysis Techniques인용 수 6
한 줄 요약

이 논문은 공저자 네트워크에서 링크 예측을 위한 지도 학습 접근법을 제안하며, 집계된 특징과 위상적 특징을 사용한다. 짧은 경로 거리 특징과 이웃 수의 합 특징을 조합할 경우 예측 정확도가 크게 향상되며, 최대 97.65%의 정확도를 기록한다. 이는 개별 특징이나 논문 수의 합 특징보다 뛰어나며, 후자는 지배적이고 성능 저하를 유발한다.

ABSTRACT

Link prediction is an important task in social network analysis. There are different characteristics (features) in a social network that can be used for link prediction. In this paper, we evaluate the effectiveness of aggregated features and topological features in link prediction using supervised learning. The aggregated features, in a social network, are some aggregation functions of the attributes of the nodes. Topological features describe the topology or structure of a social network, and its underlying graph. We evaluated the effectiveness of these features by measuring the performance of different supervised machine learning methods. Specifically, we selected five well-known supervised methods including J48 decision tree, multi-layer perceptron (MLP), support vector machine (SVM), logistic regression and Naive Bayes (NB). We measured the performance of these five methods with different sets of features of the DBLP Dataset. Our results indicate that the combination of aggregated and topological features generates the best performance. For evaluation purposes, we used accuracy, area under the ROC curve (AUC) and F-Measure. Our selected features can be used for the analysis of almost any social network. This is because these features provide the important characteristics of the underlying graph of the social networks. The significance of our work is that the selected features can be very effective in the analysis of big social networks. In such networks we usually deal with big data sets, with millions or billions of instances. Using fewer, but more effective, features can help us for the analysis of big social networks.

연구 동기 및 목표

  • 사회 네트워크에서 집계된 특징과 위상적 특징의 효과를 평가하기 위해.
  • 대규모 네트워크에서 향후 공저자 링크를 예측하는 데 가장 유용한 특징을 규명하기 위해.
  • DBLP 데이터셋을 사용하여 다양한 특징 세트에서 여러 지도 학습 알고리즘의 성능을 비교하기 위해.
  • 특징 조합이 개별 특징보다 링크 예측 작업에서 더 뛰어난 성능을 보이는지 확인하기 위해.
  • 수백만 또는 수십억 개의 노드를 포함한 대규모 사회 네트워크 분석에 효과적인 특징 세트를 제공하기 위해.

제안 방법

  • 2012–2016년 DBLP 논문을 사용해 훈련 데이터셋을 구축하고, 2017–2018년 데이터를 테스트 세트로 사용하였다.
  • 각 저자 쌍에 대해 두 개의 집계 특징을 추출: 이웃 수의 합과 논문 수의 합.
  • 한 개의 위상적 특징을 추출: 저자 쌍 간의 최단 경로 거리.
  • 다섯 종류의 지도 학습 모델을 훈련: J48 의사결정수트, 다층 퍼셉트론(MLP), 서포트 벡터 머신(SVM), 로지스틱 회귀, 나이브 베이즈.
  • 훈련 및 테스트 세트에서 정확도, AUC, F-measure를 사용해 모델 성능을 평가하였다.
  • 세 가지 특징 세트 간의 모델 성능을 비교: 개별 특징, 집계 특징과 위상적 특징의 조합, 논문 수의 합 특징만 사용.

실험 결과

연구 질문

  • RQ1이웃 수의 합, 논문 수의 합 등 집계 특징이 향후 공저자 링크 예측에 얼마나 효과적인가?
  • RQ2최단 경로 거리와 같은 위상적 특징이 링크 예측 성능에 어떻게 기여하는가?
  • RQ3집계 특징과 위상적 특징을 조합할 경우 개별 특징을 사용할 때보다 링크 예측 정확도가 향상되는가?
  • RQ4논문 수의 합 특징이 링크 존재와 강한 상관관계를 가지는 바, 이로 인해 모델 성능에 어떤 영향을 미치는가?
  • RQ5최적의 특징 세트를 사용할 때 어떤 지도 학습 알고리즘이 가장 뛰어난 성능을 보이는가?

주요 결과

  • 최단 경로 거리 특징과 이웃 수의 합 특징을 조합한 결과가 가장 높은 모델 성능을 기록하였으며, 테스트 정확도는 최대 97.65%에 달했다.
  • 최단 경로 거리 특징만을 사용했을 경우 개별 특징 중 가장 뛰어난 성능을 보였으며, 다양한 모델에서 테스트 정확도가 90.13%에서 97.65% 사이로 변동하였다.
  • 논문 수의 합 특징이 모델 학습을 지배하여 다른 특징들이 간과되며, 이로 인해 일반화 능력 저하와 모델 효과성 감소가 발생했다.
  • 이웃 수의 합 특징은 정확도를 74.25–78.10%까지 향상시켜 논문 수의 합 특징보다 뛰어나지만, 최단 경로 거리 특징에 비해 성능이 열등했다.
  • 로지스틱 회귀와 나이브 베이즈가 조합된 특징 세트에서 가장 높은 F-measure와 AUC 값을 기록했으며, 로지스틱 회귀는 전반적인 성능이 뛰어났다.
  • MLP는 훈련 세트에서 가장 높은 정확도를 기록했고 강력한 AUC 값을 보였지만, F-measure가 가장 낮아서 정밀도-재현율 균형에서의 상충 관계가 드러났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.