Skip to main content
QUICK REVIEW

[논문 리뷰] What's my age?: Predicting Twitter User's Age using Influential Friend Network and DBpedia

Alan Smith, Manas Gaur|arXiv (Cornell University)|2018. 04. 10.
Authorship Attribution and Profiling참고 문헌 12인용 수 4
한 줄 요약

이 논문은 영향력 있는 친구 네트워크와 DBpedia 구조화된 지식을 활용하여 트위터 사용자의 연령을 예측하는 기계학습 기반 접근법을 제안한다. 사용자별 DBpedia 카테고리와 정규화된 팔로워 영향력 특징을 활용함으로써, 6.8의 MAE와 10년 이내 오차 범위 내 정확도 83.7%를 달성하며, 단순 평균 예측 기준선을 능가한다.

ABSTRACT

Social media is a rich source of user behavior and opinions. Twitter senses nearly 500 million tweets per day from 328 million users.An appropriate machine learning pipeline over this information enables up-to-date and cost-effective data collection for a wide variety of domains such as; social science, public health, the wisdom of the crowd, etc. In many of the domains, users demographic information is key to the identification of segments of the populations being studied. For instance, Which age groups are observed to abuse which drugs?, Which ethnicities are most affected by depression per location?. Twitter in its current state does not require users to provide any demographic information. We propose to create a machine learning system coupled with the DBpedia graph that predicts the most probable age of the Twitter user. In our process to build an age prediction model using social media text and user meta-data, we explore the existing state of the art approaches. Detailing our data collection, feature engineering cycle, model selection and evaluation pipeline, we will exhibit the efficacy of our approach by comparing with the "predict mean" age estimator baseline.

연구 동기 및 목표

  • 트위터 프로필에 인구통계학적 데이터가 부족한 문제를 해결하기 위해 수동 설문조사나 인터뷰에 의존하지 않고도 사용자 연령을 예측하는 것.
  • 영향력 있는 친구(사회 네트워크 구조)와 DBpedia로부터의 의미적 지식을 통합함으로써 연령 예측 정확도를 향상시키는 것.
  • 실시간 소셜 미디어 데이터를 기반으로 기계학습을 활용한 확장 가능한 자동화된 파이프라인을 개발하는 것.
  • 사용자 관심사, DBpedia 카테고리, 네트워크 영향력 메트릭을 조합한 특징 공학의 효과를 평가하는 것.
  • 지식 기반 특징이 평균 연령 예측과 같은 기준선 모델에 비해 예측 오차를 감소시킨다는 것을 입증하는 것.

제안 방법

  • 목표 사용자 각각에 대해 영향력 있는 친구(팔로워 수가 높은 사용자)를 식별하기 위해 깊이 우선 탐색(1단계)을 수행하는 트위터 사용자 데이터 수집.
  • 각 영향력 있는 친구와 연결된 DBpedia 카테고리를 추출하여 사용자의 관심사와 사회적 맥락을 표현.
  • 각 사용자의 카테고리 수를 영향력 있는 친구 총수로 나누어 퍼센티지 기반 특징으로 정규화함.
  • 상호작용 기반 특징에 대해 특징 스케일링을 적용하여 모델 일반화 능력을 향상시키고 사용자별 팔로워 수에 의한 편향을 줄임.
  • 23,120명의 사용자로 구성된 데이터셋을 기반으로 교차 검증을 수행하며, SVR-RBF, LASSO, 선형 커널 SVR 등의 회귀 모델을 훈련 및 평가.
  • 예측 편향 평가를 위해 잔차 분석을 수행하며, MAE, MedAE, R², Accuracy@10 등의 통계적 지표를 사용해 모델 성능 평가.

실험 결과

연구 질문

  • RQ1영향력 있는 친구 네트워크와 DBpedia 카테고리를 활용한 기계학습 모델이 단순 평균 연령 기준선에 비해 트위터 사용자 연령 예측을 더 정확하게 수행할 수 있는가?
  • RQ2상대적 영향력과 관심 분포 기반의 특징 스케일링이 연령 예측 성능에 어떤 영향을 미치는가?
  • RQ3DBpedia로부터의 의미적 지식 통합이 연령 추정의 예측 오차 감소에 어떤 영향을 미치는가?
  • RQ4MAE 및 정확도 측면에서 다양한 연령군(예: 청소년, 젊은 성인, 노년층)에서 모델 성능은 어떻게 변화하는가?
  • RQ5모델의 예측 편향(예: 과소 예측)이 총합 정확도에 미치는 영향은 얼마나 되며, 잔차 플롯에서 이를 어떻게 반영하는가?

주요 결과

  • SVR-RBF 모델이 가장 낮은 평균 절대 오차(MAE) 6.8을 기록하며, 기준선 평균 예측 모델(MAE = 8.1)을 크게 뛰어넘음.
  • ±10년 이내 오차 범위 내 정확도가 83.7%에 도달하여, 전체 사용자 중 약 83.7%가 20년 범위 내에서 정확히 연령을 예측함.
  • 오차 범위가 넓어질수록 정확도가 향상되어, ±10년일 때 83.7%, ±9년일 때 79.6%를 기록하며 중간 오차에 대한 강건성을 입증함.
  • 잔차 플롯은 왼쪽으로 치우친 분포를 보이며, 모델이 연령을 과소 예측하는 경향이 있음을 시사하지만, 오차가 0에 가까운 영역에 높은 집중도를 유지함으로써 중심 예측 정확도가 높음을 나타냄.
  • LASSO 및 선형 SVR 모델은 다양한 정규화 수준에서 성능 변동이 심했지만, SVR-RBF는 안정적이고 일관되게 효과적인 성능 보여줌.
  • SVR-RBF의 R² 점수는 낮은 0.03이었지만, 강력한 실용적 성능을 보이며, 데이터 희소성과 노이즈 문제는 특징 공학을 통해 관리 가능함을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.