Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting the Age of Twitter Users.

Benjamin Paul Chamberlain, Clive Humby|arXiv (Cornell University)|2016. 01. 18.
Bayesian Modeling and Causal Inference참고 문헌 1인용 수 3
한 줄 요약

이 논문은 언어에 관계없이 사용자가 트위터에서 팔로우하는 사람들의 구조를 기반으로 연령을 탐지하는 언어 독립적 방법을 제안한다. 이는 이름이나 언어적 특징에 의존하지 않고, 7억 개의 계정에 대해 베이지안 분류 모델을 적용하여 F1 스코어 0.86을 달성함으로써 사용자가 제공한 생년월일 데이터나 언어별 모델이 필요 없이 정확한 연령 추론이 가능하다.

ABSTRACT

Twitter provides an extremely rich and open source of data for studying human behaviour at scale. It has been used to advance our understanding of social network structure, the viral flow of information and how new ideas develop. Enriching Twitter with demographic information would permit more precise science and better generalisation to the real world. The only demographic indicators associated with a Twitter account are the free text name, location and description fields. We show how the age of most Twitter accounts can be inferred with high accuracy using the structure of the social graph. Besides classical social science applications, there are obvious privacy and child protection implications to this discovery. Previous work on Twitter age detection has focussed on either user-name or linguistic features of tweets. A shortcoming of the user-name approach is that it requires real names (Twitter names are often false) and census data from each user's (unknown) birth country. Problems with linguistic approaches are that most Twitter users do not tweet (the median number of Tweets is 4) and a different model must be learnt for each language. To address these issues, we devise a language-independent methodology for determining the age of Twitter users from data that is native to the Twitter ecosystem. Roughly 150,000 Twitter users specify an age in their free text description field. We generalize this to the entire Twitter network by showing that age can be predicted based on what or whom they follow. We adopt a Bayesian classification paradigm, which offers a consistent framework for handling uncertainty in our data, e.g., inaccurate age descriptions or spurious edges in the graph. Working within this paradigm we have successfully applied age detection to 700 million Twitter accounts with an F1 Score of 0.86.

연구 동기 및 목표

  • 사용자가 제공한 이름이나 언어적 콘텐츠에 의존하지 않고도 정확한 연령 탐지를 가능하게 하여 트위터에서 신뢰할 수 있는 인구통계 데이터의 부족을 해결하고자 한다.
  • 기존 방법들이 일반적으로 허위일 수 있는 실제 이름이나 다국어 또는 저트윗 사용자에게는 적용이 어려운 언어별 모델에 의존하는 한계를 극복하고자 한다.
  • 다양한 인구 집단을 대상으로 원천 트위터 데이터—특히 사회망 관계 구조—에서 연령을 일반화 가능하고 확장 가능한 방법으로 추론하고자 한다.
  • 베이지안 추론을 통해 연령 기술의 불확실성과 노이즈가 있는 사회망 간선을 일관된 프레임워크로 다루고자 한다.
  • 정확한 대규모 사용자 연령 추정을 통해 사회과학 연구의 정밀도를 높이고 어린이 보호 메커니즘을 향상시키고자 한다.

제안 방법

  • 사용자가 팔로우하는 사용자 집합—즉, 사회망 구조를 주요 특징으로 삼아 연령 예측을 수행함으로써 사용자 이름이나 트윗 내용에 의존하지 않는다.
  • 연령 기술의 불확실성과 사회망 내 잠재적인 오류 연결을 모델링하기 위해 베이지안 분류 프레임워크를 적용하여 강건한 추론을 가능하게 한다.
  • 프로필 설명에 자가 보고한 연령을 기록한 약 15만 명의 사용자로 구성된 시드 세트를 활용해 네트워크 전반에 걸쳐 연령 패턴을 일반화한다.
  • 사용자의 사회적 원추 내 연령 분포를 기반으로 연령 그룹을 확률 모델을 통해 추론하며, 팔로우 행동에서 연령 기반 동질성(호모필리)을 가정한다.
  • 대규모 그래프에 적합한 효율적 추론 기법을 사용해 7억 개의 트위터 계정에 대해 이 방법을 스케일링한다.
  • 정확도와 다양한 인구 집단에서의 일반화를 균형 있게 유지하기 위해 연령 그룹(예: 18–24세, 25–34세 등)을 활용한 다중 클래스 분류 접근법을 사용한다.

실험 결과

연구 질문

  • RQ1언어나 이름 기반 특징 없이도 사회망 구조만으로 사용자의 연령을 정확하게 예측할 수 있는가?
  • RQ2사용자가 팔로우하는 사람들의 정보만으로 연령 예측 성능이 다양한 연령 그룹에서 어떻게 달라지는가?
  • RQ3프로필에 자가 보고한 연령 데이터를 활용해 전체 트위터 사용자 집단으로 일반화할 수 있는 모델을 훈련시킬 수 있는가?
  • RQ4베이지안 프레임워크는 연령 레이블의 불확실성과 노이즈가 있는 사회망 데이터를 어떻게 다루는가?
  • RQ5이 방법은 언어별 튜닝 없이 수백만 또는 수십억 명의 사용자에게도 대규모로 적용 가능한가?

주요 결과

  • 이 방법은 7억 개의 트위터 계정에서 연령 그룹을 예측할 때 F1 스코어 0.86을 달성하여 대규모에서의 높은 정확도를 입증한다.
  • 언어 독립적이므로 언어별 모델이나 트윗의 언어 분석이 필요 없어진다.
  • 사용자 이름이나 트윗 콘텐츠에 의존하는 기존 방법보다 뛰어나며, 특히 트윗 수가 적거나 전혀 없는 사용자(중위수 4개 트윗)에게서도 성능이 뛰어나다.
  • 베이지안 프레임워크는 자가 보고한 연령의 불확실성과 오류 연결을 효과적으로 다루어 강건성을 향상시킨다.
  • 작은 시드 세트(15만 명의 자가 보고 연령 사용자)에서 출발해 전체 트위터 네트워크로 잘 일반화된다.
  • 연구 결과는 언어나 이름 기반 신호 없이도 사회망 구조 자체만으로도 신뢰할 수 있는 연령 추론에 충분한 신호가 존재함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.