Skip to main content
QUICK REVIEW

[논문 리뷰] What do Vegans do in their Spare Time? Latent Interest Detection in Multi-Community Networks

Jack Hessel, Alexandra Schofield|arXiv (Cornell University)|2015. 11. 11.
Complex Network Analysis Techniques참고 문헌 20인용 수 7
한 줄 요약

이 논문은 Reddit의 다중 커뮤니티 네트워크에서 사용자 기반 유사도와 콘텐츠 기반 유사도를 대조함으로써 '잠재적 관심사'(unexpected community relationships)를 탐지하는 방법을 제안한다. 3,200개의 서브레딧에서 660만 건의 게시물 데이터셋을 사용하여, 사용자 기반은 유사하지만 언어적 콘텐츠는 상이한 서브레딧을 식별함으로써, 비건이 스포츠 커뮤니티에 참여하거나 정치 커뮤니티와 게임 포럼 간의 겹침이 있는 등 숨겨진 관심사를 드러낸다.

ABSTRACT

Most social network analysis works at the level of interactions between users. But the vast growth in size and complexity of social networks enables us to examine interactions at larger scale. In this work we use a dataset of 76M submissions to the social network Reddit, which is organized into distinct sub-communities called subreddits. We measure the similarity between entire subreddits both in terms of user similarity and topical similarity. Our goal is to find community pairs with similar userbases, but dissimilar content; we refer to this type of relationship as a "latent interest." Detection of latent interests not only provides a perspective on individual users as they shift between roles (student, sports fan, political activist) but also gives insight into the dynamics of Reddit as a whole. Latent interest detection also has potential applications for recommendation systems and for researchers examining community evolution.

연구 동기 및 목표

  • 사용자 기반은 유사하지만 콘텐츠는 상이한 커뮤니티 간의 이례적인 관계, 즉 '잠재적 관심사'를 식별하는 것.
  • 다중 커뮤니티 네트워크가 개인 간 상호작용을 초월해 사용자 역할과 사회적 역학을 어떻게 드러내는지 탐구하는 것.
  • 사용자 유사도와 텍스트 유사도를 조합하여 새로운, 명백하지 않은 커뮤니티 쌍을 탐지하는 방법을 개발하는 것.
  • 이중 유사도 지표를 활용해 신선함과 유사도를 균형 잡는 추천 시스템의 기반을 마련하는 것.
  • 향후 커뮤니티 구조와 콘텐츠 상호작용 연구를 지원하기 위해 660만 건의 Reddit 게시물로 구성된 정제되고 균형 잡힌 코퍼스를 공개하는 것.

제안 방법

  • 공동 게시자 집합을 기반으로 Jaccard 유사도를 사용해 서브레딧 간 사용자 유사도를 계산한다.
  • 주제 모델(LDA)을 사용하고 주제 분포 간 코사인 유사도를 측정하여 서브레딧 간 텍스트 유사도를 측정한다.
  • 히우리스틱 스코링 함수를 적용: LI(A,B) = S_user(A,B) × (1 - S_text(A,B))로 높은 사용자 겹침과 낮은 콘텐츠 겹침을 우선순위에 올린다.
  • 상위 100개의 사용자 기반으로 유사한 서브레딧을 필터링하고, 텍스트 유사도 기준 상위 500개를 제거함으로써 잠재적 관심사를 식별한다.
  • 검증을 위해 각 서브레딧의 콘텐츠에서 주도 주제를 LDA를 사용해 추출하여 탐지된 잠재적 관심사의 의미적 별개성을 확인한다.
  • 500건 이상의 게시물과 300명 이상의 고유 사용자를 가진 서브레딧을 필터링하는 데이터 파이프라인을 활용하며, 큰 서브레딧은 5,000건의 샘플링된 게시물로 제한하여 편향을 방지한다.

실험 결과

연구 질문

  • RQ1어떤 커뮤니티들이 유사한 사용자 기반을 공유하지만 콘텐츠는 상이하여 잠재적 관심사를 시사하는가?
  • RQ2사용자 기반과 콘텐츠 기반 유사도를 결합하면, 개별적으로는 탐지되지 않는 커뮤니티 관계를 어떻게 드러낼 수 있는가?
  • RQ3탐지된 잠재적 관심사가 의미 있는, 비단순한 커뮤니티 간 연결을 얼마나 잘 반영하는가?
  • RQ4잠재적 관심사 탐지 기법이 사용자 행동과 콘텐츠 다양성을 모두 반영함으로써 추천 시스템을 어떻게 향상시킬 수 있는가?
  • RQ5다중 커뮤니티 소속(예: 스포츠, 정치, 라이프스타일 서브레딧 등)은 잠재적 관심사 식별에 어떤 영향을 미치는가?

주요 결과

  • /r/Liberal의 상위 10개 잠재적 관심사 중 7개는 사용자 유사도 또는 텍스트 유사도 기준 상위 10위 안에 들지 않았으며, 이는 새로운 발견임을 시사한다.
  • /r/Conservative의 경우 상위 10개 잠재적 관심사 중 8개가 사용자 또는 콘텐츠 유사도 기준 상위 10위에 포함되지 않았으며, 이는 본 방법이 예상치 못한 관계를 드러내는 데 성공했음을 확인한다.
  • 이 방법은 비건이 자주 /r/fitness 및 /r/vegan과 같은 서브레딧에 참여하고 있음을 성공적으로 식별하여, 비건주의를 초월해 건강과 웰빙에 대한 잠재적 관심을 시사한다.
  • 잠재적 관심사 탐지 방법은 단일 지표 기반 접근과는 명확히 구별되며, 이중 유사도 대비 분석이 명백하지 않은 커뮤니티 연결을 탐지하는 데에 향상된 성능을 보임을 입증한다.
  • 이 방법은 /r/vegan과 /r/fitness가 높은 사용자 겹침을 보이지만 언어적 특성이 뚜렷하게 다름을 드러내어, 사용자들이 정체성 기반 커뮤니티와 생활 방식 중심 커뮤니티 양쪽 모두에 참여하고 있음을 시사한다.
  • 본 연구는 향후 커뮤니티 역학과 콘텐츠-사용자 일치 연구를 지원하기 위해 3,200개의 서브레딧에서 수집한 660만 건의 Reddit 게시물로 구성된 정제되고 균형 잡힌 코퍼스를 공개하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.