Skip to main content
QUICK REVIEW

[논문 리뷰] Social Media-based Substance Use Prediction

Tao Ding, Warren K. Bickel|arXiv (Cornell University)|2017. 05. 16.
Spam and Phishing Detection참고 문헌 32인용 수 5
한 줄 요약

이 논문은 Facebook '좋아요'와 '게시물 업데이트'를 활용하여 다중 시각, 비지도 학습 기반의 기계학습 프레임워크를 제안하며, 흡연에 대해 86% AUC, 음주에 대해 81%, 약물 사용에 대해 84%의 AUC를 기록하여 이전 방법들을 능가한다. 방대한 비지도 소셜 미디어 데이터로부터 텍스트 마이닝과 특징 학습을 융합하여 SUD 탐지 능력을 향상시키고, SUD의 행동적 연관성을 규명한다.

ABSTRACT

In this paper, we demonstrate how the state-of-the-art machine learning and text mining techniques can be used to build effective social media-based substance use detection systems. Since a substance use ground truth is difficult to obtain on a large scale, to maximize system performance, we explore different feature learning methods to take advantage of a large amount of unsupervised social media data. We also demonstrate the benefit of using multi-view unsupervised feature learning to combine heterogeneous user information such as Facebook `"likes" and "status updates" to enhance system performance. Based on our evaluation, our best models achieved 86% AUC for predicting tobacco use, 81% for alcohol use and 84% for drug use, all of which significantly outperformed existing methods. Our investigation has also uncovered interesting relations between a user's social media behavior (e.g., word usage) and substance use.

연구 동기 및 목표

  • 대규모 비지도 소셜 미디어 데이터를 활용하여 확장성 있고 비용 효율적인 방법으로 중독성 사용 장애(SUD)를 탐지하는 것.
  • 특히 Facebook '좋아요'와 '게시물 업데이트'와 같은 이질적인 사용자 데이터를 다중 시각 학습을 통해 통합하여 예측 성능을 향상시키는 것.
  • 상관 분석을 통해 소셜 미디어 언어 사용과 SUD 간의 해석 가능한 관계를 규명하는 것.
  • 전통적인 지도 학습 전용 접근 방식에 비해 비지도 및 다중 시각 특징 학습이 SUD 예측에서 우월함을 입증하는 것.

제안 방법

  • 비지도 특징 학습 기법(SPE 및 SLE)을 대규모의 레이블이 없는 소셜 미디어 데이터에 적용하여 의미 있는 사용자 표현을 추출하는 것.
  • Facebook '좋아요'와 '게시물 업데이트'라는 두 가지 다른 데이터 모ality의 특징을 융합하기 위해 다중 시각 학습을 적용하여 보다 종합적인 사용자 프로필을 구성하는 것.
  • 잠재 디리클레 분포(LDA)를 사용하여 '좋아요'와 '게시물 업데이트'의 주제 분포를 식별하고, SUD 관련 주제를 탐지하는 것.
  • Linguistic Inquiry and Word Count(LIWC)를 적용하여 게시물 업데이트의 언어적 특징을 분석하고, SUD 결과와의 상관관계를 분석하는 것.
  • 결합된 특징을 기반으로 지도 학습 모델(예: 로지스틱 회귀)을 훈련하여 SUD를 예측하고, AUC를 주요 평가 지표로 사용하는 것.
  • 스피어의 순위 상관계수 분석을 수행하여 특정 단어, 주제, 약물 사용 행동 간의 유의미한 연관성을 규명하는 것.

실험 결과

연구 질문

  • RQ1대규모 소셜 미디어 데이터에서 비지도 특징 학습을 통해 기존의 지도 학습 전용 기준 대비 SUD 예측 성능을 크게 향상시킬 수 있는가?
  • RQ2Facebook '좋아요'와 '게시물 업데이트'와 같은 이질적인 데이터 소스를 통합할 경우 SUD 예측 모델의 정확도는 어떻게 향상되는가?
  • RQ3소셜 미디어 콘텐츠 내 언어적 및 행동적 패턴 중 어떤 것이 중독성 사용 장애와 유의미하게 관련되어 있는가?
  • RQ4특정 '좋아요'와 '게시물 업데이트' 주제가 담배, 알코올 또는 약물 사용을 얼마나 잘 예측하는가?
  • RQ5소셜 미디어 행동으로 유추된 연령, 성별, 심리적 특성은 SUD 위험과 어떻게 관련되어 있는가?

주요 결과

  • 최고의 성능을 보인 모델은 담배 사용에 대해 86% AUC, 음주에 대해 81%, 약물 사용에 대해 84% AUC를 기록하여 기존 방법들을 뛰어넘었다.
  • '좋아요'와 '게시물 업데이트'를 융합한 다중 시각 학습은 단일 데이터 모달리티를 사용한 모델 대비 뚜렷한 성능 향상을 이끌었다.
  • 분노를 암시하는 단어(예: ' hate ', ' kill ')와 건강 관련 단어(예: ' clinic ', ' pill ')는 약물 사용과 양의 상관관계를 보였고, 과거형 동사(예: ' did ', ' ago ')는 음의 상관관계를 보였다.
  • 여성에 대한 언급(예: ' girl ', ' woman ')은 음주 사용과 양의 상관관계를 보였고, 남성에 대한 언급(예: ' boy ', ' man ')은 약물 사용과 음의 상관관계를 보였다.
  • 음악 장르 중 록 음악과 'V For Vendetta' 및 'Boondock Saints'와 같은 영화를 '좋아요'로 선택한 것은 담배 및 약물 사용과 양의 상관관계를 보였다.
  • 야간 생활과 욕설 관련 주제는 음주 및 담배 사용과 양의 상관관계를 보였고, 학교 관련 및 가정 중심 주제는 SUD와 음의 상관관계를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.