Skip to main content
QUICK REVIEW

[논문 리뷰] Yoga-Veganism: Correlation Mining of Twitter Health Data

Tunazzina Islam|arXiv (Cornell University)|2019. 06. 15.
Eating Disorders and Behaviors인용 수 18
한 줄 요약

이 연구는 40,000건의 건강 관련 트위터 트윗에 주제 모델링(LSA, NMF, LDA)을 적용하여 생활 방식 행동 간 숨겨진 패턴과 상관관계를 규명한다. 요가와 오트밀 식단 간 유의미한 상관관계를 발견하였으며, 학습 정확도는 66%, 테스트 정확도는 51%를 기록하였다. 모델의 해석 가능성은 향후 오해의 소지가 있는 예측 분석을 위해 LIME을 통해 향상되었다.

ABSTRACT

Nowadays social media is a huge platform of data. People usually share their interest, thoughts via discussions, tweets, status. It is not possible to go through all the data manually. We need to mine the data to explore hidden patterns or unknown correlations, find out the dominant topic in data and understand people's interest through the discussions. In this work, we explore Twitter data related to health. We extract the popular topics under different categories (e.g. diet, exercise) discussed in Twitter via topic modeling, observe model behavior on new tweets, discover interesting correlation (i.e. Yoga-Veganism). We evaluate accuracy by comparing with ground truth using manual annotation both for train and test data.

연구 동기 및 목표

  • 건강 관련 소셜 미디어 콘텐츠 내 숨겨진 상관관계, 특히 요가와 식물성 식단과 같은 생활 방식 실천 간 상관관계를 규명하기 위해.
  • 비정형 트위터 데이터에서 주요 주제를 추출하기 위해 주제 모델링 기법(LSA, NMF, LDA)을 적용하기 위해.
  • 수동 주석화를 통한 정확도 평가와 무작위 기준선과의 비교를 통해 모델 성능을 평가하기 위해.
  • 오해의 소지가 있거나 관련 없는 주제 예측을 식별하고 분석하여 모델의 해석 가능성 향상하기 위해.
  • 스트리밍 데이터 파이프라인(Kafka, Spark Streaming)을 활용한 실시간 소셜 미디어 건강 트렌드 모니터링의 가능성 탐색하기 위해.

제안 방법

  • 피트니스, 다이어트, 웰빙과 관련된 키워드를 사용해 트위터 스트리밍 API를 통해 40,000건의 건강 관련 트윗을 수집하였다.
  • 고성능의 분산 메시지 큐로 Apache Kafka를 사용해 실시간으로 고속도의 트위터 데이터 스트림을 스트리밍 및 처리하였다.
  • 대규모 트윗 스트림을 처리하기 위해 병렬 및 분산 처리를 수행하는 Spark Streaming을 활용하였다.
  • 비정형 텍스트에서 의미적 주제를 추론하기 위해 잠재의미분석(Latent Semantic Analysis, LSA), 비음수행렬분해(Non-negative Matrix Factorization, NMF), 잠재디리클레분포(Latent Dirichlet Allocation, LDA)의 세 가지 주제 모델링 알고리즘을 적용하였다.
  • 학습 및 테스트 세트에서 100~500건의 트윗을 수동 주석화하여 정확도 평가를 위한 기준값을 확보하였다.
  • 모델에 종속되지 않는 해석 가능성 기법인 LIME을 사용해 잘못 분류되거나 오해의 소지가 있는 주제 예측을 분석하고 설명하였다.

실험 결과

연구 질문

  • RQ1트위터 데이터에서 주로 다루어지는 건강 관련 주제는 무엇이며, 다양한 생활 방식 카테고리 간 어떻게 군집되어 있는가?
  • RQ2LSA, NMF, LDA와 같은 주제 모델링 알고리즘이 인간 주석화 기준에 비해 건강 관련 트윗의 진정한 주제적 내용을 얼마나 정확하게 추론하는가?
  • RQ3공개 소셜 미디어 논의에서 요가와 오트밀 식단 같은 생활 방식 행동 간 숨겨진 상관관계는 무엇인가?
  • RQ4어떤 주제 모델이 일부 트윗에 대해 오해의 소지가 있거나 관련 없는 주제를 할당하는가? 이러한 오류의 원인 요인은 무엇인가?
  • RQ5LIME과 같은 모델 해석 가능성 기법은 소셜 미디어 텍스트 분석에서 잘못된 주제 예측을 식별하고 설명하는 데 도움이 될 수 있는가?

주요 결과

  • 500건의 수동 주석화 트윗을 대상으로 평가한 결과, 모델은 학습 세트에서 66%의 정확도, 테스트 세트에서 51%의 정확도를 기록하였으며, 4개 주제 기준 25%의 무작위 기준선을 크게 상회하였다.
  • 주제 1은 대부분의 트윗에서 가장 빈번하게 주요 또는 제2주요 주제로 나타났으며, '다이어트', '워크아웃', '헬시', '웨이트로스' 등의 키워드로 특징지어졌다.
  • 데이터에서 요가와 오트밀 식단 간 강력한 상관관계가 관찰되었으며, 많은 트윗에서 두 실천 방식이 동일한 맥락에서 언급되었다.
  • 모델은 애매한 언어로 인해 일부 트윗을 잘못 분류하는 경우가 있었으며, 예를 들어 '손에 물이 있다'는 표현을 수영과 관련이 있다고 오해하여 잘못된 주제 할당을 하였다.
  • 테스트 케이스 10건 중 4건에서 오해의 소지가 있는 예측이 확인되어, LIME을 통한 개선된 해석 가능성과 오류 분석의 필요성을 강조하였다.
  • Kafka와 Spark Streaming의 활용으로 대규모 트위터 데이터 스트림의 확장성 있고 실시간 처리가 가능해졌으며, 이는 대규모 스케일의 주제 모델링을 효율적으로 지원하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.