Skip to main content
QUICK REVIEW

[논문 리뷰] Social media mining for identification and exploration of health-related information from pregnant women

Pramod Bharadwaj Chandrashekar, Arjun Magge|arXiv (Cornell University)|2017. 02. 08.
Topic Modeling참고 문헌 26인용 수 10
한 줄 요약

이 연구는 임신부를 사회적 미디어에서 식별하고, 그들의 종단적 건강 게시글을 수집하며, 임신 3개 시기 동안 약물 사용 패턴을 분석하기 위해 NLP와 기계학습을 융합한 파이프라인을 제안한다. 규칙 기반 탐지와 지도 학습 분류기(F-measure 0.81)를 사용하여 트위터와 딜리스트레NGTH에서 총 34,895명의 사용자 타임라인을 확보하였으며, 언급 빈도가 낮음에도 불구하고 약물 복용 패턴을 탐지할 수 있었다.

ABSTRACT

Widespread use of social media has led to the generation of substantial amounts of information about individuals, including health-related information. Social media provides the opportunity to study health-related information about selected population groups who may be of interest for a particular study. In this paper, we explore the possibility of utilizing social media to perform targeted data collection and analysis from a particular population group -- pregnant women. We hypothesize that we can use social media to identify cohorts of pregnant women and follow them over time to analyze crucial health-related information. To identify potentially pregnant women, we employ simple rule-based searches that attempt to detect pregnancy announcements with moderate precision. To further filter out false positives and noise, we employ a supervised classifier using a small number of hand-annotated data. We then collect their posts over time to create longitudinal health timelines and attempt to divide the timelines into different pregnancy trimesters. Finally, we assess the usefulness of the timelines by performing a preliminary analysis to estimate drug intake patterns of our cohort at different trimesters. Our rule-based cohort identification technique collected 53,820 users over thirty months from Twitter. Our pregnancy announcement classification technique achieved an F-measure of 0.81 for the pregnancy class, resulting in 34,895 user timelines. Analysis of the timelines revealed that pertinent health-related information, such as drug-intake and adverse reactions can be mined from the data. Our approach to using user timelines in this fashion has produced very encouraging results and can be employed for other important tasks where cohorts, for which health-related information may not be available from other sources, are required to be followed over time to derive population-based estimates.

연구 동기 및 목표

  • 임상 시험에 포함되지 않은 임신부를 포함한 종단적 건강 데이터의 부족을 해결하기 위해.
  • 트위터와 딜리스트레NGTH 같은 사회적 미디어 플랫폼에서 임신부를 식별하고 추적할 수 있는 확장 가능한 방법을 개발하기 위해.
  • 시간이 지남에 따라 사용자 타임라인에서 약물 복용 및 부작용과 같은 건강 관련 정보를 추출하고 분석하기 위해.
  • 취약 집단을 대상으로 한 약물안전성 감시를 보완 자료로 활용하기 위해 사회적 미디어의 가능성을 평가하기 위해.
  • 대부분의 사람들이 접근하기 어려운 인구 집단에서의 코hort 식별 및 종단적 건강 모니터링을 위한 일반화 가능한 파이프라인을 구축하기 위해.

제안 방법

  • 임신 선언을 탐지하기 위해 규칙 기반 키워드 검색을 수행하였으며, '임신 중', '출산 예정일', '배부르게 불어나는 배' 등의 용어에 집중하였다.
  • 초기 규칙 기반 결과에서 오진을 줄이기 위해 100개의 수동 애너테이션된 트윗을 기반으로 훈련된 지도 학습 이진 분류기를 적용하였으며, 임신 클래스에 대해 F-measure 0.81을 달성하였다.
  • 식별된 사용자로부터 시간이 지남에 따라 종단적 게시글을 수집하여 트위터와 딜리스트레NGTH에서 개인 건강 타임라인을 구성하였다.
  • 시간적 히وري스틱과 언어적 신호를 사용하여 게시글을 특정 임신 시기로 할당하였지만, 이 방법은 최적화되지 않았다는 점이 지적되었다.
  • 후처리 단계에서 재현율을 향상시키기 위해 일반명, 약어, 철자 변형까지 포함하여 약물 언급 탐지를 확장하였다.
  • 이름 있는 실체 인식과 시간 관계 추출 등의 NLP 기법을 조합하여 사용자 타임라인 내 건강 사건과 약물 노출를 분류하였다.

실험 결과

연구 질문

  • RQ1사회적 미디어 데이터는 종단적 건강 모니터링을 위한 임신부 식별과 추적에 효과적으로 활용될 수 있는가?
  • RQ2규칙 기반 및 기계학습 기법은 사회적 미디어 텍스트에서 임신 선언을 얼마나 정확하게 탐지할 수 있는가?
  • RQ3약물 복용 및 부작용과 같은 건강 관련 정보는 사용자 타임라인에서 얼마나 신뢰성 있게 추출될 수 있는가?
  • RQ4사회적 미디어 게시글에 반영된 바에 비추어 보면, 약물 사용 패턴은 임신 시기별로 어떻게 달라지는가?
  • RQ5제안된 파이프라인은 공공보건 연구를 위한 다른 소외계층이나 접근하기 어려운 인구 집단에 일반화될 수 있는가?

주요 결과

  • 규칙 기반 코hort 식별 방법은 트위터에서 30개월 동안 총 53,820명의 사용자를 확보하였으며, 분류기를 통해 34,895명이 임신으로 확인되었다.
  • 임신 선언 분류기는 F-measure 0.81을 달성하여, 사회적 미디어 콘텐츠에서 자가 보고된 임신을 식별하는 데 높은 정밀도와 재현율을 보였다.
  • 34,895명의 사용자 종단적 타임라인을 통해 약물 복용 패턴을 탐지할 수 있었으며, 아스피린은 각각 1, 2, 3기에서 76, 72, 90명이 언급하였다.
  • 다수의 약물에 대해 언급 빈도가 낮았음에도 불구하고(예: 대부분의 약물의 경우 <0.5%), 시기별로 일관된 약물 사용 패턴이 관찰되어 탐지 가능한 추세임을 시사하였다.
  • 이 방법은 딜리스트레NGTH에서 11,435명의 사용자로부터 총 257,531건의 게시글을 성공적으로 확보하였으며, 더 긴 게시글이 더 상세한 건강 정보 추출을 가능케 하였다.
  • 한계점으로는 어색한 어법과 시간 순서 처리가 열악하며, 트윗에서 성별에 대한 애매함과 최적화되지 않은 시기 분류가 있으며, 향후 개선이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.