[논문 리뷰] Detection and Characterization of Illegal Marketing and Promotion of Prescription Drugs on Twitter
이 연구는 트위터에서 처방약의 불법 마케팅을 탐지하고 특성화하기 위해 자연어 처리와 기계학습 기반의 접근법을 개발한다. 트윗 내용, 메타데이터, 사용자 행동을 분석함으로써 주제 모델링과 지도 학습 분류 기법을 활용하여 불법 약국 광고를 식별하는 데 높은 정확도(최대 96.6%)를 달성하였으며, 불법 사용자와 그들의 콘텐츠에 특징적인 패atters를 드러냈다.
Illicit online pharmacies allow the purchase of prescription drugs online without a prescription. Such pharmacies leverage social media platforms such as Twit- ter as a promotion and marketing tool with the intent of reaching out to a larger, potentially younger demographics of the population. Given the serious negative health effects that arise from abusing such drugs, it is important to identify the relevant content on social media and exterminate their presence as quickly as pos- sible. In response, we collected all the tweets that contained the names of certain preselected controlled substances over a period of 5 months. We found that an unsupervised topic modeling based methodology is able to identify tweets that promote and market controlled substances with high precision. We also study the meta-data characteristics of such tweets and the users who post them and find that they have several distinguishing characteristics that sets them apart. We were able to train supervised methods and achieve high performance in detecting such content and the users who post them.
연구 동기 및 목표
- 트위터에서 불법 온라인 마케팅, 특히 불법 온라인 약국(IOPs)의 처방약 마케팅을 탐지하고 특성화하기 위해.
- 일반적인 소셜미디어 콘텐츠와 비교해 불법 약국을 홍보하는 도xed 트윗과 사용자 간의 구별 가능한 특징을 식별하기 위해.
- 불법 약물 마케팅의 신속한 발생을 탐지하기 위한 확장 가능하고 실시간 감시 시스템을 개발하기 위해.
- 고정밀도 및 고재현율을 달성하는 데 기계학습 모델의 성능을 평가하기 위해.
- 불법 약국의 행동적 및 구조적 징후를 폭 드러내어 공중보건 및 규제 전략 수립에 기여하기 위해.
제안 방법
- 2015년 6월부터 11월까지 트위터의 스트리밍 API를 사용해 제제 물질 이름(예: 옥시코돈, 펜타닐)을 포함한 총 620,477건의 트윗을 수집하였다.
- 주제 모델링을 비지도 학습 방식으로 적용해 트윗 내 주제 군집을 식별하였으며, 키워드 패턴을 기반으로 불법 약국 홍보 트윗를 관련 항목으로 레이블링하였다.
- 트윗 메타데이터, 사용자 네트워크 행동, 프로필 특성(예: URL, 재트윗 수, 팔로워 수, 계정 생성일)에서 18개의 특징을 추출하였다.
- 70/30 훈련-테스트 분할 기반으로 로지스틱 회귀 분류기를 훈련시켜 트윗이 불법 약국을 홍보하는지 예측하였다.
- 정확도, 정밀도, 재현율, F1-스코어, 제로-원 손실을 포함한 표준 평가 지표를 사용해 6종의 처방약에 대해 모델 성능을 평가하였다.
- 통계적 유의성 검정 및 시계열 분석을 수행해 불법 콘텐츠 및 사용자 간의 차이를 검증하였다.
실험 결과
연구 질문
- RQ1트위터에서 불법 온라인 약국을 홍보하는 트윗은 일반 트윗과 비교해 어떤 언어적 및 구조적 패턴을 보이는가?
- RQ2불법 콘텐츠를 게재하는 사용자의 메타데이터 및 네트워크 특성은 일반 사용자와 어떻게 다를까?
- RQ3트윗 특징 기반 기계학습 모델이 높은 정확도와 신뢰성으로 불법 약물 마케팅을 탐지할 수 있는 정도는 어느 정도인가?
- RQ4소셜미디어에서 불법 마케팅을 시사하는 주요 행동적 징후(예: URL 사용, 참여 수준, 계정 연령 등)는 무엇인가?
- RQ5이러한 특징을 활용해 실시간 감시 시스템을 구축해 신속히 발생하는 불법 약국 마케팅 캠페인을 모니터링하고 대응할 수 있는가?
주요 결과
- 로지스틱 회귀 분류기는 비코딘에 대해 F1-스코어 0.9656, 옥시코돈 평균 정밀도에 대해 0.9749를 기록하여 강력한 탐지 성능을 입증하였다.
- 불법 트윗는 항상 URL을 포함했으며(100% 유병률), 거의 전부 외부 불법 약국의 로딩 페이지로 연결되었다.
- 불법 사용자의 네트워크 규모는 일반 사용자보다 유의미하게 작았으며, 평균 user_friends_count는 107배 낮고, user_followers_count는 188배 낮았다.
- 불법 사용자 계정의 70% 이상이 2014년 이전 또는 이후에 생성된 것으로 나타나, 이러한 계정들이 최근에 등장한 것으로 확인되었다.
- 불법 집단 내에는 확인된 사용자가 전혀 없었으며, user_statuses_count는 일반 집단보다 약 5배 높았다.
- 불법 트윗는 최소한의 사용자 참여를 보였으며, retweet_count와 retweeted_status 값 대부분이 0이었고, 이는 확산성이나 자연적인 공유가 거의 없음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.