Skip to main content
QUICK REVIEW

[論文レビュー] Detection and Characterization of Illegal Marketing and Promotion of Prescription Drugs on Twitter

Janani Kalyanam, Tim K. Mackey|arXiv (Cornell University)|Dec 1, 2017
Web Data Mining and Analysis参考文献 1被引用数 7
ひとこと要約

本研究では、ツイートの内容、メタデータ、ユーザ行動を分析することで、ツイッター上での処方薬の違法マーケティングを検出・特徴付ける機械学習手法を開発した。トピックモデリングと教師あり分類を組み合わせた手法により、違法薬局のプロモーションを96.6%の高精度で同定し、不正ユーザーとそのコンテンツに特徴的なパターンを明らかにした。

ABSTRACT

Illicit online pharmacies allow the purchase of prescription drugs online without a prescription. Such pharmacies leverage social media platforms such as Twit- ter as a promotion and marketing tool with the intent of reaching out to a larger, potentially younger demographics of the population. Given the serious negative health effects that arise from abusing such drugs, it is important to identify the relevant content on social media and exterminate their presence as quickly as pos- sible. In response, we collected all the tweets that contained the names of certain preselected controlled substances over a period of 5 months. We found that an unsupervised topic modeling based methodology is able to identify tweets that promote and market controlled substances with high precision. We also study the meta-data characteristics of such tweets and the users who post them and find that they have several distinguishing characteristics that sets them apart. We were able to train supervised methods and achieve high performance in detecting such content and the users who post them.

研究の動機と目的

  • ツイッター上での処方薬の違法オンラインマーケティング、特に違法オンライン薬局(IOPs)によるマーケティングを検出・特徴付けること。
  • 通常のソーシャルメディアコンテンツとは対照的に、IOPsをプロモートする不正ツイートおよびユーザの特徴を特定すること。
  • スケーラブルでリアルタイムの監視システムを構築し、ソーシャルメディアプラットフォームにおける新たな違法薬物プロモーションを検出すること。
  • 機械学習モデルの性能を、高い正確性と再現率を伴う違法薬物プロモーションコンテンツ分類の観点から評価すること。
  • IOPsの行動的・構造的兆候を明らかにすることで、公衆衛生および規制戦略の立案を支援すること。

提案手法

  • 2015年6月から11月にかけて、ツイッターのストリーミングAPIを用い、制限薬物(例:オキシコドン、フェンタニール)の名前を含む620,477件のツイートを収集した。
  • 無教師トピックモデリングを適用し、ツイート内のテーマクラスタを同定し、キーワードパターンに基づいてIOPsプロモーションを含むものとラベル付けした。
  • URL、リツイート数、フォロワー数、アカウント作成日など、ツイートメタデータ、ユーザーネットワーク行動、プロフィール特徴から18の特徴量を抽出した。
  • 70/30のトレーニング・テスト分割を用い、抽出した特徴量を入力としてロジスティック回帰分類器を学習させ、ツイートがIOPsをプロモートしているかどうかを予測した。
  • 標準的な指標(正解率、適合率、再現率、F1スコア、ゼロ・オール・ロス)を用い、6種類の処方薬についてモデルの性能を評価した。
  • 統計的有意性検定および時系列分析を実施し、不正コンテンツおよび不正ユーザと通常のコンテンツ・ユーザとの差異を検証した。

実験結果

リサーチクエスチョン

  • RQ1違法オンライン薬局をプロモートするツイートと通常のツイートとは、どのような言語的・構造的パターンによって区別されるか?
  • RQ2不正コンテンツを投稿するユーザのメタデータおよびネットワーク特性は、通常のユーザとどのように異なるか?
  • RQ3ツイート特徴量に基づいて学習された機械学習モデルは、どれほど高い正確性と信頼性で違法薬物プロモーションを検出できるか?
  • RQ4URL使用、エンゲージメントレベル、アカウント年数などの主な行動的マーカーは、ソーシャルメディア上の違法プロモーションを示唆するものか?
  • RQ5これらの特徴量を活用して、リアルタイム検出システムを構築し、新たなIOPマーケティングキャンペーンの監視と対応が可能か?

主な発見

  • ロジスティック回帰分類器は、バイコジンに対してF1スコア0.9656、オキシコドンの平均適合率で0.9749を達成し、優れた検出性能を示した。
  • 不正ツイートは一貫してURLを含んでおり(100%の出現率)、ほぼすべてが外部のIOPランディングページへ誘導していた。
  • 不正ユーザのネットワークは顕著に小さく、平均的なuser_friends_countは通常ユーザの107分の1、user_followers_countは188分の1にまで低下していた。
  • 不正ユーザアカウントの70%以上が2014年以降に作成されたことから、こうしたアカウントは近年出現したことが示された。
  • 不正セットでは確認された検証済みユーザは存在せず、user_statuses_countは通常セットの約5倍にのぼっていた。
  • 不正ツイートは最小限のユーザーエンゲージメントを示しており、リツイート数およびretweet_status値はほとんどが0であった。これは、拡散性や自然な共有がほとんどないことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。