Skip to main content
QUICK REVIEW

[論文レビュー] NRC-Canada at SMM4H Shared Task: Classifying Tweets Mentioning Adverse Drug Reactions and Medication Intake

Svetlana Kiritchenko, Saif M. Mohammad|arXiv (Cornell University)|May 11, 2018
Topic Modeling被引用数 16
ひとこと要約

NRC-Canadaは、表面形、センチメント、ドメイン固有の特徴を用いたSVMベースのシステムを開発し、副次的薬物反応(ADR)と薬物摂取の分類を実施した。この手法は、クラス不均衡の是正のためのアンダーサンプリングとドメイン一般化n-gramおよび単語埋め込みの活用により、Task 1(ADR検出)でF1スコア0.435、Task 2(薬物摂取分類)でF1スコア0.673という最先端の性能を達成した。

ABSTRACT

Our team, NRC-Canada, participated in two shared tasks at the AMIA-2017 Workshop on Social Media Mining for Health Applications (SMM4H): Task 1 - classification of tweets mentioning adverse drug reactions, and Task 2 - classification of tweets describing personal medication intake. For both tasks, we trained Support Vector Machine classifiers using a variety of surface-form, sentiment, and domain-specific features. With nine teams participating in each task, our submissions ranked first on Task 1 and third on Task 2. Handling considerable class imbalance proved crucial for Task 1. We applied an under-sampling technique to reduce class imbalance (from about 1:10 to 1:2). Standard n-gram features, n-grams generalized over domain terms, as well as general-domain and domain-specific word embeddings had a substantial impact on the overall performance in both tasks. On the other hand, including sentiment lexicon features did not result in any improvement.

研究の動機と目的

  • 非公式で短いソーシャルメディアの文章における副次的薬物反応(ADR)を検出する耐障害性の高い機械学習システムの開発。
  • 非公式な言語における自己報告のニュアンスに配慮した、個人的または可能性のある薬物摂取を示すツイートの分類。
  • 薬物警戒において一般的な極度に不均衡なデータセットにおける性能向上のため、アンダーサンプリング技術を適用。
  • 表面形、センチメントリソース、ドメイン固有の特徴といったさまざまな特徴タイプが、健康関連のソーシャルメディア文書における分類性能に与える影響の評価。
  • ADRおよび薬物摂取検出タスクにおいて、モデル性能に最も寄与する特徴を特定すること。

提案手法

  • 2つの共有タスク(ADR検出(Task 1)と薬物摂取分類(Task 2))に対して、サポートベクターマシン(SVM)分類器を訓練。
  • Task 1のクラス不均衡を1:10から1:2にまで削減するためのアンダーサンプリングを適用し、モデルの汎化性能を向上。
  • 多様な特徴を用いた:標準n-gram、ドメイン一般化n-gram(例:薬物名をプレースホルダーに置換)、一般およびドメイン固有の単語埋め込み。
  • センチメントリソース特徴を組み込み、その影響を評価したが、性能向上は見られなかった。
  • 個々の特徴グループを除外することで行うアブレーションスタディにより、全体のF1スコアに対する寄与度を評価。
  • 交差検証とテストセット評価を用いてモデル性能をチューニングおよび検証し、クラスウェイトのテストも行ったが、最終モデルでは効果がなかった。

実験結果

リサーチクエスチョン

  • RQ1従来のNLP特徴(例:n-gram、埋め込み)は、短く非公式なソーシャルメディア文書における副次的薬物反応の分類にどの程度有効か?
  • RQ2クラス不均衡はADR検出の性能にどの程度影響を及ぼすか?また、アンダーサンプリングは結果を改善できるか?
  • RQ3表面形、センチメントリソース、ドメイン固有の特徴のうち、どのタイプの特徴が薬物警戒タスクにおける分類性能に最も寄与するか?
  • RQ4ドメイン一般化n-gramとドメイン一般化埋め込みは、ADRおよび薬物摂取検出のための関連パターンをどの程度適切に捉えられるか?
  • RQ5センチメントリソース特徴は、ユーザー生成の健康コンテンツにおけるADRまたは薬物摂取の検出を向上させることができるか?

主な発見

  • Task 1(ADR検出)ではF1スコア0.435を達成し、9チーム中1位となった。
  • Task 2(薬物摂取分類)ではF1スコア0.673を達成し、9チーム中3位となった。
  • 非ADR(多数クラス)をアンダーサンプリングすることで、クラス不均衡を1:10から1:2に削減し、Task 1の性能が顕著に向上した。
  • Task 1では、一般ドメイン単語埋め込みとドメイン一般化n-gramが最も影響力のある特徴であり、高いF1スコアの達成に大きく貢献した。
  • Task 2では、ドメイン一般化n-gramが最も大きな個別的影響を示し、除外すると性能がほぼ1ポイント低下した。
  • センチメントリソース特徴はどちらのタスクでも性能向上をもたらさず、分類目的には効果がなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。