[论文解读] NRC-Canada at SMM4H Shared Task: Classifying Tweets Mentioning Adverse Drug Reactions and Medication Intake
加拿大国家研究委员会(NRC-Canada)开发了一种基于支持向量机(SVM)的系统,利用表面形式特征、情感特征和领域特定特征,对负面药物反应(ADR)和药物摄入情况进行分类。该方法在任务1(ADR检测)上取得了0.435的F1分数,在任务2(药物摄入分类)上取得了0.673的F1分数,达到当时最先进水平,通过欠采样技术有效缓解了类别不平衡问题,并利用领域泛化的n-gram和词嵌入技术显著提升了性能。
Our team, NRC-Canada, participated in two shared tasks at the AMIA-2017 Workshop on Social Media Mining for Health Applications (SMM4H): Task 1 - classification of tweets mentioning adverse drug reactions, and Task 2 - classification of tweets describing personal medication intake. For both tasks, we trained Support Vector Machine classifiers using a variety of surface-form, sentiment, and domain-specific features. With nine teams participating in each task, our submissions ranked first on Task 1 and third on Task 2. Handling considerable class imbalance proved crucial for Task 1. We applied an under-sampling technique to reduce class imbalance (from about 1:10 to 1:2). Standard n-gram features, n-grams generalized over domain terms, as well as general-domain and domain-specific word embeddings had a substantial impact on the overall performance in both tasks. On the other hand, including sentiment lexicon features did not result in any improvement.
研究动机与目标
- 开发一种稳健的机器学习系统,用于检测非正式、简短的社交媒体文本中的负面药物反应(ADR)。
- 对表明个人或可能药物摄入的推文进行分类,以应对非正式语言中自我报告的细微差别。
- 通过应用欠采样技术,提升在药物警戒任务中典型高度不平衡数据集上的性能。
- 评估不同类型特征(表面形式、情感词典、领域特定特征)对健康相关社交媒体文本分类性能的影响。
- 识别在ADR和药物摄入检测任务中对模型性能贡献最大的特征。
提出的方法
- 在两个共享任务上训练支持向量机(SVM)分类器:ADR检测(任务1)和药物摄入分类(任务2)。
- 对任务1中的类别不平衡问题应用欠采样,将正负样本比例从1:10降低至1:2,从而提升模型泛化能力。
- 使用多种特征:标准n-gram、领域泛化的n-gram(如将药物名称替换为占位符)、通用及领域特定的词嵌入。
- 引入情感词典特征以评估其影响,但结果显示未带来性能提升。
- 通过逐一移除特征组进行消融研究,以评估其对整体F1分数的贡献。
- 采用交叉验证和测试集评估来调优和验证模型性能,虽测试了类别权重,但在最终模型中未见有效作用。
实验结果
研究问题
- RQ1传统自然语言处理特征(如n-gram、词嵌入)在分类简短、非正式社交媒体文本中的负面药物反应方面效果如何?
- RQ2类别不平衡在ADR检测中的影响程度如何?欠采样能否有效提升结果?
- RQ3在药物警戒任务中,表面形式、情感词典和领域特定特征中,哪类特征对分类性能贡献最大?
- RQ4领域泛化的n-gram和词嵌入在捕捉ADR和药物摄入检测相关模式方面表现如何?
- RQ5情感词典特征能否提升用户生成健康内容中ADR或药物摄入的检测效果?
主要发现
- 在任务1(ADR检测)中,系统取得了0.435的F1分数,九支参赛团队中排名第一。
- 在任务2(药物摄入分类)中,系统取得了0.673的F1分数,九支参赛团队中排名第三。
- 通过将多数类(非ADR)进行欠采样,将类别不平衡比例从1:10降低至1:2,显著提升了任务1的性能。
- 在任务1中,通用领域词嵌入和领域泛化的n-gram是影响最大的特征,对高F1分数贡献显著。
- 在任务2中,领域泛化的n-gram具有最大的独立影响,其移除导致性能下降近1个百分点。
- 情感词典特征在任一任务中均未带来性能提升,被证实对分类目标无效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。