[论文解读] Two Step Joint Model for Drug Drug Interaction Extraction
本文提出了一种用于从药品说明书文本中抽取药物-药物相互作用(DDI)的两步联合模型,首先通过CNN-GRU序列标注系统识别致敏剂,然后联合检测细粒度的触发词和相互作用类型。该方法在TAC 2018 DDI挑战数据集上,任务1(提及抽取)的F1得分达到0.46,任务2(关系分类)的F1得分达到0.40,优于流水线方法,通过联合推理和基于规则的亚型分类实现了性能提升。
When patients need to take medicine, particularly taking more than one kind of drug simultaneously, they should be alarmed that there possibly exists drug-drug interaction. Interaction between drugs may have a negative impact on patients or even cause death. Generally, drugs that conflict with a specific drug (or label drug) are usually described in its drug label or package insert. Since more and more new drug products come into the market, it is difficult to collect such information by manual. We take part in the Drug-Drug Interaction (DDI) Extraction from Drug Labels challenge of Text Analysis Conference (TAC) 2018, choosing task1 and task2 to automatically extract DDI related mentions and DDI relations respectively. Instead of regarding task1 as named entity recognition (NER) task and regarding task2 as relation extraction (RE) task then solving it in a pipeline, we propose a two step joint model to detect DDI and it's related mentions jointly. A sequence tagging system (CNN-GRU encoder-decoder) finds precipitants first and search its fine-grained Trigger and determine the DDI for each precipitant in the second step. Moreover, a rule based model is built to determine the sub-type for pharmacokinetic interation. Our system achieved best result in both task1 and task2. F-measure reaches 0.46 in task1 and 0.40 in task2.
研究动机与目标
- 为解决从药品说明书文本中自动抽取药物-药物相互作用(DDI)的挑战,这些信息对患者安全至关重要,但手动收集极为困难。
- 通过联合建模提及检测与关系分类,而非采用命名实体识别(NER)与关系抽取(RE)的流水线方法,提升DDI抽取性能。
- 利用基于领域特定词典的规则模型,提升药代动力学(PK)相互作用亚型分类的精确度。
- 通过人工校正和从NLM-180数据集进行数据增强,克服现有数据集中存在的标注不一致和规模有限等局限性。
提出的方法
- 提出一种两步联合模型:首先,使用CNN-GRU编码器-解码器序列标注系统检测句子中的致敏剂。
- 其次,针对每个检测到的致敏剂,训练两个额外的NER系统,以识别细粒度的触发词(PK-T、PD-T、UN-T)和特定相互作用。
- 模型采用带有束搜索的联合解码策略,平衡贪婪解码与Viterbi解码,提升序列预测的准确性。
- 通过将三个模型的个体序列得分相加,采用集成方法组合预测结果,选择得分最高的输出序列。
- 基于规则的系统利用趋势词典和参数词典(源自领域知识)对药代动力学相互作用进行亚型分类。
- 通过将NLM-180数据集转换为Training-22格式,并对标签药物过滤和触发字段对齐进行人工校正,实现了数据增强。
实验结果
研究问题
- RQ1两步联合模型是否能在药物-药物相互作用提及和关系抽取任务中优于传统的流水线方法(即NER后接RE)?
- RQ2联合检测致敏剂、触发词和特定相互作用在提升DDI抽取任务F1得分方面的效果如何?
- RQ3基于规则的亚型分类在多大程度上能提升药代动力学相互作用检测的准确性?
- RQ4标注不一致和数据规模有限等数据质量问题对模型性能有何影响?是否可通过人工校正和数据增强加以缓解?
主要发现
- 所提出的两步联合模型在TAC 2018 DDI挑战任务1(提及抽取)中取得了0.4636的最高F1得分,优于其他系统。
- 在任务2(关系分类)中,系统在test1上的F1得分为0.4046,在test2上为0.3572,表现出跨测试集的鲁棒性。
- 集成三个模型的方法显著提升了性能,第三次提交在任务1中达到0.4525的最高F1得分,在任务2中达到0.4090。
- 对Training-22数据集中标注不一致问题的人工校正,以及从NLM-180进行的数据增强,显著提升了模型的泛化能力和可靠性。
- 用于PK亚型分类的基于规则的模型有效捕捉了领域特定模式,显著提升了药代动力学相互作用检测的精确度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。