Skip to main content
QUICK REVIEW

[论文解读] BERTChem-DDI : Improved Drug-Drug Interaction Prediction from text using Chemical Structure Information

Ishani Mondal|arXiv (Cornell University)|Dec 21, 2020
Computational Drug Discovery Methods参考文献 16被引用 10
一句话总结

该论文提出 BERTChem-DDI,一种新颖的方法,通过联合利用基于 BioBERT 的生物医学文本上下文嵌入和通过变分自编码器(ChemVAE)从 SMILES 编码分子中提取的化学结构表征,增强了药物-药物相互作用(DDI)预测。该方法在 DDIExtraction 2013 数据集上相较于强基线模型实现了 3.4% 的宏 F1 分数提升,表明整合分子结构信息可显著提升生物医学 NLP 中的关系分类性能。

ABSTRACT

Traditional biomedical version of embeddings obtained from pre-trained language models have recently shown state-of-the-art results for relation extraction (RE) tasks in the medical domain. In this paper, we explore how to incorporate domain knowledge, available in the form of molecular structure of drugs, for predicting Drug-Drug Interaction from textual corpus. We propose a method, BERTChem-DDI, to efficiently combine drug embeddings obtained from the rich chemical structure of drugs along with off-the-shelf domain-specific BioBERT embedding-based RE architecture. Experiments conducted on the DDIExtraction 2013 corpus clearly indicate that this strategy improves other strong baselines architectures by 3.4\% macro F1-score.

研究动机与目标

  • 通过整合特定领域的化学结构知识,提升从生物医学文本中进行药物-药物相互作用(DDI)预测的性能。
  • 探究通过变分自编码器从 SMILES 衍生的分子表征是否能够增强 DDI 抽取中的关系分类性能。
  • 开发一种统一框架,联合利用文本上下文与化学结构嵌入,以实现更优的 DDI 分类。
  • 在 DDIExtraction 2013 基准数据集上建立新的 SOTA 性能。

提出的方法

  • 模型使用基于 BioBERT 的上下文嵌入来表示句子中药物提及的表示,其池化表示来自实体标记的最终隐藏状态。
  • 通过在标记嵌入上进行平均池化,获得药物特定表示,随后通过共享参数的前馈层生成上下文感知的实体向量。
  • 在 ZINC 和 DrugBank 的规范 SMILES 字符串上独立训练 ChemVAE,以学习分子结构的低维潜在表征。
  • 最终模型 BERTChem-DDI 将 [CLS] 标记表示与来自文本和化学的两个实体表示进行拼接,随后通过全连接层和 Softmax 进行分类。
  • 化学结构嵌入使用来自训练好的 ChemVAE 的 292 维潜在向量初始化,随后与 BERT 参数一同进行微调。
  • 模型使用交叉熵损失、Adam 优化器、批量大小 16 和 5 个周期进行端到端训练,序列长度上限为 300 个标记。
Figure 1: Schematic Representation of BERTChem-DDI with the input sentence “Glepafloxain is a competitive inhibitor of the metabolism of Theophylline” tagged with two drug entities Glepafloxacin and Theophylline .
Figure 1: Schematic Representation of BERTChem-DDI with the input sentence “Glepafloxain is a competitive inhibitor of the metabolism of Theophylline” tagged with two drug entities Glepafloxacin and Theophylline .

实验结果

研究问题

  • RQ1将来自 SMILES 表征的分子结构信息整合是否能提升基于文本的 DDI 关系分类性能?
  • RQ2添加化学信息嵌入后,对不同 DDI 关系类型的表现有何影响?
  • RQ3将特定领域的生物医学语言表征与化学结构嵌入融合,是否能在 DDIExtraction 2013 基准上实现新的 SOTA 结果?
  • RQ4在性能提升中,文本上下文或化学结构哪个组件贡献更大?

主要发现

  • 使用 BioBERT v1.0 PubMed PMC 的最佳 BERT-DDI 模型实现了 0.822 的宏 F1 分数,优于其他上下文嵌入变体。
  • 在最佳 BERT-DDI 模型中加入 ChemVAE 衍生的化学结构嵌入后,宏 F1 分数提升了 1.6%,达到 0.838。
  • 性能提升在 Mechanism(3.2%)和 Advice(2.11%)关系类型上最为显著,表明结构信息有助于理解药理机制。
  • BERTChem-DDI 在 DDIExtraction 2013 数据集上实现了新的 SOTA 宏 F1 分数 0.838,较现有基线模型高出 3.4%。
  • 消融实验证实,领域特定嵌入(BioBERT)至关重要,相比通用领域 BERT 提升了 2.3%。
  • ChemVAE 模型成功从 SMILES 字符串中学习到有意义的分子表征,且在 DDI 分类流程中表现有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。