Skip to main content
QUICK REVIEW

[论文解读] Deep learning for extracting protein-protein interactions from biomedical literature

Yifan Peng, Zhiyong Lu|arXiv (Cornell University)|Jun 5, 2017
Biomedical Text Mining and Ontologies参考文献 37被引用 15
一句话总结

本文提出McDepCNN,一种基于多通道依赖关系的卷积神经网络,通过分别编码词嵌入和句法依存关系中的核心词嵌入,提升了蛋白质-蛋白质相互作用(PPI)抽取的性能。该模型在跨语料库评估中相比先前方法实现了24.4%的相对F1分数提升,在困难样本上提升了12%,展现出卓越的泛化能力和长距离特征捕捉能力。

ABSTRACT

State-of-the-art methods for protein-protein interaction (PPI) extraction are primarily feature-based or kernel-based by leveraging lexical and syntactic information. But how to incorporate such knowledge in the recent deep learning methods remains an open question. In this paper, we propose a multichannel dependency-based convolutional neural network model (McDepCNN). It applies one channel to the embedding vector of each word in the sentence, and another channel to the embedding vector of the head of the corresponding word. Therefore, the model can use richer information obtained from different channels. Experiments on two public benchmarking datasets, AIMed and BioInfer, demonstrate that McDepCNN compares favorably to the state-of-the-art rich-feature and single-kernel based methods. In addition, McDepCNN achieves 24.4% relative improvement in F1-score over the state-of-the-art methods on cross-corpus evaluation and 12% improvement in F1-score over kernel-based methods on "difficult" instances. These results suggest that McDepCNN generalizes more easily over different corpora, and is capable of capturing long distance features in the sentences.

研究动机与目标

  • 为解决将句法与语义信息整合到深度学习模型中以用于PPI抽取的挑战。
  • 克服依赖于人工特征工程或复杂相似度函数的基于特征和基于核的方法的局限性。
  • 开发一种在多样化生物医学语料库中具有良好泛化能力的深度学习模型,并能捕捉句子中的长距离依赖关系。
  • 提升在困难PPI实例上的性能,特别是在较长或结构复杂的句子中。

提出的方法

  • McDepCNN采用多通道架构,其中一个通道用于词嵌入,另一个通道用于从依存分析中提取的核心词嵌入。
  • 每个通道通过卷积层处理句子表示,随后进行最大池化以提取局部特征。
  • 该模型利用依存结构编码句法关系,从而更好地建模长距离依赖关系。
  • 采用多种卷积窗口大小(3、5、7)以捕捉不同感受野的特征。
  • 模型通过反向传播进行端到端训练,使用交叉熵损失进行二元PPI分类。
  • 消融实验验证了多通道设计的有效性,特别是独立的核心词通道,相比单通道变体性能提升了1.1%。

实验结果

研究问题

  • RQ1一种整合句法依存结构的深度学习模型是否能优于现有的基于特征和基于核的PPI抽取方法?
  • RQ2McDepCNN模型在不同生物医学语料库(如AIMed和BioInfer)上的泛化能力如何?
  • RQ3使用基于依存关系的核心词嵌入是否能提升在长距离或结构复杂PPI实例上的性能?
  • RQ4与传统核方法相比,McDepCNN在捕捉句子中长距离依赖关系方面的能力如何?

主要发现

  • McDepCNN在跨语料库评估中相比最先进方法实现了24.4%的相对F1分数提升,表明其在不同数据集间具有强大的泛化能力。
  • 在困难PPI实例上,McDepCNN的F1分数达到17.3%,比次佳的核方法(5.5 F1)高出三倍以上。
  • 该模型在困难实例上的表现表明其在捕捉长距离依赖关系方面优于基于核的方法,后者在较长或复杂句子中常表现不佳。
  • 消融实验表明,使用独立的核心词通道相比单通道模型性能提升1.1%,证实了其有效性。
  • 增加多种卷积窗口大小(3、5、7)并未提升性能,表明多通道设计已能充分捕捉上下文特征。
  • McDepCNN在AIMed和BioInfer数据集上均优于深度学习基线模型和传统核方法,证实了其鲁棒性和有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。