Skip to main content
QUICK REVIEW

[论文解读] ncRNA Classification with Graph Convolutional Networks

Emanuele Rossi, Federico Monti|arXiv (Cornell University)|May 16, 2019
RNA and protein synthesis mechanisms被引用 12
一句话总结

该论文提出RNAGCN,一种图卷积网络,可直接从原始RNA折叠图对非编码RNA(ncRNA)进行分类,在13种ncRNA家族上实现了85.73%的准确率和85.61%的F1分数。通过利用边缘感知卷积和基于注意力的全局池化,其性能优于先前的最先进方法nRC,且无需手工设计图特征。

ABSTRACT

Non-coding RNA (ncRNA) are RNA sequences which don't code for a gene but instead carry important biological functions. The task of ncRNA classification consists in classifying a given ncRNA sequence into its family. While it has been shown that the graph structure of an ncRNA sequence folding is of great importance for the prediction of its family, current methods make use of machine learning classifiers on hand-crafted graph features. We improve on the state-of-the-art for this task with a graph convolutional network model which achieves an accuracy of 85.73% and an F1-score of 85.61% over 13 classes. Moreover, our model learns in an end-to-end fashion from the raw RNA graphs and removes the need for expensive feature extraction. To the best of our knowledge, this also represents the first successful application of graph convolutional networks to RNA folding data.

研究动机与目标

  • 通过利用RNA二级结构的结构拓扑提升ncRNA分类的准确性。
  • 消除先前方法中依赖手工设计图特征提取的需要。
  • 首次将图神经网络——特别是GCN——直接应用于RNA折叠图。
  • 开发一种能够从原始RNA图中学习分层、上下文感知表示的模型,以提升分类性能。
  • 通过端到端深度学习方法在基准ncRNA分类数据集上实现最先进性能。

提出的方法

  • 该模型将RNA序列处理为图结构,其中节点代表核苷酸,边代表磷酸二酯键(黑色)和氢键(红色)。
  • 初始嵌入层将每个核苷酸映射为可学习的连续向量表示。
  • 通过批量归一化和Leaky-ReLU激活函数的多层图卷积层,利用消息传递机制优化节点级特征。
  • 边缘感知卷积在特征传播过程中显式建模不同键类型(磷酸二酯键与氢键)的差异。
  • 使用可微LSTM的set2set池化层,通过关注节点的注意力机制将节点表示聚合为全局图级嵌入。
  • 最后的全连接层配合Softmax输出13种ncRNA家族的分类概率。

实验结果

研究问题

  • RQ1图卷积网络能否有效从原始RNA折叠图中学习,从而在分类性能上超越手工设计的特征?
  • RQ2通过区分磷酸二酯键与氢键的边缘感知卷积是否能提升分类性能?
  • RQ3基于注意力的全局池化机制是否能通过聚焦RNA图中功能相关的节点来改善表征学习?
  • RQ4在RNA图上端到端训练GCN是否能优于基于特征工程的基线方法(如nRC和RNACon)?
  • RQ5与现有最先进方法相比,基于GCN的模型在标准ncRNA分类基准上的性能提升如何?

主要发现

  • 在13类测试集(test13)上,RNAGCN的测试准确率达到85.73%,显著优于nRC的81.81%。
  • 在12类测试集(test12)上,RNAGCN的准确率达到85.29%,超过RNACon(37.17%)和nRC(81.04%)。
  • 在test13上F1分数达到85.61%,在test12上达到86.30%,表明各项指标均持续提升。
  • 在test13上MCC得分达到84.59%,在test12上为84.07%,表明预测结果与真实标签具有强相关性。
  • 性能提升主要归因于从原始图端到端学习以及强调生物学相关节点的注意力池化机制。
  • 消融实验证实,边缘感知卷积和注意力池化是关键组件,移除后性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。