Skip to main content
QUICK REVIEW

[论文解读] Deriving Neural Architectures from Sequence and Graph Kernels

Tao Leí, Wengong Jin|arXiv (Cornell University)|May 25, 2017
Topic Modeling参考文献 39被引用 22
一句话总结

该论文提出核神经网络(Kernel Neural Networks),一类源自序列和图核的深度循环神经网络架构,通过核计算将可学习的虚拟参考对象与输入进行比较。该方法通过端到端训练在语言建模和分子图回归任务中取得最先进性能,在斯坦福情感树库数据集上达到53.2%的准确率,在哈佛清洁能源项目数据集上达到0.1043的RMSE。

ABSTRACT

The design of neural architectures for structured objects is typically guided by experimental insights rather than a formal process. In this work, we appeal to kernels over combinatorial structures, such as sequences and graphs, to derive appropriate neural operations. We introduce a class of deep recurrent neural operations and formally characterize their associated kernel spaces. Our recurrent modules compare the input to virtual reference objects (cf. filters in CNN) via the kernels. Similar to traditional neural operations, these reference objects are parameterized and directly optimized in end-to-end training. We empirically evaluate the proposed class of neural architectures on standard applications such as language modeling and molecular graph regression, achieving state-of-the-art results across these applications.

研究动机与目标

  • 为设计用于序列和图等结构化数据的神经架构,形式化一种基于核的原理性方法。
  • 通过从组合核计算中推导神经操作,弥合基于核的函数空间与深度学习之间的差距。
  • 实现基于核理论的端到端可训练神经模型,提升在结构化预测任务中的性能。
  • 通过基于核推导的神经操作,在语言建模和分子图回归任务中展示最先进性能。

提出的方法

  • 通过将虚拟参考对象视为可学习参数,从字符串和图核(如n-gram和Weisfeiler-Lehman核)中推导神经操作。
  • 每一层通过核函数计算输入序列或图与参数化参考对象之间的相似性,例如 $ \mathcal{K}_2(\mathbf{x},\mathbf{y}) = \sum_{i<j} \lambda^{L-i-1} \delta(\mathbf{x}_i,\mathbf{y}_k) \delta(\mathbf{x}_j,\mathbf{y}_l) $,其中包含衰减因子。
  • 该架构使用循环迭代传播基于核的比较,隐藏状态通过参考对象的核加权聚合进行更新。
  • 使用Adam优化器进行端到端训练,结合Dropout和学习率衰减以防止过拟合。
  • 对于图结构,方法采用4次迭代的Weisfeiler-Lehman核,$ n=2 $,并以原子和键特征作为输入。
  • 引入衰减因子 $ \lambda $ 的门控版本,以实现子结构相似性的自适应加权。

实验结果

研究问题

  • RQ1基于核的函数空间能否作为设计结构化数据(如序列和图)深度神经架构的正式基础?
  • RQ2如何将核计算嵌入可微、端到端可训练的神经模块中,以处理序列和图?
  • RQ3基于核推导的神经操作能否在序列建模和图回归任务中超越现有架构?
  • RQ4可学习的核参数(如衰减因子)对模型性能有何影响?

主要发现

  • 所提出的核神经网络在斯坦福情感树库的细粒度分类任务中达到53.2%的测试准确率,优于DMN和RLSTM等先前方法。
  • 在二元情感分类任务中,模型准确率达到89.9%,超过最佳基线的88.6%。
  • 在哈佛清洁能源项目数据集的分子图回归任务中,模型达到0.1043的RMSE,优于此前最佳结果0.1058(相同设置下)。
  • 衰减因子 $ \lambda $ 的门控版本在语言建模和图回归任务中均带来一致的性能提升。
  • 即使使用固定的 $ \lambda $,该模型仍优于多个强基线模型,证明了基于核的设计具有鲁棒性。
  • 该方法成功将核理论与深度学习结合,为结构化对象的架构设计提供了形式化、原理性的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。