Skip to main content
QUICK REVIEW

[论文解读] Learning a Generative Model for Validity in Complex Discrete Structures

David M. Janz, Jos van der Westhuizen|arXiv (Cornell University)|Dec 5, 2017
Machine Learning in Materials Science被引用 6
一句话总结

本文提出了一种深度循环验证器模型,该模型可学习预测部分序列是否能扩展为有效的离散结构(如有效的Python表达式或SMILES字符串)。通过采用受强化学习启发的训练方法和数据增强技术,该模型提升了变分自编码器中的序列生成质量,使基于SMILES的VAE中有效分子的解码率从0.5%提高至22.3%。

ABSTRACT

Deep generative models have been successfully used to learn representations for high-dimensional discrete spaces by representing discrete objects as sequences and employing powerful sequence-based deep models. Unfortunately, these sequence-based models often produce invalid sequences: sequences which do not represent any underlying discrete structure; invalid sequences hinder the utility of such models. As a step towards solving this problem, we propose to learn a deep recurrent validator model, which can estimate whether a partial sequence can function as the beginning of a full, valid sequence. This validator provides insight as to how individual sequence elements influence the validity of the overall sequence, and can be used to constrain sequence based models to generate valid sequences -- and thus faithfully model discrete objects. Our approach is inspired by reinforcement learning, where an oracle which can evaluate validity of complete sequences provides a sparse reward signal. We demonstrate its effectiveness as a generative model of Python 3 source code for mathematical expressions, and in improving the ability of a variational autoencoder trained on SMILES strings to decode valid molecular structures.

研究动机与目标

  • 解决深度生成模型在分子和代码等离散结构生成中出现的无效序列问题。
  • 开发一种能够预测部分序列有效性的生成模型,从而实现更优的约束感知生成。
  • 通过直接从数据中学习有效性规则,减少对手动编写语法规则的依赖。
  • 通过后处理方式过滤无效解码结果,提升变分自编码器潜在空间的实用性。
  • 通过主动学习和基于扰动的数据增强技术,在仅有少量或无标注有效性数据的情况下实现高效训练。

提出的方法

  • 训练一个循环神经网络以近似有效性函数 $\tilde{v}(x_{1:t})$,用于预测前缀 $x_{1:t}$ 是否可被扩展为完整有效序列。
  • 采用受强化学习启发的目标函数,使模型学习预测某个前缀被扩展为有效序列的概率。
  • 通过已知有效序列(如SMILES字符串)的最小扰动实现数据增强,生成具有信息量的负样本。
  • 在低数据场景下,利用基于互信息的主动学习方法选择不确定性高的序列进行标注,提升样本效率。
  • 在解码过程中作为后处理掩码集成验证器:仅允许模型认为可能有效的字符生成。
  • 通过基于验证器对前缀有效性置信度的掩码,将验证器应用于预训练的基于字符的VAE,以调整解码器logits。

实验结果

研究问题

  • RQ1学习得到的验证器模型能否有效预测部分序列是否可被扩展为有效的离散结构?
  • RQ2如何在不依赖手工编码语法规则或大规模标注数据集的情况下学习有效性约束?
  • RQ3在最小监督条件下,主动学习与数据增强在训练序列有效性模型方面的提升程度如何?
  • RQ4将学习到的验证器集成到下游生成模型(如VAE)中,能多大程度提升生成序列的有效性?
  • RQ5验证器能否无需重新训练即后处理应用于现有模型?其是否显著提升了解码质量?

主要发现

  • 所提出的验证器模型将VAE先验潜在空间生成的有效分子比例从基线CVAE的0.5%提升至22.3%。
  • 该模型在扰动后的SMILES字符串上实现了近乎完美的有效性预测,表明其对微小结构变化具有强大的泛化能力。
  • 当与主动学习结合时,该模型在仅使用少量标注数据的情况下,对Python 3数学表达式的性能表现优异。
  • 与Grammar VAE(7.2%)相比,该方法使样本有效性提升了一个数量级,且显著优于普通CVAE(0.5%)。
  • 将验证器后处理集成到现有VAE中无需重新训练,同时保持了重建精度,却显著提升了解码有效性。
  • 该方法对可变长度序列具有鲁棒性,且无需修改底层自编码器架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。