[论文解读] A COLD Approach to Generating Optimal Samples
本文提出COLD,一种约束全局优化方法,利用训练数据潜在表示的高斯混合模型(GMM)识别潜在空间中的高密度区域,从而实现基于梯度的优化,生成高分、多样化且新颖的离散样本。在MNIST和ChEMBL数据集上,COLD生成的分子具有最优性能、多样性及化学合理性,其类药物性评分达到或超过训练数据的最大值。
Optimising discrete data for a desired characteristic using gradient-based methods involves projecting the data into a continuous latent space and carrying out optimisation in this space. Carrying out global optimisation is difficult as optimisers are likely to follow gradients into regions of the latent space that the model has not been exposed to during training; samples generated from these regions are likely to be too dissimilar to the training data to be useful. We propose Constrained Optimisation with Latent Distributions (COLD), a constrained global optimisation procedure to find samples with high values of a desired property that are similar to yet distinct from the training data. We find that on MNIST, our procedure yields optima for each of three different objectives, and that enforcing tighter constraints improves the quality and increases the diversity of the generated images. On the ChEMBL molecular dataset, our method generates a diverse set of new molecules with drug-likeness scores similar to those of the highest-scoring molecules in the training data. We also demonstrate a computationally efficient way to approximate the constraint when evaluating it exactly is computationally expensive.
研究动机与目标
- 解决基于梯度的优化在离散数据上的局限性,即通常仅能改进已有训练样本,因未训练区域的潜在空间泛化能力差。
- 实现全局优化,通过将优化限制在潜在空间中训练良好的区域,生成与训练数据不同、新颖且高分的样本。
- 开发一种计算高效的近似潜在空间密度的方法,使用 k-近邻(k-NN),尤其适用于高维数据。
- 通过在潜在空间中施加最小密度阈值,确保生成的样本在化学或结构上合理且高分。
- 证明在高密度潜在区域进行约束优化可在多个数据集(包括 MNIST 和 ChEMBL)上生成多样化、高质量的样本。
提出的方法
- 联合训练一个预测变分自编码器(PVAE),其包含 VAE 和一个预测头,将数据映射到连续潜在空间并预测目标属性。
- 从所有训练数据点的编码均值和方差构建高斯混合模型(GMM),以表示训练良好的潜在区域分布。
- 使用密度阈值 η 过滤候选潜在点,仅保留位于 GMM 高密度区域的点,以确保生成的样本与训练数据相似。
- 根据预测的目标分数选择 top-t 候选点,并从这些点出发执行局部基于梯度的优化,以寻找高分样本。
- 使用 HNSW 加速的 k-近邻(k-NN)近似 GMM 密度,以提高计算效率,尤其适用于高维空间。
- 使用 VAE 解码器解码最终优化后的潜在点,并评估真实目标属性以识别全局最优解。
实验结果
研究问题
- RQ1在 VAE 潜在空间中进行约束优化,能否生成新颖、高分、兼具多样性和与训练数据相似性的离散样本?
- RQ2在潜在空间中施加基于 GMM 的密度约束,相较于无约束或局部优化,对生成样本的质量和多样性有何影响?
- RQ3密度阈值 η 的变化对优化结果的影响如何?具体体现在样本得分、多样性及有效性方面?
- RQ4使用 k-NN 近似 GMM 密度是否能实现高维潜在空间中可扩展且高效的全局优化?
- RQ5COLD 在多大程度上能生成类药物性评分与训练数据中最优值相当、同时结构上新颖的分子?
主要发现
- 在 MNIST 上,COLD 为三个不同目标成功生成了最优图像,更严格的约束提升了样本质量和多样性。
- 在 ChEMBL 数据集上,COLD 生成了一组多样且新颖的分子,其 QED 得分达到训练数据中的最高值(0.9483),且生成的分子均未出现在训练集中。
- 当密度阈值 η 从 -1000 降低到 -5000 时,最高分分子保持不变,表明在宽松约束下已收敛至单一全局最优解。
- 随着阈值 η 降低,成功解码的分子比例通常下降,但当从高密度区域采样(b=1)时例外,表明低密度点在解码时可靠性较低。
- 该方法表现出鲁棒性:相同约束下的多次优化均收敛至同一最优解,表明潜在空间中的预测器表面可能存在尖锐的局部最优。
- 使用 HNSW 加速的 k-NN 近似实现了高效的 GMM 密度评估,使该方法可扩展至大规模训练集和高维潜在空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。