[论文解读] MoleHD: Drug Discovery using Brain-Inspired Hyperdimensional Computing.
MoleHD 提出了一种受大脑启发的超维计算(HDC)方法,用于分子性质预测,通过将 SMILES 字符串编码为高维向量,实现高效训练与推理。该方法在 Clintox、BBBP 和 SIDER 数据集的 29 个分类任务中实现了最先进(SOTA)的 ROC-AUC 性能——在随机划分和骨架划分下取得最佳结果,在分层划分下位列第二——同时与最先进图神经网络和循环神经网络相比,显著降低了计算成本和训练开销。
Modern drug discovery is often time-consuming, complex and cost-ineffective due to the large volume of molecular data and complicated molecular properties. Recently, machine learning algorithms have shown promising results in virtual screening of automated drug discovery by predicting molecular properties. While emerging learning methods such as graph neural networks and recurrent neural networks exhibit high accuracy, they are also notoriously computation-intensive and memory-intensive with operations such as feature embeddings or deep convolutions. In this paper, we propose a viable alternative to existing learning methods by presenting \model, a method based on brain-inspired hyperdimensional computing (HDC) for molecular property prediction. We develop HDC encoders to project SMILES representation of a molecule into high-dimensional vectors that are used for HDC training and inference. We perform an extensive evaluation using 29 classification tasks from 3 widely-used molecule datasets (Clintox, BBBP, SIDER) under three splits methods (random, scaffold, and stratified). By an comprehensive comparison with 8 existing learning models including SOTA graph/recurrent neural networks, we show that MoleHD is able to achieve highest ROC-AUC score on random and scaffold splits on average across 3 datasets and achieve second-highest on stratified split. Importantly, MoleHD achieves such performance with significantly reduced computing cost and training efforts. To the best of our knowledge, this is the first HDC-based method for drug discovery. The promising results presented in this paper can potentially lead to a novel path in drug discovery research.
研究动机与目标
- 为解决现有深度学习模型在药物发现中计算与内存需求过高的问题。
- 探索超维计算(HDC)作为图神经网络和循环神经网络在分子性质预测中的一种新型、高效替代方案的可行性。
- 在保持或提升虚拟筛选预测性能的同时,减少训练时间与资源消耗。
- 在标准分子数据集上,针对不同数据划分方式(随机、骨架、分层)评估所提方法的鲁棒性。
- 建立首个基于 HDC 的药物发现框架,证明其作为深度学习可扩展且高效的替代方案的潜力。
提出的方法
- MoleHD 使用 HDC 编码器将分子的 SMILES 表示转换为高维二值向量,以保留其结构与化学信息。
- 该方法在训练与推理过程中均使用超维向量,避免了传统神经网络中昂贵的卷积操作或特征嵌入。
- 通过应用标准 HDC 操作(如向量加法与绑定)从编码向量中学习分子性质的表示。
- 模型在三个基准数据集(Clintox、BBBP 和 SIDER)的 29 个分类任务上进行训练与评估。
- 采用三种数据划分策略——随机划分、骨架划分与分层划分——以评估在不同数据分布下的泛化能力与鲁棒性。
- 以 ROC-AUC 为主要指标,与八种现有模型(包括最先进图神经网络与循环神经网络)进行性能对比。
实验结果
研究问题
- RQ1超维计算能否在药物发现的分子性质预测中被有效应用?
- RQ2MoleHD 在不同数据划分下的 ROC-AUC 表现与最先进深度学习模型相比如何?
- RQ3与传统深度学习方法相比,MoleHD 在计算与训练成本方面降低了多少?
- RQ4MoleHD 在不同数据划分策略(包括骨架划分与分层划分)下是否保持了强劲的性能表现?
- RQ5HDC 是否可作为药物发现中虚拟筛选的可行且可扩展的替代方案?
主要发现
- 在随机划分与骨架划分下,MoleHD 在三个数据集(Clintox、BBBP、SIDER)上均取得最高的平均 ROC-AUC 得分。
- 在分层划分下,MoleHD 取得第二高的平均 ROC-AUC 得分,表明其在不同数据分布下具备强大的泛化能力。
- 与现有深度学习模型(包括 SOTA 图神经网络与循环神经网络)相比,该模型显著降低了计算成本与训练开销。
- 性能提升在所有三个数据集中保持一致,表明其对不同分子性质类型与数据特征具有鲁棒性。
- MoleHD 是首个已知将超维计算应用于药物发现的实例,为分子性质预测建立了新颖且高效的路径。
- 结果表明,基于 HDC 的方法可在显著更低的资源需求下实现具有竞争力的性能,从而实现更快、更具可扩展性的虚拟筛选。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。