[论文解读] BioT5: Enriching Cross-modal Integration in Biology with Chemical Knowledge and Natural Language Associations
BioT5 提出了一种统一的预训练框架,通过利用 SELFIES 实现稳健的分子表征,并结合生物医学文献中的上下文自然语言关联,增强了生物学中的跨模态整合。该模型在分子描述生成和文本到分子生成任务中优于现有模型,实现了更高的准确率,并通过分别处理结构化与非结构化知识,生成了 100% 有效的类似 SMILES 的结构。
Recent advancements in biological research leverage the integration of molecules, proteins, and natural language to enhance drug discovery. However, current models exhibit several limitations, such as the generation of invalid molecular SMILES, underutilization of contextual information, and equal treatment of structured and unstructured knowledge. To address these issues, we propose $\mathbf{BioT5}$, a comprehensive pre-training framework that enriches cross-modal integration in biology with chemical knowledge and natural language associations. $\mathbf{BioT5}$ utilizes SELFIES for $100%$ robust molecular representations and extracts knowledge from the surrounding context of bio-entities in unstructured biological literature. Furthermore, $\mathbf{BioT5}$ distinguishes between structured and unstructured knowledge, leading to more effective utilization of information. After fine-tuning, BioT5 shows superior performance across a wide range of tasks, demonstrating its strong capability of capturing underlying relations and properties of bio-entities. Our code is available at $\href{https://github.com/QizhiPei/BioT5}{Github}$.
研究动机与目标
- 解决现有模型的局限性,例如无效 SMILES 生成和生物文本中上下文信息利用不足的问题。
- 通过区分结构化知识(如分子-文本对)与非结构化知识(如生物医学文献),改善跨模态整合。
- 通过统一的预训练框架整合化学知识和自然语言关联,提升分子与蛋白质表征学习能力。
- 开发一种能够结合序列和上下文文本信息,生成准确且有效分子结构与描述的模型。
提出的方法
- 使用 SELFIES 代替 SMILES 实现 100% 稳健的分子表征,彻底消除无效结构的生成。
- 通过命名实体识别和实体链接处理生物医学文本,将分子/蛋白质名称替换为其 SELFIES 或 FASTA 序列,生成‘包裹’后的文本。
- 采用共享的 T5 基架构编码器-解码器,对文本、蛋白质序列(FASTA)和分子序列(SELFIES)应用掩码跨度恢复目标。
- 在结构化数据(如 ChEBI-20、ZINC-15)和非结构化文本(PubMed)的组合上进行预训练,每种模态设有独立目标。
- 通过将分子与生物功能(如酶抑制)关联,整合蛋白质知识,提升上下文准确性。
- 使用端到端训练在下游任务(如分子描述生成和基于文本的分子生成)上微调模型。
实验结果
研究问题
- RQ1统一的预训练框架是否能通过结合化学知识与自然语言上下文,提升生物学中的跨模态整合?
- RQ2用 SELFIES 替代 SMILES 是否能显著减少生成模型中无效分子结构的生成?
- RQ3生物医学文献中周围文本的上下文信息是否能提升分子与蛋白质表征的准确性?
- RQ4区分结构化与非结构化知识是否能提升生物编码任务的性能?
- RQ5整合蛋白质知识是否能超越序列级建模,提升分子描述与生成的性能?
主要发现
- BioT5 在分子描述生成任务中达到最先进性能,其输出比 MolT5 和 T5 更准确地描述分子特征,如取代基位置和功能团。
- 在基于文本的分子生成任务中,BioT5 生成了 100% 有效的分子结构,优于生成无效 SMILES 的 MolT5 等模型。
- BioT5 正确识别出复杂分子为特定蛋白质(如 SARS-CoV-2 主蛋白酶)的抑制剂,展示了生物上下文的有效整合。
- 该模型生成语义连贯且多样的输出,避免了 MolT5 等基线模型中常见的重复现象。
- 由于采用稳健的 SELFIES 表征,BioT5 在复杂和长分子上的表现优于 GPT-3.5-turbo 和 MolXPT 等强基线模型。
- 该模型能够将多肽视为分子处理,凸显了小分子与蛋白质之间边界的模糊性,表明联合建模可带来相互益处。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。