[论文解读] GP-GPT: Large Language Model for Gene-Phenotype Mapping
GP-GPT 是一种在 OMIM、DisGeNET 和 dbGaP 等精心整理的数据库中提取的 300 多万个基因组学和医学遗传学术语上微调的专用大语言模型。它在基因-表型映射、基因组学问答和关系判断任务中优于 SOTA 模型(如 Llama3 和 GPT-4),展现出更优的生物实体表征能力,并在人工智能辅助遗传病预测方面具有潜力。
Pre-trained large language models(LLMs) have attracted increasing attention in biomedical domains due to their success in natural language processing. However, the complex traits and heterogeneity of multi-sources genomics data pose significant challenges when adapting these models to the bioinformatics and biomedical field. To address these challenges, we present GP-GPT, the first specialized large language model for genetic-phenotype knowledge representation and genomics relation analysis. Our model is fine-tuned in two stages on a comprehensive corpus composed of over 3,000,000 terms in genomics, proteomics, and medical genetics, derived from multiple large-scale validated datasets and scientific publications. GP-GPT demonstrates proficiency in accurately retrieving medical genetics information and performing common genomics analysis tasks, such as genomics information retrieval and relationship determination. Comparative experiments across domain-specific tasks reveal that GP-GPT outperforms state-of-the-art LLMs, including Llama2, Llama3 and GPT-4. These results highlight GP-GPT's potential to enhance genetic disease relation research and facilitate accurate and efficient analysis in the fields of genomics and medical genetics. Our investigation demonstrated the subtle changes of bio-factor entities' representations in the GP-GPT, which suggested the opportunities for the application of LLMs to advancing gene-phenotype research.
研究动机与目标
- 为解决在多个生物层次上表示复杂且异质的基因组学和表型数据的挑战。
- 开发一种统一框架,将结构化和非结构化的生物医学数据整合到基于大语言模型的单一系统中。
- 提高基因-表型关系抽取和医学遗传学信息检索的准确性。
- 实现人工智能辅助的遗传病关联诊断与发现,特别是在样本量小或数据不平衡的情境下。
提出的方法
- 在包含 300 多万个基因组学和医学遗传学术语的精心整理语料库上,微调了三种尺寸的基于 Llama 的大语言模型(小型、基础型、大型)。
- 从 OMIM、DisGeNET、UniProt 和 dbGaP 等结构化数据源,以及非结构化的科学文献中构建了全面的文本语料库。
- 采用两阶段微调策略,以增强对遗传和表型实体的领域特定理解与表征能力。
- 利用对比学习和注意力机制,将生物上相关的基因、蛋白质和疾病在共享向量空间中的嵌入进行对齐。
- 使用基准数据集评估模型在基因组学问答和基因组关系判断任务中的性能。
- 分析隐藏表征,以证明微调后生物上一致的基因-疾病组在嵌入空间中聚类更加清晰。
实验结果
研究问题
- RQ1大语言模型能否被有效微调,以在生物医学文本中表示并推理复杂的基因-表型-疾病关系?
- RQ2在基因组学语料库上进行领域特定微调,相较于通用模型,如何提升大语言模型在基因组学特定任务上的性能?
- RQ3在遗传病关联背景下,模型尺寸和架构在生物实体表征质量方面的影响程度如何?
- RQ4该模型能否生成可靠且上下文感知的答案,以回答需要整合多层次生物知识的复杂遗传医学问题?
- RQ5微调后的模型是否在嵌入空间中学习到更连贯、更具生物学意义的基因与疾病聚类?
主要发现
- GP-GPT 在基因组学问答和基因组关系判断任务中优于最先进的大语言模型,包括 Llama2、Llama3 和 GPT-4。
- 微调后的模型显著改善了遗传和表型实体的隐藏表征,在嵌入空间中更清晰地聚类出与神经元和脑部相关的基因与疾病。
- 模型尺寸对性能有显著影响,GP-GPT Large(700亿参数)在所有评估任务中均达到最高准确率。
- 该模型成功检索到复杂的多维关联,例如 Aβ40 脑血管病与脑出血的关联,以及 LRRK2 突变与路易体病的关联。
- 微调导致生物因子实体表征发生细微但具有重要意义的变化,表明对生物关系的理解更加深入。
- GP-GPT 在数据有限或高度不平衡的情境下,展现出在人工智能辅助遗传病预测方面的强大潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。