[论文解读] Predicting Anti-microbial Resistance using Large Language Models
该论文提出了一种新颖的集成模型,将基于核酸序列的大语言模型(LLM)与在PubMed和耐药基因数据库上微调的生物医学文本LLM(BioBERT)相结合,用于预测抗生素耐药性(AMR)药物类别。通过整合序列数据与来自文本的生物学背景知识,并利用基于LLM的数据增强技术处理罕见类别,该方法在新基准上实现了最先进性能,优于仅使用序列的模型。
During times of increasing antibiotic resistance and the spread of infectious diseases like COVID-19, it is important to classify genes related to antibiotic resistance. As natural language processing has advanced with transformer-based language models, many language models that learn characteristics of nucleotide sequences have also emerged. These models show good performance in classifying various features of nucleotide sequences. When classifying nucleotide sequences, not only the sequence itself, but also various background knowledge is utilized. In this study, we use not only a nucleotide sequence-based language model but also a text language model based on PubMed articles to reflect more biological background knowledge in the model. We propose a method to fine-tune the nucleotide sequence language model and the text language model based on various databases of antibiotic resistance genes. We also propose an LLM-based augmentation technique to supplement the data and an ensemble method to effectively combine the two models. We also propose a benchmark for evaluating the model. Our method achieved better performance than the nucleotide sequence language model in the drug resistance class prediction.
研究动机与目标
- 通过整合生物序列数据与科学文献中的文本知识,提升抗生素耐药基因分类的准确性。
- 通过基于LLM的数据增强技术,解决罕见抗生素耐药类别中的数据稀缺问题。
- 通过使用EBI ARO本体统一多个数据库(CARD和MEGARes)的标签,构建统一的分类框架。
- 评估结合序列与文本LLM的双模型集成方法相较于现有最先进AMR预测方法的性能表现。
- 利用多源、多属性耐药基因数据,建立用于评估AMR预测模型的基准。
提出的方法
- 使用6-mer分词器和低秩适应(LoRA)对多物种核酸序列LLM(NT)进行微调,以预测耐药类别。
- 在PubMed和全文文章的生物医学文本上微调BioBERT,以提取基因家族和耐药机制等耐药属性。
- 利用EBI ARO本体整合CARD和MEGARes的数据,将异构的耐药基因标签统一为单一分类系统。
- 应用BioGPT提示生成技术,为罕见耐药类别生成合成文本描述,提升训练数据的多样性。
- 通过加权软投票集成方法结合两个模型,以利用序列与文本表征的互补优势。
- 使用ART模拟器生成配对末端测序读段,以评估模型在真实世界宏基因组数据上的鲁棒性。
实验结果
研究问题
- RQ1与仅使用序列的模型相比,结合基于序列和基于文本的LLM是否能提升抗生素耐药药物类别预测的准确性?
- RQ2基于LLM的数据增强在数据样本有限的罕见抗生素耐药类别中,是否能显著提升模型性能?
- RQ3通过使用统一本体整合来自多个数据库(CARD和MEGARes)的耐药基因注释,在多大程度上能提升模型的泛化能力和一致性?
- RQ4与AMR-meta、AMR++、Meta-MARC和DeepARG等现有最先进AMR预测工具相比,序列与文本LLM的集成模型表现如何?
- RQ5当在模拟的宏基因组测序读段上进行评估时,该模型是否仍保持优异性能,表明其在真实世界中的适用性?
主要发现
- 所提出的集成模型在宏平均F1分数上优于仅使用序列的LLM基线模型,证明了整合生物文本知识的价值。
- 使用BioGPT进行数据增强显著提升了罕见耐药类别上的性能,减轻了数据不平衡的影响。
- 通过EBI ARO本体统一CARD和MEGARes的标签,实现了跨异构数据库的一致且统一的分类。
- 模型在模拟的宏基因组测序读段上表现出强竞争力,显示出对测序层面噪声和变异的鲁棒性。
- 加权软投票集成方法优于单一模型,证实了序列与文本表征之间的互补性。
- 本研究提出的基准为未来AMR预测模型提供了标准化的评估框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。