[论文解读] GenoTEX: An LLM Agent Benchmark for Automated Gene Expression Data Analysis
GenoTEX 为评估基于大语言模型(LLM)的智能体在自动化基因表达数据分析中的表现提供了一个基准,涵盖数据集选择、预处理和统计分析,包含人工校对的代码与结果。GenoAgents 是一组具备上下文感知能力、协作性的 LLM 智能体,通过迭代修正与专家咨询实现任务,表现优异但暴露出在一致性和错误处理方面持续存在的挑战,凸显了在基因组学人工智能中提升多智能体协作能力的迫切需求。
Recent advancements in machine learning have significantly improved the identification of disease-associated genes from gene expression datasets. However, these processes often require extensive expertise and manual effort, limiting their scalability. Large Language Model (LLM)-based agents have shown promise in automating these tasks due to their increasing problem-solving abilities. To support the evaluation and development of such methods, we introduce GenoTEX, a benchmark dataset for the automated analysis of gene expression data. GenoTEX provides analysis code and results for solving a wide range of gene-trait association problems, encompassing dataset selection, preprocessing, and statistical analysis, in a pipeline that follows computational genomics standards. The benchmark includes expert-curated annotations from bioinformaticians to ensure accuracy and reliability. To provide baselines for these tasks, we present GenoAgent, a team of LLM-based agents that adopt a multi-step programming workflow with flexible self-correction, to collaboratively analyze gene expression datasets. Our experiments demonstrate the potential of LLM-based methods in analyzing genomic data, while error analysis highlights the challenges and areas for future improvement. We propose GenoTEX as a promising resource for benchmarking and enhancing automated methods for gene expression data analysis. The benchmark is available at https://github.com/Liu-Hy/GenoTEX.
研究动机与目标
- 为解决人工基因表达数据分析带来的高昂成本与低效问题,该问题消耗了生物信息学家高达 45% 的工作时间,年成本达 8.483 亿美元。
- 开发一种标准化、可复现的基因识别任务分析流程,与计算基因组学中专家生物信息学家的实践保持一致。
- 评估基于大语言模型的智能体在自动化复杂、多步骤基因表达数据分析工作流方面的有效性。
- 识别 LLM 智能体在基因组学中协作时的关键失败模式与挑战,特别是在一致性和错误处理方面。
- 提供一个公开可用的基准(GenoTEX)和基线(GenoAgents),以推动人工智能驱动的基因组学研究发展。
提出的方法
- GenoTEX 通过训练人类生物信息学家遵循标准化指南,对真实世界基因表达数据进行数据集选择、预处理和统计分析构建而成。
- 该基准包含输入数据集、注释代码以及中间结果与最终结果,确保准确性和可复现性。
- GenoAgents 是一组基于大语言模型的智能体,采用上下文感知规划、迭代修正与领域专家咨询,以模拟人类生物信息学家的工作流程。
- 智能体通过结构化流程协作:数据集选择 → 预处理 → 统计分析,配备反馈回路以实现错误修正。
- 系统采用提示工程,将反馈限制在三个关键建议内,并鼓励对评审意见进行批判性评估。
- 评估采用针对各项任务的指标,包括数据集选择、预处理和统计分析,F1 分数与代码正确性作为关键性能指标。
实验结果
研究问题
- RQ1基于大语言模型的智能体能否以与人类生物信息学家相当的准确性,自动化完整的基因表达数据分析流程?
- RQ2在复杂基因组学任务中,协作式大语言模型智能体在上下文感知规划、迭代修正与专家咨询方面的表现如何?
- RQ3大语言模型智能体工作流中的主要失败模式与错误模式是什么,特别是在统计分析与代码生成方面?
- RQ4智能体反馈的一致性如何影响自动化分析流程的可靠性?
- RQ5提示工程在多大程度上可以缓解大语言模型智能体协作中出现的不稳定与不一致性?
主要发现
- GenoAgents 在自动化基因表达数据分析方面取得了优异的整体表现,证明了基于大语言模型的智能体在基因组学工作流中应用的可行性。
- 统计分析任务的 F1 得分最低,仅为 67.08%,表明在模型选择、参数传递与代码执行方面仍存在显著挑战。
- 代码评审智能体在相同运行中提供了不一致的反馈,某一实例拒绝了正确代码,而另一实例却批准了错误代码,凸显了基于大语言模型的反馈存在不稳定性。
- 当统计学家智能体向模型构造函数意外传递了 'fit_intercept' 参数时,发生了一项关键错误,尽管逻辑正确,但仍引发运行时错误。
- 尽管通过提示工程限制了反馈并鼓励批判性评估,但智能体行为中持续存在的随机性与不一致性仍是主要挑战。
- 错误分析表明,多步骤工作流中累积的错误风险显著影响性能,强调未来智能体设计中亟需引入稳健的迭代修正与共识机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。