Skip to main content
QUICK REVIEW

[论文解读] Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows

Fangyu Lei, Jixuan Chen|arXiv (Cornell University)|Nov 12, 2024
Business Process Modeling and AnalysisBusiness, Management and Accounting被引用 3
一句话总结

Spider 2.0 引入了一个真实世界的企业级文本到SQL基准测试,包含632个源自工业数据库的复杂工作流,具有庞大的模式(平均812列)、多样的SQL方言以及多步骤的数据工程任务。尽管使用了先进的大语言模型如 o1-preview,仅有21.3%的任务被成功解决,凸显了在真实企业环境中性能的显著差距。

ABSTRACT

Real-world enterprise text-to-SQL workflows often involve complex cloud or local data across various database systems, multiple SQL queries in various dialects, and diverse operations from data transformation to analytics. We introduce Spider 2.0, an evaluation framework comprising 632 real-world text-to-SQL workflow problems derived from enterprise-level database use cases. The databases in Spider 2.0 are sourced from real data applications, often containing over 1,000 columns and stored in local or cloud database systems such as BigQuery and Snowflake. We show that solving problems in Spider 2.0 frequently requires understanding and searching through database metadata, dialect documentation, and even project-level codebases. This challenge calls for models to interact with complex SQL workflow environments, process extremely long contexts, perform intricate reasoning, and generate multiple SQL queries with diverse operations, often exceeding 100 lines, which goes far beyond traditional text-to-SQL challenges. Our evaluations indicate that based on o1-preview, our code agent framework successfully solves only 21.3% of the tasks, compared with 91.2% on Spider 1.0 and 73.0% on BIRD. Our results on Spider 2.0 show that while language models have demonstrated remarkable performance in code generation -- especially in prior text-to-SQL benchmarks -- they require significant improvement in order to achieve adequate performance for real-world enterprise usage. Progress on Spider 2.0 represents crucial steps towards developing intelligent, autonomous, code agents for real-world enterprise settings. Our code, baseline models, and data are available at https://spider2-sql.github.io

研究动机与目标

  • 解决基准测试性能与真实世界企业级文本到SQL需求之间日益扩大的差距。
  • 构建一个反映工业数据工作流的现实评估框架,涵盖大规模数据库、多种方言和复杂推理。
  • 评估大语言模型在处理元数据、文档、代码库并执行多查询工作流方面的能力。
  • 提供一个可扩展、生产级别的基准测试,以指导企业数据系统中自主代码代理的开发。

提出的方法

  • 从企业应用(如 Salesforce、Google Analytics)中收集632个真实世界文本到SQL任务,使用实际的企业级数据库模式。
  • 数据源来自真实系统,包括 BigQuery、Snowflake、SQLite 和 DuckDB,平均模式大小为812列。
  • 通过文档、教程和开源项目引入多样化的SQL方言(如 Google、Snowflake SQL)。
  • 设计一个结构化环境,支持访问数据库元数据、项目代码库(如 dbt)和外部文档。
  • 实现一个代码代理框架,支持SQL执行、文件编辑、bash命令和表元数据检索等操作。
  • 定义严格的评估协议,要求输出格式正确(CSV或文本)、完整执行工作流,并与YAML定义进行验证。

实验结果

研究问题

  • RQ1当前的大语言模型在面对具有复杂、多步骤数据工程管道的真实企业级文本到SQL工作流时,其泛化能力如何?
  • RQ2当模型需要在大型模式、方言特定函数和外部文档之间进行推理时,其表现如何?
  • RQ3在真实企业环境中,长上下文推理和多查询生成(通常超过100行)对模型性能有何影响?
  • RQ4大语言模型在处理项目级代码库(如 dbt)并根据模式定义验证输出方面表现如何?
  • RQ5在传统基准测试中不存在的企业级文本到SQL工作流中的关键失败模式是什么?

主要发现

  • 使用代码代理框架的 o1-preview 模型仅成功解决了21.3%的任务,表明在真实企业环境中存在显著的性能差距。
  • 与 Spider 1.0 的91.2%和 BIRD 的73.0%相比,该性能大幅下降,凸显了企业工作流复杂性的提升。
  • 平均真实答案SQL查询包含144个标记,包含 ST_DISTANCE 等高级函数,反映出高度的语法和语义复杂性。
  • 成功解决方案需要与元数据、文档和代码库进行广泛交互——远超简单的“问题到SQL”映射。
  • 模型在输出格式验证方面频繁失败,例如返回中间SQL而非最终的CSV或文本结果。
  • 即使成功执行查询,模型也常常未能根据模式定义验证结果,尤其是在基于 dbt 的项目中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。