Skip to main content
QUICK REVIEW

[논문 리뷰] MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL

Bing Wang, Changyu Ren|arXiv (Cornell University)|2023. 12. 18.
Scientific Computing and Data Management인용 수 6
한 줄 요약

MAC-SQL는 텍스트-스키마 변환을 위한 다중 에이전트 협업 프레임워크를 제안하며, 사고의 사슬을 통한 추론을 위한 Decomposer 에이전트, 하위 데이터베이스 추출을 위한 Selector 에이전트, 외부 도구를 사용한 SQL 검증 및 보정을 위한 Refiner 에이전트를 활용한다. GPT-4를 사용하여 BIRD 벤치마크에서 실행 정확도 59.59%의 새로운 최고 성능을 달성하며, 복잡한 실세계 데이터베이스에서 뛰어난 성능을 보여준다.

ABSTRACT

Recent LLM-based Text-to-SQL methods usually suffer from significant performance degradation on "huge" databases and complex user questions that require multi-step reasoning. Moreover, most existing methods neglect the crucial significance of LLMs utilizing external tools and model collaboration. To address these challenges, we introduce MAC-SQL, a novel LLM-based multi-agent collaborative framework. Our framework comprises a core decomposer agent for Text-to-SQL generation with few-shot chain-of-thought reasoning, accompanied by two auxiliary agents that utilize external tools or models to acquire smaller sub-databases and refine erroneous SQL queries. The decomposer agent collaborates with auxiliary agents, which are activated as needed and can be expanded to accommodate new features or tools for effective Text-to-SQL parsing. In our framework, We initially leverage GPT-4 as the strong backbone LLM for all agent tasks to determine the upper bound of our framework. We then fine-tune an open-sourced instruction-followed model, SQL-Llama, by leveraging Code Llama 7B, to accomplish all tasks as GPT-4 does. Experiments show that SQL-Llama achieves a comparable execution accuracy of 43.94, compared to the baseline accuracy of 46.35 for vanilla GPT-4. At the time of writing, MAC-SQL+GPT-4 achieves an execution accuracy of 59.59 when evaluated on the BIRD benchmark, establishing a new state-of-the-art (SOTA) on its holdout test set (https://github.com/wbbeyourself/MAC-SQL).

연구 동기 및 목표

  • 대규모 데이터베이스와 복잡한 다단계 질문에서 LLM 기반 텍스트-스키마 변환 방법의 성능 저하 문제를 해결하기 위해.
  • 기존 방법들이 외부 도구와 협업적 추론을 효과적으로 활용하지 못하는 한계를 극복하기 위해.
  • 특화된 에이전트가 SQL 생성의 각 하위 작업을 담당하는 모듈러하고 확장 가능한 프레임워크를 설계하기 위해.
  • GPT-4의 성능을 모방하기 위해 오픈소스 7B 모델인 SQL-Llama를 피지컬 조정하여 다중 에이전트 환경에서의 성능을 향상시키기 위해.
  • 다중 에이전트 협업을 통해 BIRD 벤치마크에서 새로운 최고 성능 기록을 수립하기 위해.

제안 방법

  • 이 프레임워크는 세 가지 전문화된 에이전트를 활용한다: 질문 분해 및 사고의 사슬을 통한 SQL 생성을 위한 Decomposer, 노이즈를 줄이기 위해 관련 하위 데이터베이스를 추출하기 위한 Selector, 외부 도구를 통해 실행하고 오류를 수정하기 위한 Refiner.
  • Decomposer는 소수의 예시를 통한 사고의 사슬 프롬프팅을 사용하여 SQL 생성 이전에 단계별 추론을 수행한다.
  • Selector는 질문에 기반하여 관련 테이블과 컬럼을 식별함으로써 대규모 데이터베이스를 동적으로 단순화한다.
  • Refiner는 외부 SQL 실행기 도구를 사용하여 생성된 쿼리를 검증하고 피드백을 바탕으로 반복적으로 오류를 수정한다.
  • 시스템은 플러그인 기반 확장성을 지원하여 새로운 도구나 에이전트의 통합이 가능해 지속적인 요구 변화에 대응할 수 있다.
  • BIRD와 Spider에서 유래한 지침 튜닝 데이터셋을 사용하여 오픈소스 SQL-Llama(7B) 모델을 피지컬 조정하여 GPT-4의 에이전트 행동을 재현한다.

실험 결과

연구 질문

  • RQ1고도로 복잡한 스키마를 가진 복잡한 실세계 데이터베이스에서 다중 에이전트 협업 프레임워크가 텍스트-스키마 변환 성능을 향상시킬 수 있는가?
  • RQ2외부 도구 사용과 결합된 사고의 사슬 추론이 SQL 생성 오류를 줄이는 데 얼마나 효과적인가?
  • RQ3피지컬 조정된 7B 오픈소스 LLM이 다중 에이전트 텍스트-스키마 변환 파이프라인에서 GPT-4의 성능을 어느 정도 따라올 수 있는가?
  • RQ4하위 데이터베이스 선택이 대규모 데이터베이스에서 관련 없는 스키마 요소의 간섭을 현저히 줄이는가?
  • RQ5모듈러한 에이전트 아키텍처가 다양한 오류 유형에 일반화할 수 있으며, 새로운 도구를 위한 확장성을 제공하는가?

주요 결과

  • MAC-SQL+GPT-4는 BIRD 벤치마크의 보류 테스트 세트에서 실행 정확도 59.59%의 새로운 최고 성능을 달성했다.
  • 피지컬 조정된 SQL-Llama(7B) 모델은 실행 정확도 43.94%를 기록하여 GPT-4의 기준값 46.35%에 가까운 성능을 보였다.
  • 기존 방법에 비해 이 프레임워크는 스키마 연결 오류를 크게 줄이고 복잡한 다단계 질문에 대한 강건성을 향상시켰다.
  • Refiner 에이전트를 통한 외부 도구 활용은 피드백 기반의 효과적인 SQL 보정을 가능하게 하여 실행 오류를 감소시켰다.
  • 모듈러한 에이전트 아키텍처는 동적 활성화와 확장성을 가능하게 하여 새로운 도구와 추론 모듈의 통합을 지원한다.
  • 공개된 에이전트 지침 데이터셋과 SQL-Llama 모델은 협업적 텍스트-스키마 변환 분야에서 재현 가능하고 오픈소스 기반의 연구를 위한 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.