Skip to main content
QUICK REVIEW

[논문 리뷰] Interleaving Pre-Trained Language Models and Large Language Models for Zero-Shot NL2SQL Generation

Zihui Gu, Ju Fan|arXiv (Cornell University)|2023. 06. 15.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 ZeroNL2SQL를 제안하며, 사전 훈련된 언어 모델(PLM)과 대규모 언어 모델(LLM)을 번갈아 사용하여 zero-shot NL2SQL 생성을 수행하는 프레임워크이다. 먼저, 스키마 정렬을 통해 PLM을 사용해 SQL 스케치를 생성하고, 이후 복잡한 추론을 통해 LLM을 활용해 스케치를 완성한다. 예측치 校정 및 실행 기반 선택을 통해 정확도를 향상시킨다. 이 방법은 실제 벤치마크에서 최고의 실행 정확도를 달성하였으며, SOTA PLM 기반 방법보다 3.2–13% 높고, LLM 기반 방법보다 10–20% 높다.

ABSTRACT

Zero-shot NL2SQL is crucial in achieving natural language to SQL that is adaptive to new environments (e.g., new databases, new linguistic phenomena or SQL structures) with zero annotated NL2SQL samples from such environments. Existing approaches either fine-tune pre-trained language models (PLMs) based on annotated data or use prompts to guide fixed large language models (LLMs) such as ChatGPT. PLMs can perform well in schema alignment but struggle to achieve complex reasoning, while LLMs is superior in complex reasoning tasks but cannot achieve precise schema alignment. In this paper, we propose a ZeroNL2SQL framework that combines the complementary advantages of PLMs and LLMs for supporting zero-shot NL2SQL. ZeroNL2SQL first uses PLMs to generate an SQL sketch via schema alignment, then uses LLMs to fill the missing information via complex reasoning. Moreover, in order to better align the generated SQL queries with values in the given database instances, we design a predicate calibration method to guide the LLM in completing the SQL sketches based on the database instances and select the optimal SQL query via an execution-based strategy. Comprehensive experiments show that ZeroNL2SQL can achieve the best zero-shot NL2SQL performance on real-world benchmarks. Specifically, ZeroNL2SQL outperforms the state-of-the-art PLM-based methods by 3.2% to 13% and exceeds LLM-based methods by 10% to 20% on execution accuracy.

연구 동기 및 목표

  • 사용 가능한 애너테이션 훈련 데이터가 없는 새로운 환경에서 zero-shot NL2SQL의 과제를 해결한다.
  • 기존의 PLM 기반 방법이 복잡한 추론에서 약한 점과 LLM 기반 방법이 스키마 정렬에서 약한 점을 극복한다.
  • 피팅 없이 다양한 데이터베이스, 언어적 현상, SQL 구조에서 견고한 NL2SQL 생성을 가능하게 한다.
  • 예시 기반 보정을 통해 자연어 질문과 실제 데이터베이스 값 간의 정렬을 향상시킨다.
  • 두 단계 파이프라인에서 PLM과 LLM의 강점을 조합하여 zero-shot 환경에서 높은 실행 정확도를 달성한다.

제안 방법

  • 자연어 질문과 데이터베이스 스키마 간의 스키마 정렬을 수행하여, 미세조정된 사전 훈련된 언어 모델(PLM)을 사용해 SQL 스케치를 생성한다.
  • 질문과 스키마에 대한 복잡한 추론을 수행하여 고정된, 동 冻결된 대규모 언어 모델(LLM)을 활용해 SQL 스케치를 완성한다.
  • SEMANTIC 매칭(예: SBERT)을 사용해 생성된 SQL 조건절을 실제 데이터베이스 인스턴스의 값과 정렬하는 예측치 校정 방법을 도입한다.
  • 열 내부, 데이터베이스 내부, 다수준 값 매칭을 조합한 다수준 매칭 전략을 적용하여 예측 정확도를 향상시킨다.
  • LLM가 생성한 다수의 후보 쿼리 중에서 실행 기반 전략을 사용해 최적의 SQL 쿼리를 평가하고 선택한다.
  • 예측치 校정에서 의미적 유사도 계산에 SBERT를 사용하여, GloVe 및 퍼지 매칭 방법보다 우수한 성능을 달성한다.

실험 결과

연구 질문

  • RQ1PLM과 LLM을 조합한 하이브리드 프레임워크가 순수하게 PLM 기반 또는 LLM 기반 접근 방식에 비해 열등한 zero-shot NL2SQL 성능을 달성할 수 있는가?
  • RQ2PLM가 zero-shot 환경에서 스키마 정렬을 위해 정확한 SQL 스케치를 얼마나 잘 생성할 수 있는가?
  • RQ3PLM가 생성한 스케치에 의해 안내받는 LLM이 복잡한 추론을 통해 SQL 스케치를 얼마나 잘 완성할 수 있는가?
  • RQ4데이터베이스 인스턴스 기반 예측치 校정이 zero-shot NL2SQL에서 SQL 정확도를 얼마나 향상시키는가?
  • RQ5실행 기반 선택 및 의미적 매칭(e.g., SBERT)이 생성된 SQL 쿼리의 강건성과 정확도를 크게 향상시킬 수 있는가?

주요 결과

  • ZeroNL2SQL는 실제 NL2SQL 벤치마크에서 SOTA 실행 정확도를 달성하였으며, SOTA PLM 기반 방법보다 3.2%에서 13% 높다.
  • 프레임워크는 SOTA LLM 기반 방법보다 실행 정확도에서 10%에서 20% 높아, 우수한 zero-shot 일반화 능력을 입증한다.
  • SERT를 사용한 예측치 校정은 평균 실행 정확도를 78.5%로 향상시켰으며, 퍼지 매칭(77.2%) 및 GloVe(76.3%)보다 뚜렷하게 뛰어나다.
  • 예측치 校정에서의 다수준 매칭 전략은 다양한 값 유형에 걸쳐 78.5%의 평균 실행 정확도를 달성하여 강건성을 입증한다.
  • 두 단계 파이프라인—PLM를 통한 스케치 생성과 LLM을 통한 완성—은 스키마 정렬과 복잡한 추론 간의 균형을 효과적으로 유지한다.
  • 실행 기반 선택은 잘못된 SQL 쿼리를 효과적으로 걸러내어 실제 데이터베이스 인스턴스를 기반으로 검증함으로써 최종 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.