Skip to main content
QUICK REVIEW

[논문 리뷰] Content Enhanced BERT-based Text-to-SQL Generation

Tong Guo, Huilin Gao|arXiv (Cornell University)|2019. 10. 16.
Topic Modeling참고 문헌 5인용 수 46
한 줄 요약

이 논문은 표 내용과 표 머리말에서 파생된 두 개의 외부 특징 벡터를 BERT 기반 NL2SQL 모델에 추가하여 WikiSQL 성능을 향상시키고 최첨단 성과를 달성한다.

ABSTRACT

We present a simple methods to leverage the table content for the BERT-based model to solve the text-to-SQL problem. Based on the observation that some of the table content match some words in question string and some of the table header also match some words in question string, we encode two addition feature vector for the deep model. Our methods also benefit the model inference in testing time as the tables are almost the same in training and testing time. We test our model on the WikiSQL dataset and outperform the BERT-based baseline by 3.7% in logic form and 3.7% in execution accuracy and achieve state-of-the-art.

연구 동기 및 목표

  • 표 내용을 NL2SQL 모델의 외부 지식으로 활용하는 동기 부여.
  • 질문과 표 셀 및 헤더를 정렬하는 두 개의 특징 벡터를 제안.
  • SELECT, AGG, WHERE 구성요소에 대해 이러한 특징을 BERT 기반 아키텍처에 통합.

제안 방법

  • 질문-내용 매칭 벡터(QV)와 헤더-내용 매칭 벡터(HV)를 표 요소 간의 단어 매칭을 통해 구성.
  • 질문 및 표 헤더 입력을 BERT에 연결하여 Q 및 H의 컨텍스트 표현을 얻음.
  • Q, H, QV, HV를 사용하여 각각 확률로 SELECT 열, SELECT 집합 함수(agg), WHERE 숫자, WHERE 열, WHERE 연산자, WHERE 값 예측.
  • WikiSQL에서 벤치마크로 엔드투엔드 학습하되 벡터 기여를 평가하기 위한 소거 실험.
  • 추가적으로 실행 가이드 디코딩을 적용하면 결과를 더 향상시킬 수 있다.

실험 결과

연구 질문

  • RQ1표 내용에서 파생된 외부 특징이 표준 BERT 기반 기준선보다 NL2SQL 성능을 향상시킬 수 있는가?
  • RQ2표 셀/헤더 매칭이 NL2SQL 구성요소 예측(SELECT, WHERE, AGG)에 어떤 영향을 주는가?
  • RQ3추론 시 QV 및 HV를 도입하면 학습 및 평가 표가 유사할 때 이점이 있는가?

주요 결과

  • 질의 기반의 기준선 대비 로직 형태 및 실행 정확도에서 3.7포인트 향상.
  • 제안된 외부 특징으로 WikiSQL 태스크에서 SOTA 달성.
  • 소거 실험에서 헤더 벡터가 주로 WHERE OP를, 질문 벡터가 주로 WHERE VALUE를 개선하는 것으로 나타남.
  • 외부 특징 벡터를 추가하면 SELECT 열, WHERE 숫자, WHERE 열, WHERE 값 과제에서 유의미한 이득.
  • 실행 가이드 디코딩은 외부 특징과 함께 사용할 때 추가 이득을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.