[논문 리뷰] Frameworks for Querying Databases Using Natural Language: A Literature Review
이 문헌 고찰은 2008년에서 2018년 사이에 발표된 자연어에서 데이터베이스 쿼리로의 번역을 위한 47개의 프레임워크를 분석하며, SQL 기반 시스템은 통계적, 기호적, 연결망 기반 접근법으로, NoSQL 기반 시스템은 의미적 매칭 및 패턴 매칭 방법으로 분류한다. 연구의 70%가 SQL을 중심으로 하며, 영어가 주로 지원되는 언어로 사용되고 있으며, 다국어 지원 및 프레임워크 간 상호운용성의 격차가 드러나 있다.
A Natural Language Interface (NLI) facilitates users to pose queries to retrieve information from a database without using any artificial language such as the Structured Query Language (SQL). Several applications in various domains including healthcare, customer support and search engines, require elaborating structured data having information on text. Moreover, many issues have been explored including configuration complexity, processing of intensive algorithms, and popularity of relational databases, due to which translating natural language to database query has become a secondary area of investigation. The emerging trend of querying systems and speech-enabled interfaces revived natural language to database queries research area., The last survey published on this topic was six years ago in 2013. To best of our knowledge, there is no recent study found which discusses the current state of the art translations frameworks for natural language for structured and non-structured query languages. In this paper, we have reviewed 47 frameworks from 2008 to 2018. Out of 47, 35 were closely relevant to our work. SQL based frameworks have been categorized as statistical, symbolic and connectionist approaches. Whereas, NoSQL based frameworks have been categorized as semantic matching and pattern matching. These frameworks are then reviewed based on their supporting language, scheme of their heuristic rule, interoperability support, dataset scope and their overall performance score. The findings stated that 70% of the work in natural language to database querying has been carried out for SQL, and NoSQL share 15%, 10% and 5% of languages like SPAROL, CYPHER and GREMLIN respectively. It has also been observed that most of the frameworks support English language only.
연구 동기 및 목표
- 2013년 이후로 가장 최근의 주요 고찰 이후 발생한 격차를 메우기 위해, 데이터베이스에 대한 자연어 쿼리 기능을 가능하게 하는 프레임워크에 대한 현재의 종합적 조사를 제공한다.
- 통계적, 기호적, 연결망 기반, 의미 매칭, 패턴 매칭 기법을 포함한 기반 접근 방식에 따라 47개의 프레임워크를 분류하고 분석한다.
- 지원 언어, 히ュ리스틱 규칙 체계, 상호운용성, 데이터셋 범위, 성능 점수 등의 차원에서 프레임워크를 평가한다.
- 특히 다국어 지원 및 SQL과 NoSQL 쿼리 언어 프레임워크 간의 균형을 고려할 때, 연구 추세와 연구 격차를 식별한다.
- 최근의 발전과 한계에 초점을 맞춰, 데이터베이스용 자연어 인터페이스 분야의 최신 기술 수준을 체계적으로 개관한다.
제안 방법
- 2008년에서 2018년 사이에 발표된 47개의 프레임워크에 대한 체계적 문헌 고찰을 수행하였으며, 그 중 35개는 연구 초점과 밀접하게 관련된 것으로 간주되었다.
- 프레임워크는 세 가지 주요 범주로 분류된다: SQL 기반(통계적, 기호적, 연결망 기반) 및 NoSQL 기반(의미 매칭, 패턴 매칭).
- 각 프레임워크는 다섯 가지 기준에 따라 평가된다: 지원 언어, 히ュ리스틱 규칙 체계, 상호운용성 지원, 데이터셋 범위, 종합 성능 점수.
- 언어 분포의 정량적 평가가 포함되어 있으며, 연구의 70%는 SQL을 대상으로 하고, 15%는 NoSQL이며, SPARQL, Cypher, Gremlin 각각 10%씩을 차지한다.
- 핵심 차원을 기준으로 프레임워크를 비교하기 위해 구조화된 평가 매트릭스를 사용하였으며, 실용적 사용성과 기술적 설계에 중점을 두었다.
- 결과는 자연어 데이터베이스 쿼리 분야의 주요 추세, 한계점, 미개척 영역을 식별하기 위해 통합되었다.
실험 결과
연구 질문
- RQ12008년에서 2018년 사이에 자연어에서 데이터베이스 쿼리로의 프레임워크에 사용된 주요 기술적 접근 방식은 무엇인가?
- RQ2연구는 SQL과 SPARQL, Cypher, Gremlin 등의 NoSQL 언어 간에 어떻게 분포되어 있는가?
- RQ3기존 프레임워크는 영어 외의 언어, 특히 영어 이외의 언어에 대해 어느 정도의 다국어 입력을 지원하는가?
- RQ4현재 데이터베이스용 자연어 인터페이스 프레임워크에서 성능 및 상호운용성 문제는 어떤가?
- RQ5히ュ리스틱 규칙 체계와 데이터셋 범위는 자연어 쿼리 번역 시스템의 효과성에 어떤 영향을 미치는가?
주요 결과
- 검토된 프레임워크의 70%는 관계형 데이터베이스에 초점을 맞춘 것으로, 강력한 연구 및 개발 집중을 보여준다.
- NoSQL 기반 프레임워크는 전체의 15%를 차지하며, SPARQL, Cypher, Gremlin 각각 5%의 연구 관심을 받았다.
- 대부분의 프레임워크(70% 이상)는 영어만 지원하여, 다국어 자연어 인터페이스 개발에서 심각한 한계를 드러낸다.
- 대부분의 프레임워크는 규칙 기반 또는 통계 기반 방법에 의존하며, 신경망 기반(연결망 기반) 접근법은 성장 중이지만 여전히 소수에 머물러 있다.
- 프레임워크 간의 상호운용성 지원은 제한되어 있으며, 다수의 데이터베이스 시스템이나 쿼리 언어 간에 작동하도록 설계된 시스템은 소수에 불과하다.
- 성능 점수는 다양하게 편차가 크며, 표준화된 벤치마킹 프레임워크가 널리 채택되지 않아 통합된 평가 프rotocol의 필요성이 제기된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.