[논문 리뷰] KQA Pro: A Large-Scale Dataset with Interpretable Programs and Accurate SPARQLs for Complex Question Answering over Knowledge Base
KQA Pro는 지식 기반(KB)에 대한 120K개의 복잡한 질문을 포함한 대규모이고 다양한 데이터셋을 소개하며, 해석 가능한 추론 프로그램과 정확한 SPARQL 쿼리를 함께 애너테이션합니다. 이는 자연어 질문(NLQ)에서 SPARQL로의 supervision 또는 NLQ에서 Program으로의 supervision을 통해 최신 모델이 지식 기반 질문 응답(KBQA)에서 약 90%의 정확도를 달성할 수 있도록 하여, QA 전용 기준보다 크게 승승하고 인간 전문가 수준에 가까워지게 합니다.
Complex question answering over knowledge base (Complex KBQA) is challenging because it requires various compositional reasoning capabilities, such as multi-hop inference, attribute comparison, set operation, and etc. Existing benchmarks have some shortcomings that limit the development of Complex KBQA: 1) they only provide QA pairs without explicit reasoning processes; 2) questions are either generated by templates, leading to poor diversity, or on a small scale. To this end, we introduce KQA Pro, a large-scale dataset for Complex KBQA. We define a compositional and highly-interpretable formal format, named Program, to represent the reasoning process of complex questions. We propose compositional strategies to generate questions, corresponding SPARQLs, and Programs with a small number of templates, and then paraphrase the generated questions to natural language questions (NLQ) by crowdsourcing, giving rise to around 120K diverse instances. SPARQL and Program depict two complementary solutions to answer complex questions, which can benefit a large spectrum of QA methods. Besides the QA task, KQA Pro can also serves for the semantic parsing task. As far as we know, it is currently the largest corpus of NLQ-to-SPARQL and NLQ-to-Program. We conduct extensive experiments to evaluate whether machines can learn to answer our complex questions in different cases, that is, with only QA supervision or with intermediate SPARQL/Program supervision. We find that state-of-the-art KBQA methods learnt from only QA pairs perform very poor on our dataset, implying our questions are more challenging than previous datasets. However, pretrained models learnt from our NLQ-to-SPARQL and NLQ-to-Program annotations surprisingly achieve about 90\% answering accuracy, which is even close to the human expert performance...
연구 동기 및 목표
- 복잡한 지식 기반 질문 응답(KBQA)을 위한 대규모, 다양한, 해석 가능한 데이터셋의 부족을 해결합니다.
- 기존 벤치마크가 추론 트레이스가 없거나 템플릿 기반으로 생성된 낮은 다양성의 질문을 사용하는 한계를 극복합니다.
- SPARQL와 공식 프로그램(annotation)을 동시에 제공하여 KBQA에서 다양한 학습 철학을 지원합니다.
- QA 전용 및 중간 단계 supervision(SPARQL/Program) 설정 모두에서 모델 평가를 가능하게 합니다.
- 현재 모델을 도전적으로 시험하고 의미 분석 및 복합 추론 연구를 지원하는 벤치마크를 만듭니다.
제안 방법
- 복잡한 질문에 대한 단계별 추론을 표현하기 위해 구성적이고 해석 가능한 공식 언어인 'Program'을 정의합니다.
- 소규모 템플릿 세트를 조합 전략과 함께 사용하여 다양한 질문, SPARQL, 프로그램을 생성합니다.
- 크라우드소싱을 통해 생성된 질문을 자연어로 재구성하여 언어적 다양성과 유창성을 확보합니다.
- SPARQL와 Program 애너테이션이 정확하고 상호 보완적이도록 보장하여 QA 및 의미 분석 작업을 모두 지원합니다.
- NLQ에서 SPARQL로, NLQ에서 Program으로의 사전학습을 활용하여 모델의 일반화 능력과 추론 정확도를 향상시킵니다.
- 모델 평가를 위한 QA 전용 및 중간 단계 supervision 모두를 지원하도록 데이터셋을 설계합니다.
실험 결과
연구 질문
- RQ1KQA Pro와 같은 대규모, 다양한, 도전적인 데이터셋에 노출된 모델이 QA 쌍만으로 학습된 경우, 복잡한 KBQA에 일반화될 수 있는가?
- RQ2SPARQL 또는 Program 애너테이션을 통한 중간 단계 supervision이 QA 전용 supervision에 비해 KBQA 성능을 얼마나 향상시키는가?
- RQ3해석 가능한 추론 프로그램의 포함 여부가 복잡한 추론 작업에서 모델의 해석 가능성과 성능에 어떤 영향을 미치는가?
- RQ4질문의 다양성, 추론 복잡성, 모델 성능 측면에서 KQA Pro는 기존 벤치마크와 어떻게 비교되는가?
- RQ5사전학습된 모델이 NLQ에서 SPARQL로, NLQ에서 Program으로의 애너테이션에 맞춰 미세조정을 거치면 인간 전문가 수준에 가까운 성능을 달성할 수 있는가?
주요 결과
- 단지 QA 쌍만으로 학습된 최신 KBQA 모델은 KQA Pro에서 성능이 열악하여, 이 데이터셋이 이전 벤치마크보다 더 높은 복잡성을 지닌다는 것을 시사합니다.
- NLQ에서 SPARQL 애너테이션에 맞춰 미세조정된 사전학습 모델은 약 90%의 정확도를 달성하여 인간 전문가 성능에 가까워졌습니다.
- NLQ에서 Program supervision으로 학습된 모델 역시 높은 정확도를 기록하여, 해석 가능한 추론 supervision의 가치를 입증했습니다.
- SPARQL와 Program 애너테이션의 조합은 QA 전용 supervision보다 더 강력하고 일반화 능력이 뛰어난 학습을 가능하게 했습니다.
- 이 데이터셋의 다양성과 구성적 구조는 현재 모델을 효과적으로 시험하고, 더 나은 추론 메커니즘의 필요성을 드러냈습니다.
- KQA Pro는 알려진 바에 비해 NLQ에서 SPARQL로, NLQ에서 Program으로의 매핑을 위한 가장 큰 코퍼스이며, 복잡한 KBQA 연구의 새로운 기준을 설정했습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.