Skip to main content
QUICK REVIEW

[논문 리뷰] UNIQORN: Unified Question Answering over RDF Knowledge Graphs and Natural Language Text

Soumajit Pramanik, Jesujoba O. Alabi|arXiv (Cornell University)|2021. 08. 19.
Topic Modeling인용 수 10
한 줄 요약

UNIQORN은 미세튜닝된 BERT 모델을 통해 질문 관련 증거를 검색하여 동적 컨텍스트 그래프를 구성함으로써 RDF 지식 그래프와 자연어 텍스트를 유일하게 통합하는 질문 응답 프레임워크를 제안한다. 이는 노이즈가 많고 이질적인 증거에서 정확한 답변을 추출하기 위해 그룹 스티너 트리 알고리즘을 사용하며, 제로샷 및 미세튜닝 설정에서 최신 기술보다 뛰어난 성능을 보이며 해석 가능한 증거 기반의 근거를 제공한다.

ABSTRACT

Question answering over RDF data like knowledge graphs has been greatly advanced, with a number of good systems providing crisp answers for natural language questions or telegraphic queries. Some of these systems incorporate textual sources as additional evidence for the answering process, but cannot compute answers that are present in text alone. Conversely, the IR and NLP communities have addressed QA over text, but such systems barely utilize semantic data and knowledge. This paper presents a method for complex questions that can seamlessly operate over a mixture of RDF datasets and text corpora, or individual sources, in a unified framework. Our method, called UNIQORN, builds a context graph on-the-fly, by retrieving question-relevant evidences from the RDF data and/or a text corpus, using fine-tuned BERT models. The resulting graph typically contains all question-relevant evidences but also a lot of noise. UNIQORN copes with this input by a graph algorithm for Group Steiner Trees, that identifies the best answer candidates in the context graph. Experimental results on several benchmarks of complex questions with multiple entities and relations, show that UNIQORN significantly outperforms state-of-the-art methods for heterogeneous QA - in a full training mode, as well as in zero-shot settings. The graph-based methodology provides user-interpretable evidence for the complete answering process.

연구 동기 및 목표

  • RDF 지식 그래프와 비구조적 텍스트와 같은 이질적 소스에 대한 복잡한 사실 질문 응답의 격차를 해소하기 위해.
  • 구조적 데이터와 비구조적 데이터를 별개의 패러다임으로 간주하고 상호 불일치하는 방법을 사용하는 기존 질문 응답 시스템의 한계를 극복하기 위해.
  • 구조적 및 비구조적 데이터에서 유연하게 증거를 동적으로 통합하면서도 답변의 근거와 해석 가능성 보장을 보장하는 통합 프레임워크를 제공하기 위해.
  • 허구적 성향이 높은 LLM에 대한 의존도를 줄이기 위해, 검증 가능한 증거를 제공하는 투명한 그래프 기반 추론 메커니즘을 제공하기 위해.

제안 방법

  • 미세튜닝된 BERT 모델을 사용하여 RDF 지식 그래프와 텍스트 코퍼스에서 질문 관련 증거를 검색함으로써 실시간으로 컨텍스트 그래프를 구성한다.
  • 삼중항 또는 텍스트 문단에서 유래한 모든 증거를 통합된 그래프 내의 노드로 표현하며, 간선은 의미적 또는 관계적 연결을 캡처한다.
  • 질문에서 요구하는 모든 증거 그룹(예: 질문에서의 실체 및 관계)을 연결하는 최소 부분그래프를 식별하기 위해 그룹 스티너 트리 알고리즘을 적용한다. 이는 노이즈를 걸러내고 답변 관련 경로에 집중한다.
  • 비구조적 증거 통합을 가능하게 하기 위해 유연한 주어-서술어-목적어 구조를 사용하여 이질적 증거를 통일적으로 처리한다.
  • 두 단계 파이프라인을 활용한다: BERT를 통한 증거 검색, 그 다음으로 그룹 스티너 트리를 통한 그래프 기반 추론을 통해 답변을 유도한다.
  • 최종 답변 유도 경로를 가시적인 부분그래프(그룹 스티너 트리)로 노출시켜 해석 가능성을 확보하며, 답변을 소스 증거와 연결한다.

실험 결과

연구 질문

  • RQ1RDF 지식 그래프와 자연어 텍스트에서 증거가 필요한 복잡한 질문을 효과적으로 처리할 수 있는 통합 질문 응답 프레임워크는 가능한가?
  • RQ2비구조적 언어화 기반 통합 대비 그래프 기반 추론 접근법이 이질적 증거 간의 핵심 관계를 얼마나 잘 유지하는가?
  • RQ3비생성적 그래프 기반 방법이 사실 질문 응답의 제로샷 및 검색 증강 설정에서 최신 기술 수준의 LLM을 얼마나 뛰어나게 성능을 내는가?
  • RQ4그룹 스티너 트리의 사용이 이질적 질문 응답에서 정확도를 향상시키면서도 해석 가능성과 근거를 유지하는 데 기여하는가?

주요 결과

  • UNIQORN은 여러 벤치마크에서 제로샷 설정을 포함해 이질적 질문 응답에 대해 최신 기술보다 뚜렷이 뛰어난 성능을 보였다.
  • 비구조적 언어화 통합 접근법보다 우수한 성능을 달성하였으며, 이는 복잡한 추론에 필수적인 상호 증거 관계를 손실시키지 않기 때문이다.
  • 제로샷 및 검색 증강 생성(RAG) 설정에서 두 가지 주요 LLM보다도 성능이 뛰어나, LLM이 이용 가능한 상황에서도 효과성을 유지함을 입증하였다.
  • 그룹 스티너 트리의 사용은 투명하고 사용자가 이해할 수 있는 증거 경로를 제공하여 답변 유도 과정을 추적 가능하고 신뢰할 수 있게 하였다.
  • 혼합된 소스에서 동적으로 컨텍스트 그래프를 구성하고 잘라내는 방식을 통해 다수의 실체와 관계를 포함하는 복잡한 질문을 성공적으로 처리하였다.
  • 그룹 스티너 트리 알고리즘의 강건성 덕분에 입력 증거에 심각한 노이즈가 포함되어 있어도 높은 정확도를 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.