Skip to main content
QUICK REVIEW

[논문 리뷰] UniK-QA: Unified Representations of Structured and Unstructured Knowledge for Open-Domain Question Answering

Barlas Oğuz, Xilun Chen|arXiv (Cornell University)|2020. 12. 29.
Topic Modeling인용 수 15
한 줄 요약

UniK-QA는 구조화된 지식(예: 지식 기반, 표, 목록)을 텍스트 형식으로 변환하고, 모든 자료를 단일 검색기-읽기 아키텍처로 처리함으로써 개방형 질의응답을 위한 통합 프레임워크를 제안한다. 이 방법은 NaturalQuestions(+3.5 EM) 및 WebQuestions(+2.6 EM)에서 최신 기준 성능을 달성하며, 이전의 그래프 기반 방법에 비해 KBQA 성능을 11% 향상시킨다.

ABSTRACT

We study open-domain question answering with structured, unstructured and semi-structured knowledge sources, including text, tables, lists and knowledge bases. Departing from prior work, we propose a unifying approach that homogenizes all sources by reducing them to text and applies the retriever-reader model which has so far been limited to text sources only. Our approach greatly improves the results on knowledge-base QA tasks by 11 points, compared to latest graph-based methods. More importantly, we demonstrate that our unified knowledge (UniK-QA) model is a simple and yet effective way to combine heterogeneous sources of knowledge, advancing the state-of-the-art results on two popular question answering benchmarks, NaturalQuestions and WebQuestions, by 3.5 and 2.6 points, respectively. The code of UniK-QA is available at: https://github.com/facebookresearch/UniK-QA.

연구 동기 및 목표

  • 텍스트, 표, 목록, 지식 기반 등 이질적인 지식 소스를 하나의 통합 QA 시스템에 통합하는 데 도전한다.
  • 기존의 별도로 작동하는 KBQA 및 TextQA 시스템이 다중 소스 추론에 어려움을 겪는 한계를 극복한다.
  • 통합된 텍스트 기반 검색기-읽기 프레임워크가 개방형 QA에서 전문화된 그래프 기반 또는 하이브리드 아키텍처를 능가할 수 있음을 입증한다.
  • 스키마에 특화된 설계나 복잡한 다중 모듈 파ip라인을 요구하지 않고도 여러 지식 소스를 단순하고 확장 가능한 방식으로 통합할 수 있도록 한다.

제안 방법

  • 모든 구조화된 지식 소스(지식 기반 관계, 표, 목록)가 자연어 텍스트 문장으로 선형화된다.
  • 텍스트, 목록, 표, 지식 기반 관계를 포함하는 통합 코퍼스에서 디퍼지드 텍스트 검색기(DPR)를 미세조정하여 관련 텍스트를 검색한다.
  • FiD에 T5-large를 사용한 독자 모델이 개발되어 상위-k 검색된 텍스트에서 답변을 생성하도록 훈련되며, 모든 입력을 텍스트로 간주한다.
  • 질의당 지식 기반 텍스트의 최대 수를 설정하여 검색의 정확도와 성능 간 균형을 맞추며, 개발 세트에서 최적화된다.
  • 지식 기반 관계는 기호적 관계가 아닌 텍스트 표면 형태(예: '태어난 곳')로 표현되어 표준 NLP 모델과 함께 종단간 훈련이 가능해진다.
  • 다양한 소스에서 온 텍스트는 혼합되어 독자 모델에 동시에 처리되어 이질적인 데이터 유형 간 통합 추론이 가능해진다.

실험 결과

연구 질문

  • RQ1통합된 텍스트 기반 검색기-읽기 프레임워크는 개방형 QA에서 구조화된, 비구조화된, 반구조화된 지식 소스를 효과적으로 처리할 수 있는가?
  • RQ2구조화된 지식을 텍스트로 평탄화하는 것이 전문화된 그래프 기반 방법에 비해 KBQA 벤치마크 성능 향상에 기여하는가?
  • RQ3표, 목록, 지식 기반의 통합은 표준 개방형 QA 벤치마크에서 검색 및 독서 성능에 어떤 영향을 미치는가?
  • RQ4최대 성능 향상을 위해 맥락에 포함할 지식 기반 텍스트의 최적 비율은 얼마인가?
  • RQ5다중 모듈 또는 다중 아키텍처 시스템보다 단일 동질 모델이 다중 소스 QA에서 더 뛰어난 성능을 낼 수 있는가?

주요 결과

  • UniK-QA는 이전 최신 기준 방법에 비해 NaturalQuestions 벤치마크에서 3.5 EM 향상을 달성했다.
  • WebQuestions 벤치마크에서는 2.6 EM 포인트 향상되어 새로운 SOTA 결과를 수립했다.
  • WebQSP 데이터셋에서 지식 기반 질문 응답(KBQA) 성능은 정확도 측정 기준으로 11% 향상되어 이전의 그래프 기반 방법을 뛰어넘었다.
  • 모델은 지식 기반 관계를 텍스트로 선형화함으로써 조밀한 검색기 및 독자 모델의 효과적인 활용이 가능함을 입증했으며, 이는 구조화된 질의에 대해서도 성능 향상을 이끌어냈다.
  • 최적의 지식 기반 텍스트 비율은 다양한 데이터셋과 지식 기반 소스 간에 상대적으로 안정적이며, WebQuestions는 지식 기반 통합에서 가장 큰 이점을 보였다(맥락 텍스트의 최대 40%가 지식 기반에서 온 것으로 유의미한 성능 향상 기여).
  • 통합 프레임워크는 위키피디아 텍스트, 표, 목록, 두 개의 지식 기반(Freebase 및 Wikidata)을 하나의 확장 가능한 QA 시스템으로 통합했으며, 스키마에 특화된 수정 없이도 성공적으로 작동했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.