Skip to main content
QUICK REVIEW

[논문 리뷰] Complex Query Answering with Neural Link Predictors

Erik Arakelyan, Daniel Daza|arXiv (Cornell University)|2020. 11. 06.
Advanced Graph Neural Networks참고 문헌 37인용 수 14
한 줄 요약

이 논문은 복잡한 일阶 논리 쿼리에 대해 완전하지 않은 지식 그래프에서 작동하는 복잡한 쿼리 분해(CQD) 프레임워크를 제안한다. 이 프레임워크는 쿼리를 미분 가능한 하위 쿼리로 분해하고, 사전에 훈련된 신경 링크 예측기로 점수를 매기는 방식으로 작동한다. 이는 이전 방법들보다 수개의 훈련 데이터로도 최신 기술 수준의 정확도를 달성하면서도 중간 변수 할당을 통해 모델의 해석 가능성을 보장한다.

ABSTRACT

Neural link predictors are immensely useful for identifying missing edges in large scale Knowledge Graphs. However, it is still not clear how to use these models for answering more complex queries that arise in a number of domains, such as queries using logical conjunctions ($\land$), disjunctions ($\lor$) and existential quantifiers ($\exists$), while accounting for missing edges. In this work, we propose a framework for efficiently answering complex queries on incomplete Knowledge Graphs. We translate each query into an end-to-end differentiable objective, where the truth value of each atom is computed by a pre-trained neural link predictor. We then analyse two solutions to the optimisation problem, including gradient-based and combinatorial search. In our experiments, the proposed approach produces more accurate results than state-of-the-art methods -- black-box neural models trained on millions of generated queries -- without the need of training on a large and diverse set of complex queries. Using orders of magnitude less training data, we obtain relative improvements ranging from 8% up to 40% in Hits@3 across different knowledge graphs containing factual information. Finally, we demonstrate that it is possible to explain the outcome of our model in terms of the intermediate solutions identified for each of the complex query atoms. All our source code and datasets are available online, at https://github.com/uclnlp/cqd.

연구 동기 및 목표

  • 결합, 선택, 존재 기술자 등을 포함한 복잡한 논리 쿼리를 처리하는 데 어려움을 겪는 완전하지 않은 지식 그래프에서 누락된 사실로 인해 기존의 하위그래프 매칭 기법이 실패하는 문제를 해결하기 위해.
  • 복잡한 쿼리에 대해 대규모이고 다양한 훈련 데이터를 요구하지 않고도 단순한 1호프 링크 예측에서 복잡한 쿼리로 일반화할 수 있는 프레임워크를 개발하기 위해.
  • 중간 변수 할당과 하위 쿼리 점수를 노출시켜 복잡한 쿼리 답변의 해석 가능성을 보장하기 위해.
  • 완전한 지식 그래프 보정의 비가역적 복잡성이나 블랙박스 신경 쿼리 인코더를 피하면서도 높은 정확도를 달성하기 위해.

제안 방법

  • 각 복잡한 쿼리는 각 원자 하위 쿼리가 사전에 훈련된 신경 링크 예측기로 점수를 매기는, 엔드 투 엔드로 미분 가능한 목적 함수로 변환된다.
  • 쿼리 원자의 진리값은 ComplEx나 DistMult와 같은 미분 가능한 링크 예측 모델을 사용하여 계산되며, 사실이 참일 가능성을 추정한다.
  • 이 프레임워크는 기울기 기반 최적화와 조합적 빔 서치(CQD-Beam)를 사용한 두 가지 최적화 전략을 적용하여 높은 점수를 받는 변수 할당을 식별한다.
  • 논리적 결합을 미분 가능한 방식으로 모델링하기 위해 t-노름(예: 곱셈 t-노름)을 사용하여 다중 원자에 대한 점수를 집계한다.
  • 이 방법은 쿼리에 종속적이지 않으며, 새로운 쿼리 유형에 대해 재훈련이 필요 없어, 훈련 중에 볼 수 없었던 복잡한 쿼리 구조로도 제로샷 일반화가 가능하다.
  • 중간 변수 할당이 유지되어 최종 답변을 설명하는 데 사용되며, 투명성과 실패 모드 분석을 가능하게 한다.

실험 결과

연구 질문

  • RQ11호프 쿼리에서만 훈련된 신경 링크 예측기로 완전하지 않은 지식 그래프에서 복잡한 다단계 논리 쿼리를 효과적으로 해결할 수 있는가?
  • RQ2해석 가능성을 유지하면서도 높은 정확도를 달성하기 위해 복잡한 쿼리를 어떻게 미분 가능한 최적화 문제로 공식화할 수 있는가?
  • RQ3수백만 개의 복잡한 쿼리 예제를 훈련에 사용하지 않고도 최신 기술 수준의 블랙박스 신경 쿼리 인코더를 능가할 수 있는가?
  • RQ4쿼리 분해 과정에서의 중간 변수 할당이 예측 결과를 설명하고 디버깅하는 데 얼마나 유용한가?
  • RQ5훈련 중에 볼 수 없었던 분포 외의 쿼리 구조로도 이 프레임워크가 일반화되는가?

주요 결과

  • CQD 프레임워크는 여러 지식 그래프에서 Hits@3에서 8%에서 40%까지 상대적 향상을 달성하여 Query2Box와 GQE와 같은 최신 기술 수준의 모델을 능가한다.
  • 이 방법은 수백만 개의 합성 복잡 쿼리로 훈련된 모델보다도 더 높은 정확도를 달성하면서도 훈련 데이터의 수개의 주머니로 수렴한다.
  • CQD-Beam은 복잡한 쿼리에서 정답을 상위 3개 랭크 내에 올리며, 중간 변수 할당이 영화나 국적과 같은 관련 엔티티를 올바르게 식별한다.
  • 이 프레임워크는 완전한 해석 가능성을 제공한다: 중간 점수와 변수 할당을 점검하여 각 답변이 어떻게 유도되었는지 추적할 수 있으며, 최종 답변은 정확하지만 잘못된 추론에 기반한 경우에도 이를 확인할 수 있다.
  • 정답이지만 중간 할당이 잘못된 경우(예: 토마스 아퀴나스의 국적을 잘못 할당한 경우)에는 이러한 실패 모드를 드러내며, 이는 블랙박스 모델에서는 불가능한 일이다.
  • ComplEx를 링크 예측기로 사용할 경우 DistMult보다 더 높은 성능을 보이며, 모든 평가 벤치마크에서 GQE와 Query2Box를 모두 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.