[논문 리뷰] Efficient Inference and Learning in a Large Knowledge Base: Reasoning with Extracted Information using a Locally Groundable First-Order Probabilistic Logic
이 논문은 지역적으로 기반화 가능한, 개인화된 PageRank 기반의 증명 절차를 사용하여 대규모 지식 기반에서 효율적인 추론과 학습을 가능하게 하는 일阶 확률적 논리인 ProPPR를 소개한다. 짧은 유도 과정에 대한 편향을 두고 근사적인 PageRank 계산을 활용함으로써 ProPPR는 데이터베이스 크기와 무관한 시간 복잡도를 달성하며, 기존의 마르코프 논리 네트워크에 비해 수개의 주기적 속도 향상을 보이며, 수백만 개의 상호의존적인 술어를 포함한 100만 개의 실체에까지 확장 가능하다.
One important challenge for probabilistic logics is reasoning with very large knowledge bases (KBs) of imperfect information, such as those produced by modern web-scale information extraction systems. One scalability problem shared by many probabilistic logics is that answering queries involves "grounding" the query---i.e., mapping it to a propositional representation---and the size of a "grounding" grows with database size. To address this bottleneck, we present a first-order probabilistic language called ProPPR in which that approximate "local groundings" can be constructed in time independent of database size. Technically, ProPPR is an extension to stochastic logic programs (SLPs) that is biased towards short derivations; it is also closely related to an earlier relational learning algorithm called the path ranking algorithm (PRA). We show that the problem of constructing proofs for this logic is related to computation of personalized PageRank (PPR) on a linearized version of the proof space, and using on this connection, we develop a proveably-correct approximate grounding scheme, based on the PageRank-Nibble algorithm. Building on this, we develop a fast and easily-parallelized weight-learning algorithm for ProPPR. In experiments, we show that learning for ProPPR is orders magnitude faster than learning for Markov logic networks; that allowing mutual recursion (joint learning) in KB inference leads to improvements in performance; and that ProPPR can learn weights for a mutually recursive program with hundreds of clauses, which define scores of interrelated predicates, over a KB containing one million entities.
연구 동기 및 목표
- 확률적 일阶 논리에서 데이터베이스 크기에 비례하여 기반화가 증가하고 대규모 지식 기반에서의 추론을 제한하는 확장성 문제를 해결하기 위해.
- 소음이 있는 추출된 사실을 포함한 웹 스케일 지식 기반에서 효율적이고 근사적인 추론과 학습을 지원하는 일阶 확률적 논리를 개발하기 위해.
- 각 학습 예제별로 국소적으로 기반화된 부분 문제로 분할함으로써 학습 과정을 분리함으로써 빠르고 병렬 처리 가능한 가중치 학습을 가능하게 하기 위해.
- 개인화된 PageRank와 국소적 분할을 사용한 근사 기반화의 이론적 기반을 구축하여 정확성과 오차의 경계를 보장하기 위해.
제안 방법
- 기반화가 지역적으로 가능하도록 하기 위해 짧은 유도 과정에 대한 편향을 두는 재시작 메커니즘을 도입한 스트로스틱 논리 프로그램(SLPs)의 확장.
- 선형화된 증명 공간에서 개인화된 PageRank(PPR) 계산으로 증명 검색을 모델링함으로써 효율적인 근사 추론을 가능하게 한다.
- PageRank-Nibble 알고리즘을 사용하여 O(1/(αε)) 시간 내에 국소적 기반화를 수행하며, 이는 데이터베이스 크기와 무관하다. 여기서 α는 재시작 확률이고, ε은 오차 허용 범위이다.
- 학습을 각 질의별로 분할함으로써 쉽게 병렬 처리가 가능하고 효율적인 최적화를 가능하게 하는 기반 가중치 학습 알고리즘을 개발한다.
- 각 질의에 대해 관련된 부분 그래프를 고립시키기 위해 국소적 분할 기법(Andersen 등, 2006, 2008)을 활용하여 계산 비용을 감소시킨다.
- 기반화 과정을 파rameter 학습과 통합함으로써 확장성을 유지하면서도 모델 가중치의 반복적 개선을 가능하게 한다.
실험 결과
연구 질문
- RQ1완전한 기반화 없이도 대규모 지식 기반에서 효율적인 추론과 학습을 지원할 수 있는 일阶 확률적 논리를 설계할 수 있는가?
- RQ2국소적이고 PageRank 기반의 증명 절차를 사용하여 증명 가능한 정확도를 보장하는 근사 추론을 달성할 수 있는가?
- RQ3국소적 기반화를 통해 가중치 학습을 독립적이고 병렬 처리 가능한 부분 문제로 분해할 수 있는가? 이는 확장 가능한 최적화를 가능하게 하는가?
- RQ4기존의 마르코프 논리 네트워크와 비교할 때 ProPPR의 성능은 대규모 지식 기반에서 속도와 정확도 측면에서 어떻게 다른가?
- RQ5서로 상호적으로 재귀적인 술어를 함께 학습할 경우, 각각을 별도로 학습하는 것보다 성능이 향상되는가?
주요 결과
- ProPPR는 데이터베이스 크기와 무관하게 O(1/(αε)) 시간 복잡도로 추론과 학습을 수행하며, 이는 대규모 지식 기반에서의 확장 가능한 추론을 가능하게 한다.
- ProPPR의 학습은 마르코프 논리 네트워크에 비해 수개의 주기적 속도 향상을 보이며, 실험에서 10배의 속도 향상이 관찰되었다.
- ProPPR는 데스크톱 컴퓨터에서 100만 개의 실체를 포함한 지식 기반에서 수백 개의 절을 가진 상호 재귀적 프로그램의 가중치를 몇 초 만에 성공적으로 학습하였다.
- 서로 연관된 술어에 대해 공동의 추론과 학습을 수행할 경우, 각 술어를 별도로 학습하는 것보다 성능 향상이 이루어졌다.
- 국소적으로 기반화된 추론 체계는 효과적인 병렬 처리를 가능하게 하였으며, 멀티스레딩을 통해 학습에서 추가로 주기적 속도 향상이 이루어졌다.
- 이 방법은 실체 식별 및 분류 작업에서 뛰어난 성능을 보였으며, 모든 중간 증명 단계에서 근사 오차가 ε 이내로 제한되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.