[논문 리뷰] Reasoning Over Virtual Knowledge Bases With Open Predicate Relations
이 논문은 구조화된 감독 없이 비구조화된 텍스트에서 가상 지식 기반(VKB)을 구성하기 위한 Open Predicate Query Language(OPQL)을 소개한다. 이는 엔티티-관계 쌍을 인코딩하기 위해 双-에코더 사전학습 방식을 사용한다. OPQL은 효과적인 다단계 추론을 가능하게 하며, 언어 모델에 통합되었을 때 개방 도메인 질의 응답에서 최신 기술 수준의 성능을 달성한다. 특히 복합 추론 작업에서 더 큰 모델들을 능가한다.
We present the Open Predicate Query Language (OPQL); a method for constructing a virtual KB (VKB) trained entirely from text. Large Knowledge Bases (KBs) are indispensable for a wide-range of industry applications such as question answering and recommendation. Typically, KBs encode world knowledge in a structured, readily accessible form derived from laborious human annotation efforts. Unfortunately, while they are extremely high precision, KBs are inevitably highly incomplete and automated methods for enriching them are far too inaccurate. Instead, OPQL constructs a VKB by encoding and indexing a set of relation mentions in a way that naturally enables reasoning and can be trained without any structured supervision. We demonstrate that OPQL outperforms prior VKB methods on two different KB reasoning tasks and, additionally, can be used as an external memory integrated into a language model (OPQL-LM) leading to improvements on two open-domain question answering tasks.
연구 동기 및 목표
- 기존의 가상 지식 기반(VKB)이 사전에 존재하는 구조화된 지식 기반에서 유도된 거리 감독에 의존하는 한계를 해결하기 위해.
- 라벨링된 관계나 구조화된 감독 없이도 비구조화된 텍스트 코퍼스에서 직접 가상 지식 기반을 구성하는 방법을 개발하기 위해.
- 텍스트에서 추출한 개방 어휘 관계에 대해 복합적이고 다단계 추론을 가능하게 하기 위해.
- 사전 학습된 언어 모델에 OPQL 메모리를 통합하여 추론 및 질의 응답 능력을 향상시키기 위해.
제안 방법
- OPQL는 주제 엔티티 임베딩과 관계 임베딩을 조합하여 키를 구성하고, 값으로는 대상 엔티티 임베딩을 사용하는 키-값 메모리 구조를 구축한다.
- 엔티티 연결 텍스트 코퍼스에서 사전학습된 이중 에코더 아키텍처를 사용하여 엔티티-관계 쌍의 조밀한 표현을 학습한다.
- 사전에 정의된 지식 기반 스키마에 의존하지 않고, 직접 텍스트에서 개방형 자연어 관계(예: '저자')를 인코딩하는 방법을 학습한다.
- 질의 임베딩을 기반으로 관련된 키-값 쌍을 검색하여, 여러 항목에 대해 미분 가능한 추론을 지원한다.
- 관계 인코더나 언어 모델을 재학습하지 않고도 피팅 테이밍 시간에 새로운 지식 항목을 메모리에 주입할 수 있다.
- OPQL는 외부 메모리로서 언어 모델(OPQL-LM)에 통합되어 검색 및 추론과 함께 엔드 투 엔드 학습이 가능하다.
실험 결과
연구 질문
- RQ1기존의 구조화된 지식 기반에서의 감독 없이도 텍스트에서 가상 지식 기반을 구성할 수 있는가?
- RQ2OPQL은 텍스트에서 추출한 개방 어휘 및 자연어 관계에 대해 효과적으로 다단계 추론을 지원할 수 있는가?
- RQ3표준 언어 모델과 비교했을 때, OPQL을 외부 메모리로 통합하면 개방 도메인 질의 응답 작업에서 성능 향상이 이루어지는가?
- RQ4특히 복합 추론 시나리오에서 훈련 중에 볼 수 없었던 관계에 대해 OPQL이 일반화할 수 있는가?
- RQ5OPQL-LM은 복잡한 추론 벤치마크에서 더 큰 파rameter를 가진 언어 모델들과 비교해 어떻게 성능을 내는가?
주요 결과
- OPQL는 더 적은 감독 조건에서도 이중 다단계 추론 작업에서 이전 최고 성능의 VKB 방법을 능가한다.
- OPQL-LM은 WebQSP에서 Hits@1 정확도 51.9%, ComplexWebQ에서 40.7%를 기록하여 여러 큰 언어 모델을 능가하고 후자의 경우 새로운 SOTA를 수립했다.
- OPQL 메모리에 추가 지식 쌍을 주입함으로써 커버리지가 54.6%에서 82.9%로 증가했고, WebQSP에서 전체 Hits@1 정확도는 51.9%에서 53.7%로 향상되었다.
- 제거 실험 결과, null 임베딩을 제거하면 성능이 크게 떨어지며, 이는 정확한 검색을 위해 중요하다는 것을 시사한다.
- 복합 추론 지원 기능을 갖춘 OPQL-LM은 ComplexWebQ 데이터셋에서 새로운 SOTA를 달성했으며, 훨씬 더 큰 텍스트-투-텍스트 모델들을 능가했다.
- 이 방법은 수백만 개의 항목까지 확장 가능하여 히우리스틱 삼중항 검색 메커니즘에 의존하지 않고도 효율적인 검색 및 추론을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.