Skip to main content
QUICK REVIEW

[논문 리뷰] Incremental Knowledge Base Construction Using DeepDive

Jaeho Shin, Sen Wu|arXiv (Cornell University)|2015. 02. 03.
Geochemistry and Geologic Mapping인용 수 15
한 줄 요약

이 논문은 지식 기반 구축(KBC)을 가속화하기 위해 점진적 기반 설정과 추론을 가능하게 하는 오픈소스 시스템인 DeepDive를 제시한다. 샘플링과 변분 추론이라는 두 가지 근사 추론 기법을 도입하고 규칙 기반 최적화기와 결합하여, 품질 손실를 최소화하면서도 KBC 파이프라인에서 최대 100배의 속도 향상을 달성하며 지식 기반 시스템의 반복적 개발 주기를 크게 단축시킨다.

ABSTRACT

Populating a database with unstructured information is a long-standing problem in industry and research that encompasses problems of extraction, cleaning, and integration. Recent names used for this problem include dealing with dark data and knowledge base construction (KBC). In this work, we describe DeepDive, a system that combines database and machine learning ideas to help develop KBC systems, and we present techniques to make the KBC process more efficient. We observe that the KBC process is iterative, and we develop techniques to incrementally produce inference results for KBC systems. We propose two methods for incremental inference, based respectively on sampling and variational techniques. We also study the tradeoff space of these methods and develop a simple rule-based optimizer. DeepDive includes all of these contributions, and we evaluate DeepDive on five KBC systems, showing that it can speed up KBC inference tasks by up to two orders of magnitude with negligible impact on quality.

연구 동기 및 목표

  • 지식 기반 구축(KBC) 시스템의 반복적 개발 주기를 가속화하기 위해, 이는 일반적으로 느리고 노동 집약적인 작업이다.
  • KBC에서 통계적 추론의 계산 병목 현상을 해결하기 위해, 데이터 또는 프로그램 변경 후 요인 그래프에 대한 점진적 업데이트를 가능하게 한다.
  • 작업 특성에 따라 샘플링과 변분 추론 사이의 트레이드오프를 고려한 추론 시스템을 설계한다.
  • 다양한 도메인에서 실세계 KBC 응용 프로그램에 대해 점진적 추론의 성능 및 품질 트레이드오프를 평가한다.
  • 공학자들이 고품질 지식 기반을 구축하는 데에 적합한 확장성 있고 프로덕션 수준의 시스템을 제공한다.

제안 방법

  • DeepDive는 SQL과 마르코프 논리 네트워크를 기반으로 한 선언적 언어를 사용하여 KBC 파이프라인을 정의함으로써 데이터베이스 기술과 기계 학습 기법의 통합을 가능하게 한다.
  • 입력 데이터 또는 규칙 업데이트에 반응하여 요인 그래프 출력이 어떻게 변화하는지 기술하는 '델타 규칙'을 정의함으로써 기반 설정을 점진적으로 구현한다. 이는 중복 계산을 줄인다.
  • 추론을 위해 DeepDive는 두 가지 근사 추론 방법을 구현한다: 적응형 수락률을 가진 지브스 샘플링과 평균 필드 근사법을 사용한 변분 추론.
  • 규칙 기반 최적화기는 작업 특성(예: 분포 안정성, 요인 그래프 크기 등)에 따라 변수 그룹별로 샘플링과 변분 추론 사이에서 최적의 방법을 선택한다.
  • 모든 추출된 사실에 대해 校정된 마진 확률을 유지함으로써 예측된 확률이 실제 정확도를 반영하도록 보장한다(예: 0.9의 확률은 약 90%의 참 양성 결과를 의미한다).
  • 중간 추론 상태의 재료화는 비용 분산 회복을 가능하게 하여, 다수의 업데이트에 걸쳐 점진적 설정의 일회성 오버헤드가 가치가 있음을 보장한다.

실험 결과

연구 질문

  • RQ1데이터나 규칙 변경 후 재계산를 줄이기 위해 지식 기반 구축의 기반 설정 단계를 어떻게 점진적으로 만들 수 있는가?
  • RQ2점진적 KBC 시스템에서 샘플링 기반 추론과 변분 추론 간의 성능 및 품질 트레이드오프는 어떠한가?
  • RQ3작업 특성에 따라 동적으로 추론 기법을 선택하는 전략이 정확도를 희생시키지 않고 종합 성능을 향상시킬 수 있는가?
  • RQ4점진적 추론은 실세계 응용 프로그램에서 KBC 파이프라인의 총 실행 시간을 얼마나 줄일 수 있는가?
  • RQ5빠르고 점진적인 업데이트를 가능하게 하면서도, 시스템은 어떻게 校정된 확률을 유지할 수 있는가?

주요 결과

  • DeepDive는 다섯 개의 실세계 KBC 시스템에서 추론 실행 시간에 대해 최대 두 개의 지수(100배)의 속도 향상을 달성했으며, 정밀도와 재현율에 거의 영향을 주지 않았다.
  • 뉴스 시스템에서는 분포가 안정된 상태에서 샘플링 기반 접근이 수용률이 높고 재계산 오버헤드가 낮아 최대 11배의 속도 향상을 기록했다.
  • 팔레오파일로지 시스템에서는 변수당 요인 그래프가 작아 전체 추론이 더 저렴하고 점진적 업데이트에 더 적합해 10배의 속도 향상을 달성했다.
  • 규칙 기반 최적화기는 작업 특성에 따라 변수 그룹별로 최적의 추론 방법을 동적으로 선택함으로써 고정 전략 기반 벤치마크 대비 최대 2배 빠른 실행 성능을 기록했다.
  • 점진적 설정을 위한 일회성 재료화 비용 12시간은 다수의 업데이트에 걸쳐 분산되어 반복적 개발에 매우 효율적인 것으로 확인되었다.
  • 손실 연구 결과, 샘플링 또는 변분 추론을 비활성화할 경우 성능이 크게 악화됨을 확인했다. 특히 감독 규칙에 대해 변분 추론을 비활성화했을 경우 최대 36배 느려지는 결과를 보였으며, 이는 이중 기법 트레이드오프 공간의 중요성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.