Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Knowledge: Creation and Curation of Comprehensive Knowledge Bases

Gerhard Weikum, Xin Dong|arXiv (Cornell University)|2020. 09. 24.
Data Quality and Management참고 문헌 604인용 수 115
한 줄 요약

대규모 지식 기반(KB)을 자동으로 구축하고 큐레이션하는 방법에 대한 포괄적 고찰로, 엔티티 발견, 정규화, 속성 및 관계 추출, 오픈 스키마, 장기 KB 유지 관리 및 주요 KB 사례 연구를 다룹니다.

ABSTRACT

Equipping machines with comprehensive knowledge of the world's entities and their relationships has been a long-standing goal of AI. Over the last decade, large-scale knowledge bases, also known as knowledge graphs, have been automatically constructed from web contents and text sources, and have become a key asset for search engines. This machine knowledge can be harnessed to semantically interpret textual phrases in news, social media and web tables, and contributes to question answering, natural language processing and data analytics. This article surveys fundamental concepts and practical methods for creating and curating large knowledge bases. It covers models and methods for discovering and canonicalizing entities and their semantic types and organizing them into clean taxonomies. On top of this, the article discusses the automatic extraction of entity-centric properties. To support the long-term life-cycle and the quality assurance of machine knowledge, the article presents methods for constructing open schemas and for knowledge curation. Case studies on academic projects and industrial knowledge graphs complement the survey of concepts and methods.

연구 동기 및 목표

  • AI 애플리케이션을 위한 포괄적 세계 지식으로 기계에 장착하는 목표를 고취한다.
  • 엔티티 중심 KB와 그 수명 주기에 대한 기초 개념과 아키텍처 설계를 조사한다.
  • 발견, 정규화, 보강, 오픈 스키마 진화 및 큐레이션 등 KB 생성의 핵심 작업을 제시한다.
  • 반구조화 및 비구조화 소스를 활용한 실용적 방법과 설계 의사결정을 강조한다.
  • 원칙과 도전을 설명하기 위한 저명한 KB 프로젝트의 사례 연구를 제공한다.

제안 방법

  • 엔티티, 클래스, 속성 및 고차 관계에 대한 지식 표현의 기초를 설명한다.
  • 입력 소스, 품질 및 출력 범위를 포함하여 KB 구축의 설계 공간을 개략한다.
  • 다양한 소스에서의 엔티티 발견과 계통 구축 방법을 상세히 설명한다.
  • 엔티티 연결 및 매칭을 포함한 엔티티 정규화를 설명한다.
  • 텍스트 및 반구조화 데이터에서 속성과 관계를 추출하는 기법을 제시한다.
  • 오픈 스키마 구축과 장기 KB 큐레이션 및 품질 보증에 대해 논의한다.

실험 결과

연구 질문

  • RQ1대규모 엔티티 중심 지식 기반의 필수 구성요소와 아키텍처는 무엇인가?
  • RQ2반구조화 및 비구조화 소스에서 엔티티, 유형 및 관계를 어떻게 신뢰성 있게 발견, 정규화 및 보강할 수 있는가?
  • RQ3KB의 장기 유지 관리와 품질을 지원하는 오픈 스키마 및 큐레이션 전략은 무엇인가?
  • RQ4유명한 KB 사례 연구(예: Wikidata, DBpedia, YAGO, OpenK...)에서 얻을 수 있는 교훈은 무엇이며, 실용적 KB 구축과 거버넌스에 어떻게 적용될 수 있는가?

주요 결과

  • 본 연구는 포괄적인 KB 구축에 필수적인 발견, 정규화, 보강 기술의 스펙트럼을 종합한다.
  • 고정된 경직된 스키마가 아니라 오픈 월드, 필요에 따라 확장되는 KB 스키마의 성장을 강조한다.
  • 품질 지표, 완전성, 출처 및 수명 주기 관리 등을 KB 유지 관리의 핵심으로 논의한다.
  • 사례 연구는 주요 KB 프로젝트가 원칙을 실제로 어떻게 구현하고 응용에 어떤 영향을 미치는지 보여준다.
  • 본 고서는 KB 구축을 시맨틱 검색, 질의응답, NLP, 데이터 분석 등 응용에 연결하고 도메인 간의 관련성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.