Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Graphs on the Web -- an Overview

Nicolas Heist, Sven Hertling|arXiv (Cornell University)|2020. 03. 02.
Advanced Graph Neural Networks참고 문헌 42인용 수 38
한 줄 요약

이 논문은 공개적으로 이용 가능한 교차 도메인 지식 그래프를 조사하고, 크기, 내용, 스키마, 그래프 간 교차 중복을 비교하여 설명 가능한 AI를 포함한 응용에 적합한 KG 선택을 안내합니다.

ABSTRACT

Knowledge Graphs are an emerging form of knowledge representation. While Google coined the term Knowledge Graph first and promoted it as a means to improve their search results, they are used in many applications today. In a knowledge graph, entities in the real world and/or a business domain (e.g., people, places, or events) are represented as nodes, which are connected by edges representing the relations between those entities. While companies such as Google, Microsoft, and Facebook have their own, non-public knowledge graphs, there is also a larger body of publicly available knowledge graphs, such as DBpedia or Wikidata. In this chapter, we provide an overview and comparison of those publicly available knowledge graphs, and give insights into their contents, size, coverage, and overlap.

연구 동기 및 목표

  • 지식 그래프를 다양한 데이터 통합을 위한 다목적 지식 표현으로 활용하도록 동기를 부여한다.
  • 공개적으로 이용 가능한 교차 도메인 지식 그래프(예: DBpedia, Wikidata, YAGO, BabelNet, NELL, CaLiGraph, Voldemort)를 개관한다.
  • 내용물, 크기, 스키마 복잡성, 중복을 특징화하여 응용에 특화된 KG 선정을 돕는다.
  • 생성 기법(수작업, 구조화 데이터, 비구조화 데이터) 및 커버리지와 품질에 대한 시사점을 논의한다.

제안 방법

  • 생성 방법을 수작업 큐레이션, (반)구조화 데이터 추출, 비구조화 데이터 추출로 분류한다.
  • 대표 파이프라인을 설명한다: 위키피디아 인포박스의 온톨로지 매핑(DBpedia), 분류/워드넷 기반 타이핑(YAGO), 다국어 통합(Wikidata, BabelNet), 웹 데이터에서의 추출(CaLiGraph, VoldemortKG).
  • KG 평가를 위한 일반 메트릭을 요약한다(인스턴스, 주장, 연결 정도, 클래스, 관계, 온톨로지 깊이/너비, 복잡성).
  • DBpedia, YAGO, Wikidata, BabelNet, NELL, CaLiGraph, Voldemort, Cyc 등의 공개 KG를 이용한 크기, 상세 정보, 스키마 복잡성의 교차 비교를 제시한다.
  • 힙사이트(link discovery) 및 재현율/정확도 기반 추정치를 사용하여 KG 간 상호 연결 및 중복 추정치를 설명한다.

실험 결과

연구 질문

  • RQ1웹에서 가장 많이 공개된 교차 도메인 지식 그래프는 무엇이며 크기, 내용, 스키마에서 어떻게 차이가 나는가?
  • RQ2생성 방법(수작업, 구조화, 비구조화)이 이러한 지식 그래프의 커버리지와 품질에 어떤 영향을 미치는가?
  • RQ3주요 지식 그래프 간의 중복성과 상호 연결성은 어떠하며, 이를 결합하면 커버리지가 어떻게 개선될 수 있는가?
  • RQ4인스턴스 수준 및 스키마 수준의 메트릭이 특정 애플리케이션(XAI 등)에 맞는 KG 선택에 어떻게 정보를 제공하는가?

주요 결과

  • 지식 그래프의 크기와 주장 수는 수만에서 수천만 인스턴스까지, 주장 수는 수십만에서 수억까지 천 차이가 난다.
  • 스키마는 깊이와 복잡성에서 차이가 나며, DBpedia/NELL은 더 작고 간단한 스키마를 가지는 반면 Wikidata/BabelNet은 더 깊고 상세한 계층을 보이며, Cyc는 형식적 온톨로지로 인해 가장 높은 복잡성을 보인다.
  • Wikidata는 많은 클래스에서 일반적으로 가장 많은 인스턴스를 보유하는 반면, YAGO는 종종 가장 상세하고(상당히 연결된) 클래스 수준 정보를 제공한다.
  • KG 간의 상호 연결은 흔하고 Wikidata, DBpedia, YAGO, CaLiGraph 사이에서 대체로 완전하지만, NELL, OpenCyc, Voldemort에서는 약한 편이어서 다중 그래프 통합은 상호 연결 노력이 필요하다는 것을 시사한다.
  • KG를 결합하면 커버리지 측면에서 상당한 이점을 얻을 수 있는데, 특히 BabelNet과 CaLiGraph 같은 보완 소스가 DBpedia와 결합될 때 그렇고, 중복성은 클래스와 소스에 따라 달라진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.