[논문 리뷰] Enriching Linked Datasets with New Object Properties
DART는 웹 텍스트 패턴에서 문맥적 유사성과 동의어 탐지 기반으로 두 개의 주어진 LOD 클래스 간에 새로운 객체 속성을 자동으로 탐지하는 비지도 학습 프레임워크이다. DART는 기존의 newOntExt와 같은 시스템에 비해 정확성과 발견 관계의 수에서 모두 뛰어나며, 기존 LOD 속성에 대한 자동 기반 설정을 통해 관련이 없는 관계를 제거하고 T-Box 강화를 위한 후보 속성 공리 생성에 성공한다.
Although several RDF knowledge bases are available through the LOD initiative, the ontology schema of such linked datasets is not very rich. In particular, they lack object properties. The problem of finding new object properties (and their instances) between any two given classes has not been investigated in detail in the context of Linked Data. In this paper, we present DART (Detecting Arbitrary Relations for enriching T-Boxes of Linked Data) - an unsupervised solution to enrich the LOD cloud with new object properties between two given classes. DART exploits contextual similarity to identify text patterns from the web corpus that can potentially represent relations between individuals. These text patterns are then clustered by means of paraphrase detection to capture the object properties between the two given LOD classes. DART also performs fully automated mapping of the discovered relations to the properties in the linked dataset. This serves many purposes such as identification of completely new relations, elimination of irrelevant relations, and generation of prospective property axioms. We have empirically evaluated our approach on several pairs of classes and found that the system can indeed be used for enriching the linked datasets with new object properties and their instances. We compared DART with newOntExt system which is an offshoot of the NELL (Never-Ending Language Learning) effort. Our experiments reveal that DART gives better results than newOntExt with respect to both the correctness, as well as the number of relations.
연구 동기 및 목표
- LOD 데이터셋에서 객체 속성이 부족하여 의미적 표현력과 추론 능력이 제한되는 문제를 해결하기 위해.
- 두 개의 주어진 LOD 클래스 간에 새로운 의미 있는 객체 속성을 자동으로 탐지하는 비지도 학습 방법을 개발하기 위해.
- 발견된 관계를 기존 LOD 속성에 자동으로 기반 설정하여 관련이 없거나 의미적으로 불일치하는 관계를 제거하기 위해.
- T-Box 강화를 위한 후보 속성 공리(예: 하위 속성, 동치 속성, 역속성)를 생성하기 위해.
- 기존 시스템인 newOntExt에 비해 발견 관계의 정밀도와 재현율 모두에서 뛰어나기 위해.
제안 방법
- DART는 두 개의 주어진 LOD 클래스의 개체를 연결하는 웹 코퍼스에서 텍스트 패턴을 추출한다.
- 문맥적 유사성과 동의어 탐지를 적용하여 의미적으로 유사한 패턴을 클러스터링하여 잠재적 객체 속성으로 간주한다.
- 기존 LOD 속성의 도메인 및 레인지 유형 호환성 검사를 통해 자동 기반 설정을 수행한다.
- 기반 설정된 관계는 의미적 관련성 여부를 검증하며, 관련 없는 관계(예: 종교와 국가 사이의 '부모이다')는 기각된다.
- 시스템은 하위 속성, 동치 속성, 역속성 관계를 포함한 후보 속성 공리를 생성한다.
- 수동 주석 또는 외부 지식 없이도 완전 자동화된 탐지 및 매핑을 지원한다.
실험 결과
연구 질문
- RQ1비지도 방법이 두 개의 주어진 LOD 클래스 간에 새로운 객체 속성을 효과적으로 탐지할 수 있는가?
- RQ2문맥적 유사성과 동의어 탐지를 어떻게 조합하여 관계 클러스터링 정확도를 향상시킬 수 있는가?
- RQ3자동 기반 설정이 의미적으로 잘못되거나 불일치하는 관계를 얼마나 효과적으로 제거할 수 있는가?
- RQ4DART는 newOntExt와 같은 기존 시스템에 비해 발견 관계의 정확성과 수량 측면에서 어떻게 비교되는가?
- RQ5DART는 T-Box 강화를 위한 유효한 후보 속성 공리(예: 하위 속성, 역속성)를 생성할 수 있는가?
주요 결과
- Rulers-Empires 쌍에서 DART는 정확도 0.833를 달성하여 정확성과 관계 수 모두에서 newOntExt를 뛰어넘었다.
- Religions-Countries 쌍에서는 25개의 정확한 관계를 식별하여 50%의 정확도를 기록했으며, 다양한 클래스 쌍에 대한 강건성을 입증했다.
- 기반 설정 단계는 종교와 국가 사이의 '부모이다'와 같은 의미적으로 불일치하는 관계를 기각함으로써 성능 향상에 기여했다.
- 작가와 소설 간에 DART는 15개의 의미 있는 관계를 탐지했으며, 정확도는 52%로 도메인 특화 관계 추출의 효과성을 보였다.
- 음악 장르-음악 장르 쌍에서는 69%의 정확도를 기록했고, '하위 장르이다' 관계가 기존 속성에 매핑된 9개의 기반 설정 관계를 생성했다.
- 특히 '연주하지 않는다'와 '연주하고 싶다'와 같은 의미적으로 구분되는 관계를 정확히 식별하는 데서 DART는 관계 수와 정확성 측면에서 newOntExt를 뛰어넘었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.