Skip to main content
QUICK REVIEW

[논문 리뷰] Similarity-based Browsing over Linked Open Data

Michael W. Hickson, Yannis Kargakis|arXiv (Cornell University)|2011. 06. 21.
Semantic Web and Ontologies참고 문헌 27인용 수 4
한 줄 요약

이 논문은 정확도와 성능의 균형을 이루기 위해 깊이(반경)로 설정 가능한 확장된 이웃을 기반으로 한 가중 Jaccard 계수를 사용하여 연결된 개방형 데이터(Lod) 내 RDF 엔티티에 대한 유형 독립적이고 이웃 기반의 유사도 메트릭을 제안한다. 이 방법은 유사도 기반 브라우징을 효율적으로 가능하게 하여 분산된 LOD 환경에서 역방향 쿼리와 확장 가능한 상위-L 검색을 지원한다.

ABSTRACT

An increasing amount of data is published on the Web according to the Linked Open Data (LOD) principles. End users would like to browse these data in a flexible manner. In this paper we focus on similarity-based browsing and we introduce a novel method for computing the similarity between two entities of a given RDF/S graph. The distinctive characteristics of the proposed metric is that it is generic (it can be used to compare nodes of any kind), it takes into account the neighborhoods of the nodes, and it is configurable (with respect to the accuracy vs computational complexity tradeoff). We demonstrate the behavior of the metric using examples from an application over LOD. Finally, we generalize and elaborate on implementation approaches harmonized with the distributed nature of LOD which can be used for computing the most similar entities using neighborhood-based similarity metrics.

연구 동기 및 목표

  • 사용자가 SPARQL 쿼리를 작성할 필요 없이 연결된 개방형 데이터(Lod)를 민첩하고 사용자 친화적으로 브라우징할 수 있도록 지원한다.
  • 유사도 기반 탐색을 통해 의미적으로 풍부한 분산 RDF 데이터셋을 탐색하는 데 도전 과제를 해결한다.
  • 모든 종류의 RDF 자원(예: 영화, 배우, 감독 등)에 대해 적용 가능한 일반적인 유사도 메트릭을 개발한다.
  • 분산된 LOD 환경에서 가장 비슷한 엔티티를 확장 가능하고 효율적으로 계산할 수 있도록 지원한다.
  • 유사도 함수를 뒤집어 분산된 LOD 엔드포인트를 통해 국소화된 효율적인 쿼리 검색을 지원하는 방법을 제공한다.

제안 방법

  • 비교 대상 노드의 확장된 반경 제한 이웃(모든 인스턴스 및 스키마 노드 포함)에 대해 Jaccard 유사도 계수를 사용하여 두 RDF 노드 간의 유사도를 계산한다.
  • 유사도 계산에서 교집합 및 합집합 내 노드에 경로 거리에 따라 가중치를 할당하여 더 가까운 매칭을 우선시한다.
  • 이웃의 반경(깊이 k)을 구성 가능하게 하여 계산 복잡도와 정확도 사이의 균형을 조절할 수 있도록 한다.
  • 단일 지식 기반과 분산된 LOD 클라우드 모두에 적용 가능한 일반화된 유사도 함수를 설계한다.
  • 유사도 함수를 뒤집어, 유사도가 0이 아닌 엔티티만을 검색하는 쿼리를 생성함으로써 분산된 환경에서 효율적인 유사 엔티티 계산을 가능하게 한다.
  • L개의 유사한 엔티티를 찾을 때까지 반경을 점진적으로 증가시키는 상위-L 검색 알고리즘을 제안하며, 이는 근사 보장을 제공한다.

실험 결과

연구 질문

  • RQ1연결된 개방형 데이터(Lod) 내 RDF 엔티티에 대해 사용자 브라우징을 지원하는 일반적이고 유형에 독립적인 유사도 메트릭을 어떻게 설계할 수 있는가?
  • RQ2분산되고 탈중앙화된 LOD 환경에서 이웃 기반의 유사도를 어떻게 효율적으로 계산할 수 있는가?
  • RQ3전체 LOD 코퍼스를 스캔하지 않고도 상위-L개의 가장 유사한 엔티티를 확장 가능한 방식으로 검색할 수 있는 메커니즘은 무엇인가?
  • RQ4유사도 함수를 어떻게 뒤집어 분산된 LOD 엔드포인트를 통해 국소화되고 효율적인 쿼리 검색을 지원할 수 있는가?
  • RQ5이웃 기반의 유사도 계산에서 정확도와 계산 복잡도 사이의 상충 관계는 무엇인가?

주요 결과

  • 제안된 유사도 메트릭은 서로 다른 유형의 엔티티(예: 배우와 영화) 간에 의미 있는 유사도를 성공적으로 계산하여 의미적 데이터에서의 민첩한 브라우징을 가능하게 한다.
  • 노드를 경로 거리에 따라 가중치를 할당함으로써 유사도 계산에서 더 의미적으로 가까운 이웃을 우선시함으로써 매칭의 관련성을 향상시킨다.
  • 이 방법은 구성 가능한 깊이(반경 k)를 지원하여 사용자 또는 시스템이 정밀도와 계산 비용 사이에서 조율할 수 있다.
  • 유사도 함수를 뒤집어, 관련 없는 결과를 제외하는 타겟된 쿼리를 생성함으로써 분산된 환경에서 효율적인 유사 엔티티 계산을 가능하게 한다.
  • 상위-L 검색 알고리즘은 k > 1일 때 정확한 상위-L 결과를 보장하지는 않지만, 대규모 LOD 환경에서 실용적인 근사 전략을 제공한다.
  • 성능에 민감한 응용 프로그램을 위해 각 엔티티당 상위-L 유사 엔티티의 물리적 뷰(materialized views)를 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.