[논문 리뷰] A New Similarity Measure for Taxonomy Based on Edge Counting
이 논문은 우와 팔머의 엣지 카운팅 방법을 개선하기 위해 개념 간 최단 경로와 전체 계층도 깊이를 통합함으로써, 계층도 내에서 가까운 개념이 같은 분지에 있는 개념보다 더 높은 유사도 점수를 받는 모순을 수정하기 위한 벌점 인자를 도입한 새로운 계층도 기반의 유사도 측정 방법을 제안한다. 그 결과, 정보 검색, 온톨로지 매칭, 텍스트 마이닝 등의 응용 분야에서 더 의미적으로 정확하고 강건한 유사도 측정 방법이 도출된다.
This paper introduces a new similarity measure based on edge counting in a taxonomy like WorldNet or Ontology. Measurement of similarity between text segments or concepts is very useful for many applications like information retrieval, ontology matching, text mining, and question answering and so on. Several measures have been developed for measuring similarity between two concepts: out of these we see that the measure given by Wu and Palmer [1] is simple, and gives good performance. Our measure is based on their measure but strengthens it. Wu and Palmer [1] measure has a disadvantage that it does not consider how far the concepts are semantically. In our measure we include the shortest path between the concepts and the depth of whole taxonomy together with the distances used in Wu and Palmer [1]. Also the measure has following disadvantage i.e. in some situations, the similarity of two elements of an IS-A ontology contained in the neighborhood exceeds the similarity value of two elements contained in the same hierarchy. Our measure introduces a penalization factor for this case based upon shortest length between the concepts and depth of whole taxonomy.
연구 동기 및 목표
- 개념 간 의미적 거리가 반영되지 않는 우와 팔머의 유사도 측정 방법의 한계를 해결한다.
- 동일한 계층에서의 개념이 이웃 분지의 개념보다 낮은 유사도 점수를 받는 비직관적인 결과를 수정한다.
- 최단 경로와 전체 계층도의 깊이를 모두 통합한 유사도 측정 방법을 개발한다.
- IS-A 온톨로지에서 진정한 의미적 관련성을 반영하기 위해 유사도 점수에 벌점 인자를 도입한다.
- 정보 검색, 온톨로지 매칭, 질문 응답 등의 응용 분야에서 개념 유사도 평가를 향상시켜 성능을 향상시킨다.
제안 방법
- 우와 팔머의 엣지 카운팅 접근법을 확장하여 계층도 내 두 개념 간 최단 경로 길이를 통합한다.
- 다양한 계층 수준 간 일관성을 향상시키기 위해 전체 계층도의 깊이를 정규화 요소로 통합한다.
- 최단 경로 거리와 계층도 깊이를 조합하여 유사도 점수의 편향을 줄이기 위한 새로운 유사도 공식을 정의한다.
- 개념의 상대적 위치와 루트로부터의 거리에 기반한 벌점 인자를 도입하여 오해의 소지가 있는 유사도 순위를 수정한다.
- 두 개념이 계층도에서 수렴하는 지점을 결정하기 위해 최저 공통 조상(LCS) 개념을 사용한다.
- LCS의 깊이와 전체 계층도 깊이를 고려한 함수를 사용하여 유사도 점수를 정규화한다.
실험 결과
연구 질문
- RQ1IS-A 계층도에서 개념 유사도 측정의 의미 정확도를 어떻게 향상시킬 수 있는가?
- RQ2왜 우와 팔머의 측정 방법은 동일한 계층 내 개념과 이웃 분지의 개념을 비교할 때 일관성 없는 결과를 낳는가?
- RQ3최단 경로와 전체 계층도 깊이를 통합하면 유사도 점수의 일관성이 향상되는가?
- RQ4유사도 점수에 대해 유사도가 높지만 위치가 다른 개념들에 대해 벌점 인자가 어떤 영향을 미치는가?
- RQ5기존 방법과 비교할 때 제안된 측정 방법은 강건성과 의미 정확성 측면에서 어떻게 다른가?
주요 결과
- 제안된 유사도 측정 방법은 동일한 계층 내 개념이 이웃 분지의 개념보다 낮은 유사도 점수를 받는 문제를 해결한다.
- 최단 경로와 계층도 깊이를 통합함으로써, 더 일관되고 의미적으로 의미 있는 유사도 점수를 제공한다.
- 벌점 인자는 계층도에서 가까운 개념이지만 루트에서 멀리 떨어진 개념들에 대해 과도하게 유사도를 높이는 것을 효과적으로 줄인다.
- 유사도 값이 구조적 위치에만 기반하는 것이 아니라 진정한 개념적 관련성을 반영하기 위해, 이는 우와 팔머의 접근법을 개선한다.
- 온톨로지 매칭과 정보 검색과 같은 정확한 개념 유사도가 요구되는 응용 분야에서 신뢰성 향상이 입증된다.
- 이론적 분석을 통해 측정 방법이 대칭성과 다양한 계층도 깊이에서 적절한 정규화와 같은 바람직한 성질을 유지함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.