Skip to main content
QUICK REVIEW

[논문 리뷰] Calculating Semantic Similarity between Academic Articles using Topic Event and Ontology

Ming Liu, Bo Lang|arXiv (Cornell University)|2017. 11. 30.
Topic Modeling참고 문헌 29인용 수 8
한 줄 요약

이 논문은 학술 논문의 문서 수준 의미 유사도를 계산하기 위한 새로운 방법을 제안한다. 연구 내용을 '주제 이벤트'(연구 목적, 방법론, 분야를 통합한 표현)로 모델링하고, 도메인 온톨로지(ontology)를 활용하여 유사도를 계산한다. 이 방법은 표면 통계를 넘어서 전반적인 의미적 구조를 포착함으로써 최신 기법들을 능가한다.

ABSTRACT

Determining semantic similarity between academic documents is crucial to many tasks such as plagiarism detection, automatic technical survey and semantic search. Current studies mostly focus on semantic similarity between concepts, sentences and short text fragments. However, document-level semantic matching is still based on statistical information in surface level, neglecting article structures and global semantic meanings, which may cause the deviation in document understanding. In this paper, we focus on the document-level semantic similarity issue for academic literatures with a novel method. We represent academic articles with topic events that utilize multiple information profiles, such as research purposes, methodologies and domains to integrally describe the research work, and calculate the similarity between topic events based on the domain ontology to acquire the semantic similarity between articles. Experiments show that our approach achieves significant performance compared to state-of-the-art methods.

연구 동기 및 목표

  • 문서 수준 의미 유사도 계산에 있어 표면 통계에 의존하는 기존 기법의 한계를 해결하기 위해.
  • 개별 개념이나 문장이 아닌 전반적인 의미적 구조와 의미를 포착함으로써 학술 문헌 내 의미 매칭을 향상시키기 위해.
  • 연구 목적, 방법론, 분야를 통합한 유일한 표현 방식인 주제 이벤트를 활용해 학술 논문을 통합 표현하기 위해.
  • 도메인 온톨로지를 활용해 학술 논문 간 더 정확한 의미 유사도 계산을 수행하기 위해.

제안 방법

  • 각 학술 논문을 연구 목적, 방법론, 분야를 하나의 의미 단위로 통합한 '주제 이벤트'로 표현하기.
  • 연구 도메인 내 개념 간 관계를 모델링하기 위해 도메인 온톨로지를 구축하여 구조화된 의미 비교를 가능하게 하기.
  • 각 논문의 핵심 구성 요소(예: 목적, 방법, 분야 등)를 온톨로지의 노드에 매핑하여 공식적인 유사도 계산을 가능하게 하기.
  • 경로 길이 또는 의미 유사도 점수와 같은 온톨로지 기반의 거리 측정법을 사용해 주제 이벤트 간 의미 유사도를 계산하기.
  • 다양한 프로파일 차원(목적, 방법, 분야)에 걸친 유사도 점수를 가중 평균하여 최종 문서 수준의 유사도 점수를 도출하기.
  • 온톨로지 내 계층적이고 맥락적인 관계를 활용하여 키워드 겹침을 넘어서는 유사도 계산을 정교화하기.

실험 결과

연구 질문

  • RQ1주제 이벤트가 문서 수준 의미 유사도 계산을 위해 학술 논문의 전반적 의미적 내용을 효과적으로 표현할 수 있는가?
  • RQ2표면 통계 기반 방법과 비교해 온톨로지 기반의 의미 유사도 계산은 문서 수준 의미 매칭을 얼마나 향상시키는가?
  • RQ3연구 목적, 방법론, 분야를 통합한 유일한 주제 이벤트로 통합함으로써 유사도 정확도는 어느 정도 향상되는가?
  • RQ4제안된 방법은 학술 문헌의 의미 유사도 작업에서 최신 기법들을 능가하는가?

주요 결과

  • 제안된 방법은 문서 수준 의미 유사도 작업에서 최신 기법들에 비해 뚜렷한 성능 향상을 달성한다.
  • 연구 목적, 방법론, 분야를 주제 이벤트에 통합함으로써 전반적인 의미적 의미를 더 정확하게 모델링할 수 있다.
  • 온톨로지 기반의 의미 유사도 계산은 어휘적 겹침을 넘어서 의미 관계를 포착함으로써 문서 이해의 편차를 감소시킨다.
  • 도메인 온톨로지를 통한 구조화된 표현 덕분에 다양한 학술 분야에서 뛰어난 강인성을 보였다.
  • 실험 결과, 주제 이벤트 모델링이 기준 기법보다 더 의미 있고 맥락적으로 정확한 유사도 점수를 도출함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.