Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Concept Hierarchies through Probabilistic Topic Modeling

V. S. Anoop, S. Asharaf|arXiv (Cornell University)|2016. 11. 29.
Advanced Text Analysis Techniques참고 문헌 10인용 수 3
한 줄 요약

이 논문은 비지도 학습 프레임워크를 제안하며, 주제 모델링에 잠재(dirichlet) 분포 할당(LDA)을 활용하고 경량의 언어 처리 기법을 결합하여 비구조화된 텍스트에서 인간이 이해할 수 있는 개념을 추출한다. 이후 개념 간의 확률적 'is-a' 관계를 통해 상위 개념 계층 구조를 구축하여 BBC 및 레이터스 뉴스 데이터셋에서 기존 방법들에 비해 우수한 성능을 달성한다.

ABSTRACT

With the advent of semantic web, various tools and techniques have been introduced for presenting and organizing knowledge. Concept hierarchies are one such technique which gained significant attention due to its usefulness in creating domain ontologies that are considered as an integral part of semantic web. Automated concept hierarchy learning algorithms focus on extracting relevant concepts from unstructured text corpus and connect them together by identifying some potential relations exist between them. In this paper, we propose a novel approach for identifying relevant concepts from plain text and then learns hierarchy of concepts by exploiting subsumption relation between them. To start with, we model topics using a probabilistic topic model and then make use of some lightweight linguistic process to extract semantically rich concepts. Then we connect concepts by identifying an "is-a" relationship between pair of concepts. The proposed method is completely unsupervised and there is no need for a domain specific training corpus for concept extraction and learning. Experiments on large and real-world text corpora such as BBC News dataset and Reuters News corpus shows that the proposed method outperforms some of the existing methods for concept extraction and efficient concept hierarchy learning is possible if the overall task is guided by a probabilistic topic modeling algorithm.

연구 동기 및 목표

  • 도메인 특화 학습 데이터 없이 대규모 비구조화된 텍스트 코퍼스에서 인간이 이해할 수 있는 개념을 자동으로 추출하는 것.
  • 추출된 개념 간의 상위-하위 관계(‘is-a’ 관계)를 학습하여 온톨로지 생성을 위한 계층적 구조를 만드는 것.
  • 주제 모델링을 기반으로 한 개념 추출이 기존 비지도 방법들보다 성능이 향상되는지 평가하는 것.
  • 실제 뉴스 코퍼스인 BBC 및 레이터스와 같은 환경에서의 확장성과 효과성을 입증하는 것.

제안 방법

  • 대규모 비구조화된 텍스트 코퍼스의 주제를 모델링하기 위해 잠재(dirichlet) 분포 할당(LDA)을 적용한다.
  • 어휘 빈도와 역주제 빈도를 기반으로 다단어 용어를 후보 개념으로 식별하기 위해 경량의 언어 처리 과정을 사용한다.
  • 정규화된 어휘 빈도(Ntf)와 역주제 빈도(itf)를 계산하여 의미적으로 풍부한 다단어 용어를 점수화하고 필터링한다.
  • 조건부 확률 P(C₁|C₂)와 P(C₂|C₁)를 계산하여 상위-하위 관계를 설정하며, C₁이 C₂를 포함하는 경우 P(C₁|C₂) = 1이고 P(C₂|C₁) < 1이 되도록 한다.
  • 모든 개념 쌍에 대해 상위-하위 조건을 반복적으로 적용하여 계층적 구조를 구성한다.
  • 정밀도, 재현율, F1 점수를 사용하여 인간이 애너테이션한 개념 레포지터리를 기준으로 평가한다.

실험 결과

연구 질문

  • RQ1경량 언어 처리 과정을 통해 통계적으로 생성된 주제에서 인간이 이해할 수 있는 개념을 효과적으로 추출할 수 있는가?
  • RQ2제안된 방법이 추출된 개념 간의 'is-a' 관계를 기반으로 의미 있는 상위-하위 계층을 학습할 수 있는가?
  • RQ3주제 모델링을 기반으로 한 개념 추출이 개념 식별 및 계층 학습에서 기존 비지도 알고리즘보다 우수한 성능을 보이는가?
  • RQ4대규모 텍스트 코퍼스에서 주제 수가 증가함에 따라 제안된 방법의 성능은 어떻게 변화하는가?

주요 결과

  • 제안된 방법은 개념 추출에서 정밀도 0.8165, 재현율 0.8901, F1 점수 0.8516을 달성하여 ACE(F1: 0.2517)와 ICE(F1: 0.7595)를 모두 능가했다.
  • 주제 수가 증가할수록 더 많은 인간이 이해할 수 있는 개념을 추출하여 확장성과 강건성을 입증했다.
  • BBC 및 레이터스 뉴스 코퍼스에서의 성능 평가 결과, ACE 및 ICE와 같은 기준 방법들보다 일관되게 뛰어난 성능을 보였다.
  • 상위-하위 관계 학습 모듈은 문서 공존 패턴을 기반으로 '다이얼업 인터넷'이 '네트워크 연결'에 포함되는 계층적 관계를 성공적으로 식별했다.
  • 프레임워크는 도메인 특화 학습 데이터나 인간 레이블이 붙은 코퍼스 없이도 완전히 비지도 방식으로 작동한다.
  • 결과는 주제 모델링 가이드가 추출된 개념의 품질과 관련성, 그리고 그들의 계층적 구성에 있어 크게 향상된다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.