Skip to main content
QUICK REVIEW

[논문 리뷰] Math-KG: Construction and Applications of Mathematical Knowledge Graph

Jianing Wang|arXiv (Cornell University)|2022. 05. 08.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 BERT+CRF를 사용한 실체 인식과 BERT+Attention를 사용한 관계 분류와 같은 NLP 기법을 활용해 바이두 Baike와 위키피디아에서 파생된 파이프라인 기반의 수학 지식 그래프인 Math-KG를 제안한다. 실체 인식에서 92.62%의 F1 점수와 관계 분류에서 85.09%의 F1 점수를 기록하여 수학 교육 분야의 고장 분석 및 의미 기반 검색 응용을 가능하게 한다.

ABSTRACT

Recently, the explosion of online education platforms makes a success in encouraging us to easily access online education resources. However, most of them ignore the integration of massive unstructured information, which inevitably brings the problem of extit{information overload} and extit{knowledge trek}. In this paper, we proposed a mathematical knowledge graph named Math-KG, which automatically constructed by the pipeline method with the natural language processing technology to integrate the resources of the mathematics. It is built from the corpora of Baidu Baike, Wikipedia. We implement a simple application system to validate the proposed Math-KG can make contributions on a series of scenes, including faults analysis and semantic search. The system is publicly available at GitHub \footnote{\url{https://github.com/wjn1996/Mathematical-Knowledge-Entity-Recognition}.}.

연구 동기 및 목표

  • 비구조화된 자료 통합을 통해 온라인 수학 교육 분야의 정보 과부하와 지식 분산 문제를 해결하기 위해.
  • 반구조화되고 비구조화된 문헌에서 대규모로 구조화된 수학 지식 기반을 구축하기 위해.
  • 수학 분야의 지식 추출을 위한 자연어 처리 기반 파이프라인 구성 요소의 성능을 평가하기 위해.
  • 수학 교육 분야의 실용적 응용, 예를 들어 고장 분석 및 의미 기반 검색과 같은 분야에서 Math-KG의 유효성을 검증하기 위해.

제안 방법

  • 문헌 전처리, 명명된 실체 인식, 관계 분류, 지식 융합의 파이프라인을 통해 Math-KG를 구축하였다.
  • 웹 크롤러를 사용해 바이두 Baike와 위키피디아에서 카테고리, 개요, 본문, 인포박스, 수식을 추출하여 데이터를 수집하였다.
  • spaCy를 활용해 토큰화, 품사 태깅, 의존성 파싱을 수행하고, MathOCR를 사용해 수학 수식을 LaTeX로 변환하였다.
  • 6종류의 관계 유형을 정의: 종속성, 소속, 동치성, 대비, 동의어, 소유 성질.
  • 지식 실체 인식(KER)을 위해 8,950개 샘플을 기반으로 BERT+CRF를 학습하여 92.62%의 F1 점수를 달성하였다.
  • 실체 관계 분류(ERC)를 위해 13,365개 샘플을 기반으로 BERT+Attention+Softmax를 학습하여 85.09%의 F1 점수를 달성하였다.

실험 결과

연구 질문

  • RQ1파이프라인 기반의 자연어 처리 접근 방식이 비구조화된 수학 텍스트에서 구조화된 지식을 효과적으로 추출할 수 있는가?
  • RQ2자연어 처리 모델이 중국어 및 영어 수학 교육 텍스트에서 수학적 실체와 그 관계를 얼마나 정확하게 식별할 수 있는가?
  • RQ3구축된 수학 지식 그래프가 고장 분석 및 의미 기반 검색과 같은 실용적 교육 응용을 지원할 수 있는가?
  • RQ4저자원 수학 자연어 처리 환경에서 실체 인식 및 관계 분류의 성능은 어떠한가?

주요 결과

  • 지식 실체 인식(KER) 모델은 테스트 세트에서 92.62%의 F1 점수를 기록하여 수학적 실체 식별에 뛰어난 성능을 보였다.
  • 실체 관계 분류(ERC) 모델은 85.09%의 F1 점수를 기록하여 정의된 6종류의 수학적 관계를 효과적으로 식별함을 입증하였다.
  • 최종적으로 구성된 Math-KG에는 1,905개의 수학 지식 포인트 실체와 8,019개의 삼중항이 포함되어 있으며, 이 중 1,337개는 개념 실체, 568개는 정리 실체였다.
  • 관계 분포를 분석한 결과, 종속성 2,016개, 소속 2,609개, 동치성 76개, 대비 301개, 동의어 493개, '소유 성질' 2,524개의 삼중항이 존재하였다.
  • 고장 분석 응용은 관련 지식 포인트의 부분 그래프를 분석하여 학생 오류의 근본 원인을 성공적으로 식별하였다.
  • 의미 기반 검색 시스템은 TransE 임베딩과 유사도 점수를 활용해 '삼각형'에서 '외접원 반지름'으로 이르는 다단계 경로를 정확히 검색하여 반환하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.