Skip to main content
QUICK REVIEW

[논문 리뷰] KBSET -- Knowledge-Based Support for Scholarly Editing and Text Processing

Jana Kittelmann, Christoph Wernhard|arXiv (Cornell University)|2019. 08. 29.
Semantic Web and Ontologies인용 수 4
한 줄 요약

KBSET는 GND와 DBpedia와 같은 외부 지식 기반을 통합하는 Prolog 기반의 LaTeX 기반 학술 편집 프레임워크를 제안한다. 이는 의미적 마크업, 명명된 실체 인식, 외부 지식 기반을 지원하며, 실시간 후보 제안 기능을 통해 논리 기반 텍스트 처리를 효율적으로 구현한다. 대규모 문헌 집합에서 실체 해결을 약 7초 내에 달성하며, 선언적이고 쿼리 기반의 지식 통합을 통해 확장 가능하고 유지보수 용이한 학술 워크플로우를 지원한다.

ABSTRACT

KBSET supports a practical workflow for scholarly editing, based on using LaTeX with dedicated commands for semantics-oriented markup and a Prolog-implemented core system. Prolog plays there various roles: as query language and access mechanism for large Semantic Web fact bases, as data representation of structured documents and as a workflow model for advanced application tasks. The core system includes a LaTeX parser and a facility for the identification of named entities. We also sketch future perspectives of this approach to scholarly editing based on techniques of computational logic.

연구 동기 및 목표

  • 학술 편집에 실용적이고 확장 가능한 지식 기반 통합 지원의 부족을 해결한다.
  • 인문학 연구자들이 주석이 달린 학술 텍스트를 생성, 검증, 제시할 수 있도록 경제적이고 확장 가능한 워크플로우를 개발한다.
  • LaTeX 내에서 구조화되고 쿼리 가능한 마크업과 외부 지식 기반(예: GND, DBpedia)을 원활하게 통합할 수 있도록 지원한다.
  • 컴퓨터 논리 기반으로 명명된 실체 인식 및 의미적 추론과 같은 고급 텍스트 처리 작업을 지원한다.
  • 마크업과 레이아웃을 분리하고 재사용 가능하고 조합 가능한 주석을 가능하게 하는 탄력적인 논리 기반 인프라를 제공한다.

제안 방법

  • 특정 도메인의 의미적 명령을 사용한 LaTeX를 활용하여 학술 텍스트, 특히 서신 편람의 구조화되고 인간이 읽기 쉬운 마크업을 수행한다.
  • LaTeX를 파싱하고 문서 및 주석을 표현하며 지식 통합을 관리하기 위해 Prolog 기반의 핵심 시스템을 사용한다.
  • GND, GeoNames, DBpedia, YAGO와 같은 외부 사실 기반을 Prolog 쿼리를 통해 실체 해결 및 의미적 풍부화에 통합한다.
  • 이름 유사도, 직업 일치도, 맥락 일致성 등의 가능성 히وري스틱을 활용해 후보 실체의 기능 기반 순위를 매긴다.
  • 사용자 피드백을 통해 실체 제안을 점진적으로 개선하고, 보조 문서를 업데이트하며 쿼리를 재평가한다.
  • Prolog의 쿼리 최적화 및 논리적 추론을 활용해 효율적이고 확장 가능하며 유지보수 용이한 텍스트 처리 파이프라인을 제공한다.

실험 결과

연구 질문

  • RQ1의미적 마크업과 외부 지식 기반을 통합하는 확장 가능한 실용적 학술 편집 워크플로우를 어떻게 설계할 수 있는가?
  • RQ2Prolog가 학술 편집에서 문서 표현, 쿼리 처리, 워크플로우 모델링의 통합 기반으로 얼마나 효과적으로 작용할 수 있는가?
  • RQ3기능 기반 실체 후보 순위 매기기가 대규모 텍스트 처리에서 정확도와 성능을 향상시킬 수 있는가?
  • RQ4논리 기반 시스템은 자동 생성된 주석과 수작업으로 보존된 주석 간의 매개 역할을 어떻게 수행할 수 있는가?
  • RQ5컴퓨터 논리 기반 접근 방식은 전통적인 XML/TEI 모델을 초월해 어떻게 확장 가능하고 조합 가능하며 유지보수 가능한 학술 텍스트 처리를 지원할 수 있는가?

주요 결과

  • KBSET는 현대 노트북에서 10,000+ 쿼리 워크로드에 대해 약 7초 내로 명명된 실체 인식을 수행하여 대규모 학술 텍스트 처리에서 높은 성능을 입증한다.
  • 시스템은 2,000페이지에 달하는 학술 서신 편람 프로젝트(Sulzer-Bodmer)의 편집을 성공적으로 지원하여 실제 디지털 인문학 응용 분야에서의 실용성과 타당성을 입증한다.
  • Prolog는 쿼리 언어, 데이터 모델, 워크플로우 엔진으로서 효과적으로 작용하여 지식 기반의 탄력적 통합과 동적 쿼리 재평가를 가능하게 한다.
  • 맥락적 및 의미적 특징(예: 직업 일치도, 위키백과 연결성 등)을 활용한 기능 기반 가능성 순위 매기기가 실체 후보의 정확도와 사용자 안내를 크게 향상시킨다.
  • 사용자 피드백을 통한 주석 점진적 개선을 지원하여 보조 문서를 업데이트하고 다시 로드함으로써 향후 결과의 향상을 가능하게 한다.
  • KBSET의 아키텍처는 마크업과 레이아웃을 분리하고, 확장 가능하고 아키텍처 중심의 주석 통합 방식을 지원하여 향후 확장 가능성에 매우 높은 잠재력을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.