Skip to main content
QUICK REVIEW

[논문 리뷰] Ontology-driven Information Extraction

Weronika T. Adrian, Nicola Leone|arXiv (Cornell University)|2015. 12. 18.
Semantic Web and Ontologies참고 문헌 8인용 수 6
한 줄 요약

이 논문은 유사 유형의 비정형 문서(예: Europass 스타일 이력서)를 두 단계 설계/실행 아키텍처를 통해 의미적으로 풍부하고 기계가 처리할 수 있는 데이터로 변환하는 온톨로지 기반 정보 추출 시스템인 KnowRex를 제시한다. 논리 프로그래밍, 테이블 인식, 의미적 메타데이터 추가 기술을 통합함으로써 KnowRex는 높은 정밀도로 구조화된 지식을 추출하여 스킬 기반 이력서 필터링과 같은 작업에서 초기 테스트 데이터 기준 80%의 성공률을 달성한다.

ABSTRACT

Homogeneous unstructured data (HUD) are collections of unstructured documents that share common properties, such as similar layout, common file format, or common domain of values. Building on such properties, it would be desirable to automatically process HUD to access the main information through a semantic layer -- typically an ontology -- called semantic view. Hence, we propose an ontology-based approach for extracting semantically rich information from HUD, by integrating and extending recent technologies and results from the fields of classical information extraction, table recognition, ontologies, text annotation, and logic programming. Moreover, we design and implement a system, named KnowRex, that has been successfully applied to curriculum vitae in the Europass style to offer a semantic view of them, and be able, for example, to select those which exhibit required skills.

연구 동기 및 목표

  • 기계가 처리하기 어려운 비록 인간에게는 가독성이 높지만 동일한 형식의 비정형 데이터(HUD)에서 의미적으로 유의미한 정보를 추출하는 데 도전하는 것.
  • 데이터의 원래 구조와는 독립된 의미적 조직 구조를 제공하는 통일된 온톨로지 기반의 의미적 시각을 제공하는 시스템을 설계하는 것.
  • 이름 추출, 테이블 파싱, 논리 프로그래밍, 온톨로지 모델링 등 다양한 기술을 통합하여 확장 가능하고 스케일링 가능한 정보 추출을 위한 융합된 프레임워크를 설계하는 것.
  • 필요한 스킬 기반으로 이력서를 검색하거나 필터링하는 등의 실용적 응용을 가능하게 하여 시스템의 실세계 지식 관리 응용 가능성을 입증하는 것.

제안 방법

  • 시스템은 사용자가 대상 온톨로지 스키마, 개체 모델, 의미적 서술자를 정의하는 설계 단계와 이 사양을 기반으로 문서를 처리하는 런타임 단계로 나누어 운영된다.
  • 문서의 구조는 2차원 격자 분할 도구(예: Quablo)를 통해 분석되어 셀과 토큰 위치를 식별함으로써 텍스트 레이아웃에 대한 공간적 추론이 가능해진다.
  • 이름 엔티티 인식기(예: StanfordNER, DBpedia Spotlight)를 적용하여 명시적 엔티티를 식별하고, 결과는 위치 메타데이터(예: onePosition, biPosition)를 포함한 OntoDLP에 논리 사실로 저장된다.
  • 의미적 서술자는 유한 오토마타로 모델링된 논리 규칙으로 표현되며, 문서의 토큰 및 셀 구조를 순회하여 패턴을 식별하고 새로운 의미적 개체를 생성한다.
  • 매핑 규칙은 OntoDLP에 저장된 중간 개체 모델을 목표 의미적 시각 온톨로지의 인스턴스로 변환하여 원하는 스키마와의 일치를 보장한다.
  • 전체 파이프라인은 공식 논리에 의해 구동되어 정밀하고 추적 가능하며 조합 가능한 추출을 가능하게 하며, 복잡한 제약 조건(예: '이메일은 동일한 셀 내 레이블 뒤에 와야 함')을 지원한다.

실험 결과

연구 질문

  • RQ1Europass 이력서와 같은 동일한 형식의 비정형 문서에서 의미적으로 풍부한 정보를 추출하기 위해 통합된 온톨로지 기반 접근법을 어떻게 설계할 수 있는가?
  • RQ2논리 프로그래밍과 의미적 서술자를 통해 복잡한 추출 패턴을 모델링할 수 있는 정도는 어느 정도이며, 정밀도와 모듈성을 유지할 수 있는가?
  • RQ3실세계 HUD 처리에서 발생하는 주요 성능 저하 요인는 무엇이며, 규칙 기반 기술과 제3자 애노테이터를 하이브리드 방식으로 통합함으로써 이를 어떻게 완화할 수 있는가?
  • RQ4의미적 및 공간적 제약 조건만을 사용하여 레이아웃이 다양한 PDF에서 높은 재현율과 정밀도로 구조화된 지식을 추출할 수 있는가?

주요 결과

  • KnowRex의 설계 단계는 약 두 명월의 작업을 소요하여 실세계 배포에 대한 타당한 설정 시간을 보여주었다.
  • 초기 설정 후 Quablo(2차원 구조 인식 도구)는 테스트된 80개의 Europass 스타일 이력서 중 약 50%를 성공적으로 처리하였다.
  • 마진 허용 오차 조정과 같은 소량의 설정 조정을 통해 추가로 약 20%의 문서도 만족스러운 결과를 달성하였다.
  • 의미적 애노테이터의 정밀도는 높았지만 재현율이 때로 낮아, 사전 기반 애노테이터의 조정으로 보완 가능했다.
  • 의미적 서술자 및 매핑을 위한 논리 규칙는 정밀도 손실 없이 예상대로 기능하여 개체 생성과 스키마 매핑의 신뢰성을 입증하였다.
  • 시스템은 CV 외 다양한 HUD 시나리오에 적용 가능할 정도로 충분한 모듈성과 유연성을 보였으며, 다양한 문서 유형과 도메인 간 재사용이 가능함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.