Skip to main content
QUICK REVIEW

[논문 리뷰] Rule Based Metadata Extraction Framework from Academic Articles

Jahongir Azimjonov, Jumabek Alikhanov|arXiv (Cornell University)|2018. 07. 24.
Semantic Web and Ontologies참고 문헌 13인용 수 4
한 줄 요약

이 논문은 학술 PDF에서 고성능 메타데이터 추출을 위한 무료, 오픈소스, 자바 기반의 규칙 기반 프레임워크를 제시한다. 제목 검출에 레이아웃, 폰트, 크기 히ュ리스틱을 활용하고, 요약, 关键어, 결론, 참고문헌 등의 추출에 고정된 규칙 세트를 사용하여, 기존 시스템 대비 9–10배 빠른 처리 속도를 달성하면서도 무제한 PDF 업로드를 지원하고 결과를 오라클 및 XML 형식으로 저장한다.

ABSTRACT

Metadata of scientific articles such as title, abstract, keywords or index terms, body text, conclusion, reference and others play a decisive role in collecting, managing and storing academic data in scientific databases, academic journals and digital libraries. An accurate extraction of these kinds of data from scientific papers is crucial to organize and retrieve important scientific information for researchers as well as librarians. Research social network systems and academic digital library systems provide academic data extracting, organizing and retrieving services. Mostly these types of services are not free or open source. They also have some performance problems and extracting limitations in the number of PDF (Portable Document Format) files that you can upload to the extraction systems. In this paper, a completely free and open source Java based high performance metadata extraction framework is proposed. This frameworks extraction speed is 9-10 times faster than existing metadata extraction systems. It is also flexible in that it allows uploading of unlimited number of PDF files. In this approach, titles of papers are extracted using layout features, font and size characteristics of text. Other metadata fields such as abstracts, body text, keywords, conclusions and references are extracted from PDF files using fixed rule sets. Extracted metadata are stored in both Oracle database and XML (Extensible Markup Language) file. This framework can be used to make scientific collections in digital libraries, online journals, online and offline scientific databases, government research agencies and research centers.

연구 동기 및 목표

  • 학술 PDF에 대한 무료, 오픈소스, 확장 가능한 메타데이터 추출 솔루션의 부족을 보완하기 위해.
  • 기존 상용 또는 전용 시스템에서 발생하는 성능 저하 및 파일 업로드 제한 문제를 해결하기 위해.
  • 제목, 요약, 关键어, 본문, 결론, 참고문헌 등의 메타데이터 필드를 효율적이고 정확하며 확장 가능한 방식으로 추출하기 위해.
  • 신뢰할 수 있고 구조화된 메타데이터를 제공함으로써 대규모 디지털 도서관 및 연구 데이터베이스 구축을 지원하기 위해.
  • 오프라인 및 온라인 학술 시스템에 배포 가능한 유연하고 고성능 솔루션을 제공하기 위해.

제안 방법

  • 제목 추출은 레이아웃 특징, 폰트 유형, 텍스트 크기를 활용하여 제목 섹션을 식별하고 분리한다.
  • 다른 메타데이터 필드(요약, 关键어, 본문, 결론, 참고문헌)는 PDF 내부의 구조적 및 텍스트 패턴 기반으로 사전 정의된 규칙 세트를 사용하여 추출한다.
  • 프레임워크는 PDF의 구조에서 텍스트 및 레이아웃 정보를 파싱하는 자바 기반 파이프라인을 사용하여 PDF를 처리한다.
  • 추출된 메타데이터는 상호운용성과 장기 저장을 위해 오라클 데이터베이스 및 XML 파일 형식으로 지속적으로 저장된다.
  • 시스템은 무제한 수의 PDF 파일을 처리하도록 설계되어 있으며, 상용 도구에서 흔히 볼 수 있는 업로드 제한을 제거한다.
  • 프레임워크는 모듈식이며 확장 가능하여, 다양한 저널 형식이나 메타데이터 표준에 맞는 규칙 세트 커스터마이제이션을 가능하게 한다.

실험 결과

연구 질문

  • RQ1규칙 기반 시스템이 기존 메타데이터 추출 도구보다 현저히 빠른 추출 속도를 달성할 수 있는가?
  • RQ2무료 및 오픈소스 프레임워크가 상용 또는 전용 소프트웨어에 의존하지 않고 학술 PDF에서 핵심 메타데이터 필드를 효과적으로 추출할 수 있는가?
  • RQ3레이아웃 및 폰트 기반 히ュ리스틱이 다양한 학술 PDF 형식에서 제목 검출 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4대량의 PDF를 처리할 경우 시스템의 확장성은 어떻게 평가되는가?
  • RQ5프레임워크가 다양한 후속 응용 프로그램을 위해 구조화된 데이터베이스 저장과 표준 XML 출력을 동시에 지원할 수 있는가?

주요 결과

  • 프레임워크는 기존 시스템 대비 9–10배 빠른 메타데이터 추출 속도를 달성한다.
  • 시스템은 무제한 수의 PDF 파일 업로드를 지원하여 상용 도구에서 흔한 주요 제한 사항을 극복한다.
  • 레이아웃, 폰트, 크기 기반 히ュ리스틱을 사용함으로써 제목 추출의 정확도가 매우 높다.
  • 고정된 규칙 세트를 사용하여 요약, 关键어, 결론, 참고문헌 등의 구조화된 메타데이터 필드를 성공적으로 추출한다.
  • 추출된 메타데이터는 오라클 데이터베이스 및 XML 형식으로 신뢰성 있게 저장되어 다양한 디지털 도서관 및 연구 시스템과의 통합을 가능하게 한다.
  • 시스템은 완전히 오픈소스이며 무료로 사용 가능하여 학술 기관, 정부 기관, 연구 센터에서의 배포가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.