Skip to main content
QUICK REVIEW

[논문 리뷰] Corpus Conversion Service: A Machine Learning Platform to Ingest Documents at Scale

Peter Staar, Michele Dolfi|arXiv (Cornell University)|2018. 05. 24.
Web Data Mining and Analysis참고 문헌 11인용 수 17
한 줄 요약

이 논문은 구조화된 데이터 포맷(예: JSON)으로 변환하는 데 중점을 두고, PDF 및 비트맵 문서를 대규모로 처리할 수 있는 확장성 있고 클라우드 기반의 기계학습 플랫폼인 코퍼스 변환 서비스(CCS)를 제시한다. 비동기식 마이크로서비스 아키텍처와 훈련된 딥러닝 모델을 활용하여 CCS는 콘텐츠 추출에서 거의 완벽한 정밀도와 재현율(최대 99%)을 달성하며, 지표 데이터 생성을 최소 한 계단 이상 가속화한다.

ABSTRACT

Over the past few decades, the amount of scientific articles and technical literature has increased exponentially in size. Consequently, there is a great need for systems that can ingest these documents at scale and make the contained knowledge discoverable. Unfortunately, both the format of these documents (e.g. the PDF format or bitmap images) as well as the presentation of the data (e.g. complex tables) make the extraction of qualitative and quantitive data extremely challenging. In this paper, we present a modular, cloud-based platform to ingest documents at scale. This platform, called the Corpus Conversion Service (CCS), implements a pipeline which allows users to parse and annotate documents (i.e. collect ground-truth), train machine-learning classification algorithms and ultimately convert any type of PDF or bitmap-documents to a structured content representation format. We will show that each of the modules is scalable due to an asynchronous microservice architecture and can therefore handle massive amounts of documents. Furthermore, we will show that our capability to gather ground-truth is accelerated by machine-learning algorithms by at least one order of magnitude. This allows us to both gather large amounts of ground-truth in very little time and obtain very good precision/recall metrics in the range of 99\% with regard to content conversion to structured output. The CCS platform is currently deployed on IBM internal infrastructure and serving more than 250 active users for knowledge-engineering project engagements.

연구 동기 및 목표

  • 광범위한 과학적 및 기술적 PDF 및 비트맵 문서에서 구조화된 지식을 추출하는 데 점점 커지는 도전 과제를 해결하기 위해.
  • 지식 탐색을 위해 비구조화된 문서 콘텐츠를 JSON 및 XML과 같은 구조화된 포맷으로 확장성 있고 고정밀도로 변환하기 위해.
  • 문서 파싱 작업에서 기계학습 모델 훈련을 위한 지표 데이터 수집을 가속화하기 위해.
  • 동시 사용자, 대규모 문서 워크로드, 동적 자원 스케일링을 지원하는 모듈러하고 클라우드 네이티브 플랫폼을 설계하기 위해.
  • 마이크로서비스와 딥러닝을 통해 문서 변환 파이프라인의 효율성과 성능을 향상시키기 위해.

제안 방법

  • 플랫폼은 다섯 단계로 구성된 파이프라인을 사용한다: 문서 파싱, 레이아웃 의미 주석, 지표 데이터 기반 모델 훈련, 훈련된 모델을 통한 추론, 그리고 구조화된 출력 조립(예: JSON).
  • 파이프라인의 각 구성 요소는 상태 없는 마이크로서비스로 구현되어 있으며, 비동기 메시지 큐를 통해 통신하여 독립적인 스케일링과 장애 내성 기능을 제공한다.
  • 지표 데이터 주석은 기계학습을 활용하여 최소 한 계단 이상의 수준으로 수동 작업을 감소시킨다.
  • 딥러닝 모델은 레이아웃 요소(예: 표 셀, 텍스트 블록)를 분류하고 파싱된 문서에서 의미 역할을 예측하기 위해 주석 처리된 데이터 기반으로 훈련된다.
  • 플랫폼은 동적 자원 바인딩을 지원하는 쿠버네티스에 배포되어 각 마이크로서비스별로 유연하게 컴퓨팅 자원을 스케일링할 수 있다.
  • 플랫폼은 옵션 기반의 OCR 및 이미지 처리 마이크로서비스를 통해 원본 PDF 및 스캔된 문서를 모두 지원한다.

실험 결과

연구 질문

  • RQ1비구조화된 PDF 및 비트맵 문서를 대규모로 구조화된 데이터로 변환할 수 있는 확장성 있고 모듈러한 플랫폼을 어떻게 설계할 수 있는가?
  • RQ2기계학습을 통해 문서 레이아웃 이해를 위한 지표 데이터 수집을 얼마나 빠르게 가속화할 수 있는가?
  • RQ3플랫폼의 마이크로서비스 아키텍처는 사용자 수, 문서 볼륨, 컴퓨팅 자원에 걸쳐 수평 스케일링을 어떻게 가능하게 하는가?
  • RQ4훈련된 딥러닝 모델을 사용해 문서 레이아웃에서 구조화된 콘텐츠 추출을 수행할 때 달성할 수 있는 정밀도와 재현율 수준은 어느 정도인가?
  • RQ5다양한 워크로드와 문서 크기 조건에서 시스템은 어떻게 일정한 시간 내에 해결을 보장할 수 있는가?

주요 결과

  • 코퍼스 변환 서비스 플랫폼은 250명 이상의 동시 사용자를 처리하며 대규모 PDF 페이지를 처리할 수 있으며, 갑작스러운 사용량 급증 상황에서도 성능이 안정적으로 유지된다.
  • 플랫폼은 구조화된 콘텐츠 변환에서 최대 99%의 정밀도와 재현율을 달성하여 문서 레이아웃 이해의 높은 정확도를 입증한다.
  • 기계학습을 활용함으로써 지표 데이터 주석이 최소 한 계단 이상 빨라져 수동 레이블링 시간이 크게 감소한다.
  • 파싱 및 기계학습 추론 구성 요소는 워커 노드 수에 따라 선형(또는 선형을 약간 초월하는) 방식으로 스케일링되며, 강력한 수평 확장성 잠재력을 보여준다.
  • 페이지 수준의 병렬 처리에 내재된 제약으로 인해 문서 조립 단계는 더 낮은 속도 향상 곡선을 보이지만, 대규모 코퍼스 크기를 통해 로드 불균형이 완화된다.
  • 워크로드 수요에 따라 동적으로 컴퓨팅 자원을 할당함으로써 시스템은 일정한 시간 내에 해결을 유지하며 예측 가능한 성능을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.