[논문 리뷰] Deep Structured Feature Networks for Table Detection and Tabular Data Extraction from Scanned Financial Document Images
이 논문은 재무 PDF 문서에서 스캔된 이미지에서 자동으로 표를 검출하고 표준화된 데이터를 추출하기 위한 종단 간 프레임워크를 제안한다. 표 영역 검출을 위해 특징 피라미드 네트워크(FPN)를 통합한 Faster R-CNN을 사용하고, 이후 룰 기반 레이아웃 세분화 기법을 통해 OCR과 정규 표현식을 조합하여 구조 및 내용을 추출한다. 주요 기여 사항으로는 새로운 애너테이션 처리된 재무 문서 데이터셋, 높은 성능을 보이는 검출 모델, 확장 가능한 룰 기반 데이터 추출 파이프라인을 포함한다.
Automatic table detection in PDF documents has achieved a great success but tabular data extraction are still challenging due to the integrity and noise issues in detected table areas. The accurate data extraction is extremely crucial in finance area. Inspired by this, the aim of this research is proposing an automated table detection and tabular data extraction from financial PDF documents. We proposed a method that consists of three main processes, which are detecting table areas with a Faster R-CNN (Region-based Convolutional Neural Network) model with Feature Pyramid Network (FPN) on each page image, extracting contents and structures by a compounded layout segmentation technique based on optical character recognition (OCR) and formulating regular expression rules for table header separation. The tabular data extraction feature is embedded with rule-based filtering and restructuring functions that are highly scalable. We annotate a new Financial Documents dataset with table regions for the experiment. The excellent table detection performance of the detection model is obtained from our customized dataset. The main contributions of this paper are proposing the Financial Documents dataset with table-area annotations, the superior detection model and the rule-based layout segmentation technique for the tabular data extraction from PDF files.
연구 동기 및 목표
- 노이즈와 구조적 일관성 부족으로 인한 스캔된 재무 문서 이미지에서의 표준화된 데이터 추출의 정확도 저하 문제를 해결한다.
- 추출된 표의 구조적 무결성과 의미적 정확성을 확보하여 재무 분야의 데이터 추출 신뢰도를 향상시킨다.
- 복잡하고 노이즈가 많은 재무 문서 레이아웃에서 구조화된 표준화된 데이터를 추출하기 위한 확장 가능하고 견고한 방법을 개발한다.
- 미래의 재무 문서 분석 연구를 지원하기 위해 정확한 표 영역 애너테이션을 갖춘 새로운 벤치마크 데이터셋을 구축한다.
- 추출 파이프라인에 룰 기반 필터링 및 재구성 기능을 통합하여 정확도와 확장성을 향상시킨다.
제안 방법
- 다양한 스케일의 특징 표현을 향상시킨 FPN을 통합한 Faster R-CNN을 사용하여 스캔된 재무 문서 이미지 내 표 영역을 검출한다.
- 검출된 표 영역에 OCR을 적용하여 후속 처리를 위한 텍스트 콘텐츠 및 레이아웃 정보를 추출한다.
- OCR 결과와 수작업으로 작성한 정규 표현식 규칙을 조합한 복합적인 레이아웃 세분화 기법을 사용하여 표 헤더와 콘텐츠를 분리한다.
- 표의 구조적 일관성 문제를 수정하고 추출 과정에서 데이터 무결성을 향상시키기 위해 룰 기반 필터링 및 재구성 모듈을 설계한다.
- 도메인 특화된 일반화 성능을 확보하기 위해 애너테이션 처리된 재무 문서 데이터셋을 검출 모델 훈련 및 평가에 활용한다.
- 검출 및 추출 파이프라인을 통합하여 PDF 문서의 종단 간 처리를 위한 유일한 프레임워크로 통합한다.
실험 결과
연구 질문
- RQ1기본 모델 대비 Faster R-CNN에 FPN를 적용한 모델이 스캔된 재무 문서 이미지 내 표 영역 검출에 얼마나 효과적인가?
- RQ2OCR 결과와 정규 표현식을 조합한 룰 기반 세분화 기법이 표 헤더와 콘텐츠 분리 정확도를 얼마나 향상시키는가?
- RQ3제안된 파이프라인이 노이즈가 많은 스캔된 재무 문서에서 구조화된 표준화된 데이터를 추출하는 데 얼마나 효과적인가?
- RQ4룰 기반 필터링 및 재구성 기능을 통합함으로써 표준화된 데이터 추출의 확장성과 신뢰성이 얼마나 향상되는가?
- RQ5도메인 특화된 애너테이션 처리된 데이터셋을 사용할 경우 표 검출 및 추출 모델의 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 Faster R-CNN에 FPN를 통합한 모델은 새로 제작된 재무 문서 데이터셋에서 뛰어난 표 검출 성능을 보였다.
- 룰 기반 레이아웃 세분화 기법은 OCR 출력 결과와 정규 표현식을 조합하여 표 헤더와 콘텐츠를 효과적으로 분리했다.
- 룰 기반 필터링 및 재구성 기능의 통합은 추출된 표준화된 데이터의 구조적 정확성과 일관성을 크게 향상시켰다.
- 제안된 프레임워크는 최소한의 수동 간섭으로 다양한 재무 문서 레이아웃을 처리하는 데 있어 높은 확장성을 입증했다.
- 정확한 표 영역 애너테이션을 갖춘 재무 문서 데이터셋의 제작 및 공개는 향후 재무 문서 분석 분야의 연구에 유의미한 기준을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.