Skip to main content
QUICK REVIEW

[논문 리뷰] CDeC-Net: Composite Deformable Cascade Network for Table Detection in Document Images

Madhav Agarwal, Ajoy Mondal|arXiv (Cornell University)|2020. 08. 25.
Handwritten Text Recognition Techniques참고 문헌 50인용 수 5
한 줄 요약

CDeC-Net는 복합 백본과 변형 가능 합성곱을 통합한 새로운 엔드 투 엔드 학습 가능한 캐스케이드 Mask R-CNN 아키텍처로, 문서 이미지 내에서 정확한 표 검출을 위해 설계되었다. 이는 다양한 벤치마크에서 최신 기술 수준의 성능을 달성하며, 엄격한 IoU 임계값에서 높은 mAP를 기록하고, 각 데이터셋에 맞게 재학습이 필요 없는 단일의 정밀하게 튜닝된 모델(CDeC-Net‡)을 제공하여 다양한 데이터셋 간에 잘 일반화된다.

ABSTRACT

Localizing page elements/objects such as tables, figures, equations, etc. is the primary step in extracting information from document images. We propose a novel end-to-end trainable deep network, (CDeC-Net) for detecting tables present in the documents. The proposed network consists of a multistage extension of Mask R-CNN with a dual backbone having deformable convolution for detecting tables varying in scale with high detection accuracy at higher IoU threshold. We empirically evaluate CDeC-Net on all the publicly available benchmark datasets - ICDAR-2013, ICDAR-2017, ICDAR-2019,UNLV, Marmot, PubLayNet, and TableBank - with extensive experiments. Our solution has three important properties: (i) a single trained model CDeC-Net‡ performs well across all the popular benchmark datasets; (ii) we report excellent performances across multiple, including higher, thresholds of IoU; (iii) by following the same protocol of the recent papers for each of the benchmarks, we consistently demonstrate the superior quantitative performance. Our code and models will be publicly released for enabling the reproducibility of the results.

연구 동기 및 목표

  • 다양한 문서 이미지 데이터셋에서 표 검출에 대해 잘 작동하는 단일 일반화 가능한 딥 러닝 모델을 개발하는 것.
  • 복잡한 레이아웃에서 거짓 양성 결과를 줄이기 위해 높은 IoU 임계값에서 검출 정확도를 향상시키는 것.
  • 기존 모델이 데이터셋에 특화된 재학습 또는 튜닝이 필요로 하는 한계를 해결하는 것.
  • 변형 가능 합성곱과 이중 백본을 캐스케이드 Mask R-CNN 프레임워크에 통합하여 다양한 표 레이아웃에서 더 나은 특징 학습을 가능하게 하는 것.
  • 일致한 평가 프로토콜을 기반으로 여러 공개 데이터셋에서 뛰어난 성능을 보이며, 표 검출 분야의 새로운 벤치마크를 설정하는 것.

제안 방법

  • 모델은 객체 제안을 개선하고 국소화 정확도를 높이기 위해 다단계 캐스케이드 Mask R-CNN 아키텍처를 사용한다.
  • 다양한 척도의 표를 위한 특징 표현을 향상시키기 위해 ResNeXt-101과 변형 가능 합성곱을 통합한 두 번째 스트림을 포함한 이중 백본을 사용한다.
  • 백본에 변형 가능 합성곱을 통합하여 관련 공간 영역에 적응적으로 집중함으로써 레이아웃 변형과 누락된 격자선에 대한 강건성을 향상시킨다.
  • 모델은 IIIT-AR-13K 데이터셋에서 학습되고, 각 벤치마크 데이터셋의 훈련 세트에서 미세조정되어 단일 일반화 모델(CDeC-Net‡)을 생성한다.
  • 평가 과정은 최근 최신 기술 논문에서 사용된 표준 프로토콜을 따르며, 데이터셋 간 공정하고 일관된 비교를 보장한다.
  • 프레임워크는 엔드 투 엔드로 학습 가능하며, 객체 검출기에게 더 도전적인 높은 IoU 임계값(예: 0.8)을 최적화하기 위해 설계되었다.
Figure 1: Illustration of the proposed cd e c-n et which is compose of cascade Mask r-cnn with composite backbone having deformable convolution instead of conventional convolution.
Figure 1: Illustration of the proposed cd e c-n et which is compose of cascade Mask r-cnn with composite backbone having deformable convolution instead of conventional convolution.

실험 결과

연구 질문

  • RQ1특정 데이터셋에 맞게 재학습이 필요 없이, 다양한 표 검출 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는 단일 딥 러닝 모델이 존재하는가?
  • RQ2변형 가능 합성곱과 이중 백본의 통합이, 특히 높은 IoU 임계값에서 검출 정확도를 어떻게 향상시키는가?
  • RQ3캐스케이드 Mask R-CNN 아키텍처는 빌드업이 유사한 객체가 존재하는 복잡한 문서 레이아웃에서 거짓 양성 결과를 얼마나 줄이는가?
  • RQ4대규모이고 다양한 데이터셋(IIIT-AR-13K)에서 사전 학습된 모델을 미세조정하면, 새로운 벤치마크에서 더 나은 일반화 성능을 얻을 수 있는가?
  • RQ5통합된 모델이 각 벤치마크에 특화된 전용 모델의 성능을 뛰어나거나 동등하게 유지할 수 있는가?

주요 결과

  • 단일 미세조정 모델인 CDeC-Net‡는 PublayNet에서 mAP 0.978을 기록하여 이전 최신 기술 수준의 방법(m-RCNN)의 0.960을 초월했다.
  • ICDAR-2019 데이터셋에서 CDeC-Net‡는 IoU=0.8일 때 F1 스코어 0.950을 기록하여 높은 IoU 임계값에서 강력한 성능을 보였다.
  • ICDAR-2013 데이터셋에서 CDeC-Net‡는 F1 스코어 0.968을 기록하여 최고 성능을 낸 모델(dCnt)의 0.996에 근접했으며, 이는 단일 모델임을 감안할 때 놀라운 성능이었다.
  • UNLV 데이터셋에서 CDeC-Net‡는 mAP 0.912를 기록하여 이전 최신 기술 수준의 모델(God)의 0.910을 略로 뛰어넘었다.
  • TableBank 데이터셋에서 CDeC-Net‡는 mAP 0.965를 기록하여 이전 최신 기술 수준의 모델(Li et al.)의 0.981과 매우 유사했으며, 동시에 모든 데이터셋에 대해 단일 모델을 유지했다.
  • 제거 분석 결과, 캐스케이드 Mask R-CNN 프레임워크 내에서 이중 백본과 변형 가능 합성곱을 결합하면 IoU=0.5일 때 ICDAR-2013에서 F1 스코어 1.000을 기록하는 최고의 성능을 낸다.
Figure 2: Illustration of the deformable convolution.
Figure 2: Illustration of the deformable convolution.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.