[논문 리뷰] IIIT-AR-13K: A New Dataset for Graphical Object Detection in Documents
이 논문은 다국어 연간 보고서에서 13,000페이지의 수작업로 표시된 페이지를 포함하는 그래픽 오브젝트 검출을 위한 가장 큰 수작업으로 표시된 데이터셋인 iiit-ar-13k를 소개한다. Faster R-CNN 및 Mask R-CNN로 훈련된 모델은 더 큰 자동으로 표시된 데이터셋으로 훈련된 모델보다 성능이 뛰어나며, 표준 테이블 검출 및 파라미터 조정에서 고도로 정제된 데이터가 양보다도 효과적임을 보여준다.
We introduce a new dataset for graphical object detection in business documents, more specifically annual reports. This dataset, IIIT-AR-13k, is created by manually annotating the bounding boxes of graphical or page objects in publicly available annual reports. This dataset contains a total of 13k annotated page images with objects in five different popular categories - table, figure, natural image, logo, and signature. It is the largest manually annotated dataset for graphical object detection. Annual reports created in multiple languages for several years from various companies bring high diversity into this dataset. We benchmark IIIT-AR-13K dataset with two state of the art graphical object detection techniques using Faster R-CNN [20] and Mask R-CNN [11] and establish high baselines for further research. Our dataset is highly effective as training data for developing practical solutions for graphical object detection in both business documents and technical articles. By training with IIIT-AR-13K, we demonstrate the feasibility of a single solution that can report superior performance compared to the equivalent ones trained with a much larger amount of data, for table detection. We hope that our dataset helps in advancing the research for detecting various types of graphical objects in business documents.
연구 동기 및 목표
- 비즈니스 문서, 특히 연간 보고서에서 그래픽 오브젝트 검출을 위한 대규모이고 다양한 수작업으로 표시된 데이터셋의 부족을 해결하기 위해.
- 비즈니스 문서 이해를 위한 새로운 고다양성 데이터셋에서 최신 기술의 오브젝트 검출 모델(Faster R-CNN, Mask R-CNN)을 평가하기 위해.
- 정제된 소규모 수작업으로 표시된 데이터가 더 큰 자동 생성 데이터셋보다 검출 정확도에서 뛰어나지 않는지 평가하기 위해.
- 새로운 대규모 다국어 데이터셋을 사용하여 비즈니스 문서에서 그래픽 오브젝트 검출을 위한 강력한 베이스라인을 수립하기 위해.
제안 방법
- 13,000페이지의 공개된 연간 보고서에서 표, 그림, 자연 이미지, 로고, 서명의 다섯 가지 그래픽 오브젝트 유형에 대해 수작업으로 바운딩 박스를 표시하여 데이터셋을 구축하였다.
- 보고서들은 10년 이상의 기간을 포함하며, 영어, 프랑스어, 일본어, 러시아어를 포함한 다양한 언어에서 29개의 기업에서 유래하여 레이아웃과 시각적 다양성이 매우 높다.
- 저자는 iiit-ar-13k 데이터셋에서 Faster R-CNN 및 Mask R-CNN를 평가하여 향후 연구를 위한 강력한 성능 기준을 수립하였다.
- 전이 학습 실험은 큰 자동 데이터셋(PubLayNet, TableBank)으로 훈련된 모델을 1,000장의 iiit-ar-13k에서 무작위로 선택된 이미지로 추가로 훈련시켜 이전 모델의 전이 가능성과 효과를 평가하기 위해 수행되었다.
- 성능 평가는 표준 지표인 평균 평균 정확도(mAP), 정밀도, 재현율, F-측정치를 검증 및 테스트 세트에서 평가하였다.
실험 결과
연구 질문
- RQ1iiit-ar-13k처럼 소규모이지만 정제된 수작업으로 표시된 데이터셋이 비즈니스 문서의 그래픽 오브젝트 검출에서 더 큰 자동으로 표시된 데이터셋보다 성능이 뛰어나지 않는가?
- RQ2iiit-ar-13k는 큰 자동 생성 데이터셋으로 사전 훈련된 모델의 파라미터 조정 데이터셋으로 얼마나 효과적인가?
- RQ3iiit-ar-13k의 다양성과 정제된 표시가 테이블 및 기타 그래픽 오브젝트 검출에서 뛰어난 일반화 및 성능을 이끌어내는가?
- RQ4iiit-ar-13k에서 단지 1,000장의 이미지로만 파라미터 조정을 수행했을 때, 큰 데이터셋으로 훈련된 모델의 성능 향상은 얼마나 되는가?
주요 결과
- iiit-ar-13k에서만 훈련된 모델은 PubLayNet(0.9886 mAP) 및 TableBank(0.9863 mAP)와 같은 더 큰 데이터셋으로 훈련된 모델보다 높은 mAP(0.9555)를 기록하여 정제된 데이터가 더 뛰어난 성능을 낼 수 있음을 보여준다.
- PubLayNet과 같은 더 큰 데이터셋으로 사전 훈련된 모델을 iiit-ar-13k에서 1,000장의 이미지로 추가로 훈련시켰을 때 성능이 크게 향상되어 mAP 0.9882(f-trs) 및 0.9869(p-trs)를 기록하였으며, 이는 순수하게 큰 데이터셋으로 훈련된 모델의 성능에 도달하거나 초월하였다.
- iiit-ar-13k에서 훈련된 모델은 PubLayNet의 전체 훈련 세트로 파라미터 조정을 수행했을 때 테스트 세트에서 0.9891 mAP를 기록하여 새로운 데이터셋의 뛀아난 전이 가능성과 효과를 입증하였다.
- iiit-ar-13k에서 단지 1,000장의 이미지로만 파라미터 조정을 수행했을 때, 큰 데이터셋으로 사전 훈련된 모델이 비교적 높은 성능(mAP ~0.988)을 기록하여 높은 데이터 효율성과 새로운 표시의 품질을 입증하였다.
- iiit-ar-13k 데이터셋은 TableBank 및 PubLayNet과 같은 더 큰 자동으로 표시된 데이터셋으로 훈련된 모델보다 테이블 검출의 mAP 측면에서 뛰어난 성능을 보였으며, 이는 정제된 데이터가 양보다 더 큰 가치를 가진다는 가설을 검증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.