[논문 리뷰] Table Structure Recognition with Conditional Attention
이 논문은 시각적 특징을 사용하여 위치 기반 좌표에 의존하지 않고 셀 연결 분류 문제로 테이블 구조 인식을 공식화하는 조건부 어텐션 네트워크인 CATT-Net을 제안한다. 이 방법은 ICDAR2013에서 정렬된 바운딩 박스를 사용할 경우 Micro-F1을 0.963으로 향상시켜 최신 기술 수준을 확립하였으며, 향후 연구를 위해 정렬된 박스와 텍스트 중심의 바운딩 박스를 모두 포함한 새로운 주석 기반 벤치마크를 도입한다.
Tabular data in digital documents is widely used to express compact and important information for readers. However, it is challenging to parse tables from unstructured digital documents, such as PDFs and images, into machine-readable format because of the complexity of table structures and the missing of meta-information. Table Structure Recognition (TSR) problem aims to recognize the structure of a table and transform the unstructured tables into a structured and machine-readable format so that the tabular data can be further analysed by the down-stream tasks, such as semantic modeling and information retrieval. In this study, we hypothesize that a complicated table structure can be represented by a graph whose vertices and edges represent the cells and association between cells, respectively. Then we define the table structure recognition problem as a cell association classification problem and propose a conditional attention network (CATT-Net). The experimental results demonstrate the superiority of our proposed method over the state-of-the-art methods on various datasets. Besides, we investigate whether the alignment of a cell bounding box or a text-focused approach has more impact on the model performance. Due to the lack of public dataset annotations based on these two approaches, we further annotate the ICDAR2013 dataset providing both types of bounding boxes, which can be a new benchmark dataset for evaluating the methods in this field. Experimental results show that the alignment of a cell bounding box can help improve the Micro-averaged F1 score from 0.915 to 0.963, and the Macro-average F1 score from 0.787 to 0.923.
연구 동기 및 목표
- 포지션 민감한 특징에 의존하지 않고 비정형 문서 이미지 내에서 복잡한 테이블 구조를 인식하는 데 도전하는 것.
- 좌표 기반 입력 대신 시각적 특징을 사용하여 도메인 간 일반화 성능을 향상시키는 것.
- 정렬된 바운딩 박스와 텍스트 중심의 바운딩 박스라는 두 가지 유형의 셀 바운딩 박스 주석이 모델 성능에 미치는 영향을 조사하는 것.
- 향후 테이블 구조 인식 평가를 위한 새로운 주석 기반 벤치마크 데이터셋(정렬된 및 텍스트 중심 바운딩 박스 유형을 모두 포함한 ICDAR2013)을 제공하는 것.
제안 방법
- 각 셀 쌍을 수직, 수평 또는 연결이 없는 경우로 간주하여 셀 연결 분류 문제로 테이블 구조 인식을 공식화한다.
- 두 셀을 조건으로 하여 채널 및 공간 어텐션 모두를 조절하는 조건부 어텐션 메커니즘을 도입하여 특징 구분 능력을 향상시킨다.
- 셀 이미지의 시각적 특징에만 의존하는 바텀업 접근 방식을 사용하여 바운딩 박스 좌표나 해상도에 의존하지 않는다.
- 셀을 정점으로, 연결 관계를 간선으로 간주하는 그래프 기반 표현 방식을 사용하며, 모델은 셀 쌍 간의 간선 유형을 예측한다.
- 이전 검출 단계에서 발생할 수 있는 오류를 줄이기 위해 바운딩 박스 병합과 같은 후처리 기법을 적용한다.
- 공개 데이터셋에서 엔드 투 엔드로 모델을 훈련시키며, 어텐션 메커니즘을 활용해 셀 간의 맥락적 관계를 학습한다.
실험 결과
연구 질문
- RQ1조건부 어텐션의 사용이 테이블 구조 인식에서 셀 연결 예측 성능에 어떻게 기여하는가?
- RQ2정렬된 바운딩 박스와 텍스트 중심 바운딩 박스 중 어느 것이 모델 성능에 더 큰 영향을 미치는가?
- RQ3좌표 기반 모델에 비해 시각적 특징에만 기반한 바텀업 접근 방식이 도메인 간 일반화에 더 잘 작동하는가?
- RQ4바운딩 박스 주석 유형의 선택이 테이블 구조 인식에서 최종 F1 스코어에 얼마나 큰 영향을 미치는가?
- RQ5이중 바운딩 박스 주석을 갖춘 새로운 벤치마크 데이터셋이 이 분야의 재현 가능성과 평가를 향상시킬 수 있는가?
주요 결과
- CATT-Net은 정렬된 바운딩 박스를 사용할 경우 ICDAR2013 데이터셋에서 Micro-averaged F1 스코어 0.963을 기록하여 이전 최신 기술 수준의 방법(0.930)을 크게 능가한다.
- 정렬된 바운딩 박스를 사용할 경우 Macro-averaged F1이 텍스트 중심 바운딩 박스를 사용할 때보다 0.787에서 0.923으로 향상된다.
- 조건부 어텐션 메커니즘이 셀 쌍의 두 셀을 조건으로 하여 특징 학습을 향상시켜 더 정확한 연결 예측을 가능하게 한다.
- 정렬된 바운딩 박스는 성능 향상에 크게 기여하여, 텍스트 중심 바운딩 박스 대비 Micro-F1을 0.048 향상시키고, Macro-F1을 0.136 향상시킨다.
- 좌표 기반 입력이 아닌 시각적 특징에 의존함으로써 이 방법은 다양한 도메인 간 일반화 성능이 뛰어나다.
- 정렬된 및 텍스트 중심 바운딩 박스를 모두 포함한 ICDAR2013 데이터셋의 새로운 주석은 향후 연구를 위한 귀중한 벤치마크를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.