[논문 리뷰] TSRFormer: Table Structure Recognition with Transformers
TSRFormer는 두 단계 DETR 기반 프레임워크인 SepRETR를 사용하여 분리선 예측 문제를 선 회귀 문제로 재구성함으로써, 왜곡되거나 테두리가 없는 복잡한 표에 대해 정확도와 강인성을 향상시키는 새로운 표 구조 인식 방법을 제안한다. 이는 SciTSR, PubTabNet, WTW 벤치마크에서 최신 기술 성능(SOTA)을 달성하며, 도전적인 내부 데이터셋에서도 뛰어난 일반화 성능을 보인다.
We present a new table structure recognition (TSR) approach, called TSRFormer, to robustly recognizing the structures of complex tables with geometrical distortions from various table images. Unlike previous methods, we formulate table separation line prediction as a line regression problem instead of an image segmentation problem and propose a new two-stage DETR based separator prediction approach, dubbed extbf{Sep}arator extbf{RE}gression extbf{TR}ansformer (SepRETR), to predict separation lines from table images directly. To make the two-stage DETR framework work efficiently and effectively for the separation line prediction task, we propose two improvements: 1) A prior-enhanced matching strategy to solve the slow convergence issue of DETR; 2) A new cross attention module to sample features from a high-resolution convolutional feature map directly so that high localization accuracy is achieved with low computational cost. After separation line prediction, a simple relation network based cell merging module is used to recover spanning cells. With these new techniques, our TSRFormer achieves state-of-the-art performance on several benchmark datasets, including SciTSR, PubTabNet and WTW. Furthermore, we have validated the robustness of our approach to tables with complex structures, borderless cells, large blank spaces, empty or spanning cells as well as distorted or even curved shapes on a more challenging real-world in-house dataset.
연구 동기 및 목표
- 실세계 이미지 내에서 복잡하고 기하학적으로 왜곡되며 테두리가 없는 표를 인식하는 데 도전하는 것.
- 마스크에서 선으로의 변환을 위해 히우리스틱 후처리에 의존하는 세그멘테이션 기반 방법의 한계를 극복하는 것.
- 두 단계 DETR에서 분리선 예측의 수렴성과 국소화 정확도를 향상시키는 것.
- 직접 분리선을 회귀하고 스플릿 셀을 복구하는 강인한 엔드 투 엔드 프레임워크를 개발하는 것.
- 곡선, 빈 셀, 대규모 공백 영역이 있는 표를 포함한 다양한 실세계 표 환경에서의 성능을 검증하는 것.
제안 방법
- 이미지 세그멘테이션 대신 표 분리선 예측을 선 회귀 문제로 재구성함으로써, 히우리스틱 마스크에서 선으로의 변환을 피함.
- 기본점 예측을 먼저 수행하고, 트랜스포머 디코더를 사용해 전체 분리선을 회귀하는 두 단계 DETR 기반 분리선 회귀 모듈(SepRETR)을 제안.
- 분리선 예측 작업에서 DETR 프레임워크의 수렴 속도를 향상시키기 위해 사전 정보를 통합한 매칭 전략을 도입.
- 고해상도 컨볼루션 특징 맵에서 직접 특징을 샘플링하는 새로운 크로스 어텐션 모듈을 설계하여, 낮은 계산 비용으로 국소화 정밀도를 향상.
- 교차하는 분리선으로부터 행 또는 열 스플릿 셀을 복구하기 위해 관계 네트워크 기반의 셀 병합 모듈을 활용.
- 히우리스틱 레이블 할당 및 NMS에 의존하지 않는 트랜스포머 디코더에서의 세트 예측 손실을 적용.
실험 결과
연구 질문
- RQ1왜곡되거나 테두리가 없는 표에서 분리선을 예측할 때 선 회귀가 세그멘테이션보다 더 효과적인가?
- RQ2두 단계 DETR 프레임워크를 어떻게 개선하여 TSR에서 고정밀도, 저비용의 분리선 회귀를 달성할 수 있는가?
- RQ3사전 정보를 통합한 매칭 전략이 DETR 기반 TSR 모델의 수렴 속도를 뚜렷이 향상시키는가?
- RQ4고해상도 특징 맵에서 직접 특징을 샘플링하면 계산 비용 증가 없이 국소화 정확도를 향상시킬 수 있는가?
- RQ5곡선, 대규모 공백 영역, 스플릿 셀이 있는 복잡한 실세계 표 변형에 대해 제안된 방법이 얼마나 강인한가?
주요 결과
- TSRFormer는 WTW 벤치마크에서 95.2%의 최신 기술 성능(F1 점수)을 달성하며 이전 방법들을 능가한다.
- SciTSR 데이터셋에서 모델은 F1 점수 92.6%를 기록하여 과학적 표에 대한 강력한 일반화 성능을 입증한다.
- 제안된 SepRETR 모듈과 세트 예측, 고해상도 특징 샘플링이 기본 설계 대비 F1 점수를 0.5% 향상시킨다는 것이 추론 연구를 통해 확인되었다.
- 사전 정보를 통합한 매칭 전략은 표준 DETR가 40 에포크 학습한 성능을 20 에포크 만에 달성할 수 있도록 해주었다.
- 정성적 결과 분석에서, 이 방법은 곡선, 테두리가 없는, 심하게 왜곡된 표에서도 강인하며, 내부 평가에서 세그멘테이션 기반 베이스라인보다 뛰어난 성능을 보였다.
- 대규모 공백 영역, 빈 셀, 스플릿 셀이 있는 표에서도 높은 정확도를 유지함으로써 실용적인 강인성을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.