[논문 리뷰] PingAn-VCGroup's Solution for ICDAR 2021 Competition on Scientific Table Image Recognition to Latex
이 논문은 ICDAR 2021 과학적 표 이미지 인식에서 LaTeX로의 변환 경쟁 대회를 위해 Pingan-vcgroup가 제안한 솔루션을 제시하며, 표의 구조 및 내용 복원을 이미지에서 시퀀스로의 과제로 간주하기 위해 최적화된 MASTER 모델을 활용한다. 이 방법은 표의 구조 복원에서 0.7444의 정확한 일치 및 0.8765의 정확한 일치 @95%를, 표의 내용 복원에서 0.5586의 정확한 일치 및 0.7386의 정확한 일치 @95%를 달성하였다. 이는 랭커 옵timizer, 데이터 증강, 해상도 스케일링, SyncBN, 특징 병합, 앙상블 학습 등의 모델 개선 기법을 통해 달성되었다.
This paper presents our solution for the ICDAR 2021 Competition on Scientific Table Image Recognition to LaTeX. This competition has two sub-tasks: Table Structure Reconstruction (TSR) and Table Content Reconstruction (TCR). We treat both sub-tasks as two individual image-to-sequence recognition problems. We leverage our previously proposed algorithm MASTER \cite{lu2019master}, which is originally proposed for scene text recognition. We optimize the MASTER model from several perspectives: network structure, optimizer, normalization method, pre-trained model, resolution of input image, data augmentation, and model ensemble. Our method achieves 0.7444 Exact Match and 0.8765 Exact Match @95\% on the TSR task, and obtains 0.5586 Exact Match and 0.7386 Exact Match 95\% on the TCR task.
연구 동기 및 목표
- 복잡하고 다양한 표의 구조를 가진 과학적 표 이미지를 의미적으로 정확한 LaTeX 코드로 변환하는 데 도전하는 것.
- 표의 구조 복원(TSR)과 표의 내용 복원(TCR)이라는 두 가지 하위 과제의 성능을 향상시키기 위한 목표로, 이 두 과제를 모두 이미지에서 시퀀스로의 인식 문제로 간주하는 것.
- 네트워크 아키텍처, 학습 전략, 데이터 처리 기법을 조정하여 MASTER 모델을 표 인식에 최적화하는 것.
- 작은 데이터셋 크기와 일관되지 않은 애너테이션 문제를 해결하기 위해 데이터 증강, 앙상블 학습, 사전학습 후 미세조정 기법을 활용하는 것.
제안 방법
- 이 방법은 원래 도메인 특화된 스트리트 텍스트 인식을 위해 설계된 MASTER 모델을 활용하여 TSR 및 TCR을 모두 이미지에서 시퀀스로의 인식 과제로 간주한다.
- 주요 모델 최적화 기법으로는 수렴 성능 향상을 위해 RAdam, LookAhead 및 기울기 중심화를 결합한 랭커 옵timizer의 사용.
- 제한된 배치 크기로 다중 GPU 학습을 수행할 경우 대용량 입력 해상도를 처리하기 위해 동기화 배치 정규화(SyncBN)를 적용한다.
- 장거리 시퀀스 디코딩을 위한 특징 표현 학습을 향상시키기 위해 트랜스포머 디코더 레이어의 특징 병합(FeaC)을 도입한다.
- 표의 구조 및 내용 복원에 최적화된 스케일을 도출하기 위해 300×200에서 800×400까지 다양한 입력 이미지 해상도를 평가한다.
- 안정성 및 일반화 성능 향상을 위해 기울기, 애핀, 투영, 밝기, 대비, 포화도 변형을 포함한 광범위한 데이터 증강 기법을 적용한다.
실험 결과
연구 질문
- RQ1기존의 스트리트 텍스트 인식 모델인 MASTER를 과학적 표 이미지에서 LaTeX로의 변환에 효과적으로 적응시키는 방법은 무엇인가?
- RQ2학습 최적화 및 아키텍처 수정의 조합 중에서 표의 구조 및 내용 복원 과제에서 가장 높은 성능을 내는 조합은 무엇인가?
- RQ3다양한 입력 해상도와 데이터 증강 전략은 미리 보지 않은 테스트 데이터에 대한 일반화 능력과 정확도에 어떤 영향을 미치는가?
- RQ4앙상블 학습 및 대규모 사전학습 데이터셋에서의 사전학습 후 미세조정은 더 작은 도메인 특화 표 인식 벤치마크에서 성능 향상에 얼마나 기여하는가?
주요 결과
- 최종 모델은 표의 구조 복원(TSR) 과제에서 0.7444의 정확한 일치 및 0.8765의 정확한 일치 @95%를 달성하였다.
- 표의 내용 복원(TCR) 과제에서는 테스트 세트에서 0.5586의 정확한 일치 및 0.7386의 정확한 일치 @95%를 기록하였다.
- 앙상블 학습은 성능 향상에 크게 기여하였으며, 최고의 TSR 성능(0.8765 EM@95%)은 다양한 데이터 증강 및 해상도로 학습된 모델들을 조합했을 때에만 달성되었다.
- 트랜스포머 디코더 레이어의 특징 병합은 TSR 성능에 약 0.7% 향상 기여하였다.
- 데이터 증강은 약 0.5%의 성능 향상을 가져왔으며, TABLE2LATEX-450K와 같은 더 큰 사전학습 데이터셋에서의 미세조정은 도메인 이격에도 불구하고 상당한 성능 향상을 이끌어냈다.
- 더 큰 입력 해상도는 TCR 성능 향상에 기여했지만, 더 작은 해상도는 TSR에서 더 나은 성능를 보였으며, 이는 내용 세부 정보와 구조적 집중 사이의 상충 관계를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.