Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Robust Visual Information Extraction in Real World: New Dataset and Novel Solution

Jia-Peng Wang, Chongyu Liu|arXiv (Cornell University)|2021. 01. 24.
Handwritten Text Recognition Techniques인용 수 9
한 줄 요약

이 논문은 시각 및 의미적 조율 메커니즘을 활용하여 통합 최적화를 가능하게 하는, 동시 텍스트 검출, 인식 및 정보 추출을 위한 통합 엔드 투 엔드 프레임워크인 VIES를 제안한다. 또한, 텍스트 스트링킹과 시각적 정보 추출을 위한 첫 번째 완전히 애너테이션된 중국어 벤치마크인 EPHOIE를 도입하여, 엔드 투 엔드 설정에서 SROIE 데이터셋에서 SOTA 대비 9.01%의 F-스코어 향상을 달성한다.

ABSTRACT

Visual information extraction (VIE) has attracted considerable attention recently owing to its various advanced applications such as document understanding, automatic marking and intelligent education. Most existing works decoupled this problem into several independent sub-tasks of text spotting (text detection and recognition) and information extraction, which completely ignored the high correlation among them during optimization. In this paper, we propose a robust visual information extraction system (VIES) towards real-world scenarios, which is a unified end-to-end trainable framework for simultaneous text detection, recognition and information extraction by taking a single document image as input and outputting the structured information. Specifically, the information extraction branch collects abundant visual and semantic representations from text spotting for multimodal feature fusion and conversely, provides higher-level semantic clues to contribute to the optimization of text spotting. Moreover, regarding the shortage of public benchmarks, we construct a fully-annotated dataset called EPHOIE (https://github.com/HCIILAB/EPHOIE), which is the first Chinese benchmark for both text spotting and visual information extraction. EPHOIE consists of 1,494 images of examination paper head with complex layouts and background, including a total of 15,771 Chinese handwritten or printed text instances. Compared with the state-of-the-art methods, our VIES shows significant superior performance on the EPHOIE dataset and achieves a 9.01% F-score gain on the widely used SROIE dataset under the end-to-end scenario.

연구 동기 및 목표

  • 실제 시각적 정보 추출(VIE) 환경에서 분리된 텍스트 스트링킹과 정보 추출의 한계를 해결하기 위해.
  • 텍스트 검출, 인식 및 엔티티 추출을 공동 최적화하여 오류 전파와 중복 계산을 감소시키기 위해.
  • 시각, 의미 및 공간적 레이아웃의 다중모달 특징을 활용하는 강력한 엔드 투 엔드 학습 가능한 프레임워크를 개발하기 위해.
  • 복잡한 레이아웃과 수기 글씨를 포함한 중국어 문서 이해를 위한 새로운 벤치마크를 구축하기 위해.
  • 노이즈가 많은 배경과 임의의 텍스트 방향을 가진 실제 시나리오에서의 성능 향상하기 위해.

제안 방법

  • 텍스트 검출, 인식 및 정보 추출을 공동 최적화하는 통합 엔드 투 엔드 프레임워크인 VIES를 제안한다.
  • 정보 추출을 위한 텍스트 스트링킹에서의 시각적 특징을 집계하기 위해 시각적 조율 메커니즘(VCM)을 도입한다.
  • 텍스트 스트링킹의 검출 및 인식 향상을 위해 고수준의 의미적 단서를 되돌려주는 의미적 조율 메커니즘(SCM)을 제안한다.
  • 세그먼트 및 토큰 수준에서 시각, 의미 및 위치 특징을 통합하기 위해 적응형 특징 융합 모듈(AFFM)을 설계한다.
  • 실제 시험지 앞면 1,494장과 15,771개의 애너테이션된 중국어 텍스트 인스턴스를 포함한 EPHOIE라는 새로운 데이터셋을 구축한다. 이는 복잡한 레이아웃 내에서 수기 및 인쇄된 문자를 포함한다.
  • 출력 형식을 교정하기 위해 경량 네트워크 구조와 단순한 정규화 기법을 활용하여, 복잡한 앙상블 또는 후처리를 피한다.

실험 결과

연구 질문

  • RQ1텍스트 검출, 인식 및 정보 추출의 공동 최적화가 실제 문서 이해에서 강건성을 향상시킬 수 있는가?
  • RQ2시각, 의미 및 공간적 레이아웃에서 유래한 다중모달 특징 융합이 엔드 투 엔드 VIE 성능을 어떻게 향상시키는가?
  • RQ3통합 프레임워크는 계열적 파이프라인에 비해 오류 누적을 얼마나 줄일 수 있는가?
  • RQ4제안된 EPHOIE 데이터셋은 복잡한 실제 중국어 문서에서 VIE 시스템 평가에 얼마나 효과적인가?
  • RQ5제안된 방법은 지표 기반 및 엔드 투 엔드 설정 모두에서 최신 기술(SOTA) 모델을 초월하는가?

주요 결과

  • 엔드 투 엔드 설정에서 널리 사용되는 SROIE 데이터셋에서 VIES는 이전 SOTA 대비 9.01%의 F-스코어 향상을 달성한다.
  • EPHOIE 데이터셋에서 VIES는 엔드 투 엔드 조건에서 기존 방법들인 TRIE(83.81%) 및 Lample et al.(83.81%)에 비해 F1-스코어 95.23%를 기록하여 뚜렷한 승리를 거두었다.
  • 공동 최적화를 통한 효과적인 오류 완화 덕분에, OCR 오류가 흔한 엔드 투 엔드 시나리오에서도 뛰어난 강건성을 보였다.
  • 제안된 EPHOIE 데이터셋은 중국어 텍스트 스트링킹과 VIE를 위한 첫 번째 완전히 애너테이션된 벤치마크로, 복잡한 레이아웃과 수기 글씨를 포함한 실제 시험지 앞면을 특징으로 한다.
  • EPHOIE 및 SROIE 양쪽 모두에서 VIES는 모든 베이스라인을 압도하여 다양한 문서 유형과 애너테이션 체계에서 일관된 효과성을 입증했다.
  • 지표 기반 설정에서도 경쟁적인 성능을 기록했으며, 모델 앙상블 및 복잡한 후처리를 사용한 경쟁 우승 모델조차도 이를 뛰어넘었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.