Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Extract Semantic Structure from Documents Using Multimodal Fully Convolutional Neural Network

Xiao Yang, Ersin Yumer|arXiv (Cornell University)|2017. 06. 07.
Handwritten Text Recognition Techniques인용 수 58
한 줄 요약

이 논문은 문서 이미지에서 픽셀 단위의 의미 구조 추출을 수행하기 위해 시각적 특징과 텍스트 임베딩을 공동으로 사용하는 다중모달 완전 합성 신경망(MFCN)을 제시하며, 합성 데이터 프리트레이닝 및 비지도 학습 태스크에 의해 보조됩니다.

ABSTRACT

We present an end-to-end, multimodal, fully convolutional network for extracting semantic structures from document images. We consider document semantic structure extraction as a pixel-wise segmentation task, and propose a unified model that classifies pixels based not only on their visual appearance, as in the traditional page segmentation task, but also on the content of underlying text. Moreover, we propose an efficient synthetic document generation process that we use to generate pretraining data for our network. Once the network is trained on a large set of synthetic documents, we fine-tune the network on unlabeled real documents using a semi-supervised approach. We systematically study the optimum network architecture and show that both our multimodal approach and the synthetic data pretraining significantly boost the performance.

연구 동기 및 목표

  • 픽셀 단위로 외관 기반(레이아웃) 클래스와 의미 기반(문서 역할) 클래스를 동시에 식별하는 엔드투엔드 모델을 개발한다.
  • 작거나 의미적으로 구별되는 영역의 분할을 개선하기 위해 텍스트 임베딩 맵을 통한 텍스트 정보를 도입한다.
  • 감독 신호를 확장하기 위해 합성 데이터를 활용하고 표현 학습을 강화하기 위한 비지도 보조 태스크를 제안한다.
  • 합성 라벨 데이터와 라벨이 없는 실제 문서를 교대로 사용하여 준지도 학습을 가능하게 한다.

제안 방법

  • 시각적 및 텍스트 표현을 융합하는 브리지를 포함하고 인코더, 세그멘테이션 디코더, 보조 재구성 디코더(훈련 시에만)로 구성된 다중모달 완전 컨볼루션 네트워크를 제안한다.
  • 단어 임베딩을 평균화하여 문장 수준 벡터를 만들고 이를 대응하는 문장 영역에 할당한 다음 시각적 특징과 연결(concatenate)한다.
  • 작은 객체의 수용 영역을 확장하되 언풀링 기반의 스킵 연결을 통해 공간 정확도를 보존하기 위해 확장된 컨볼루션 블록을 도입한다.
  • 위키피디아에서 스킵그램 모델을 사용해 텍스트 임베딩을 학습하여 임베딩 맵 구성에 사용할 128차원 단어 벡터를 얻는다.
  • 훈련 중 비지도 손실 두 가지를 사용한다: 보조 디코더를 통한 재구성 손실과 바운딩 박스를 사용하여 영역 내 특징 유사성을 강제하는 일관성 손실.
  • 감독 프리트레이닝을 위한 픽셀 단위의 정답을 제공하기 위해 대규모 합성 문서 생성기(135,000 페이지)를 개발한 뒤 실제 문서에서 준지도 방식으로 파인튜닝한다.

실험 결과

연구 질문

  • RQ1기저 텍스트 내용을 활용하여 문서 분할에서 모양 기반의 접근법만을 사용하는 것보다 단일 다중모달 네트워크가 성능을 초과할 수 있는가?
  • RQ2텍스트 임베딩 맵을 도입하는 것이 문서의 픽셀 단위 의미 분할에 미치는 영향은 무엇인가?
  • RQ3비지도 보조 태스크(재구성 및 일관성)가 실제 문서의 표현 학습 및 분할 정확도를 향상시키는가?
  • RQ4실제 데이터에서 높은 성능의 문서 의미 구조 추출을 가능하게 하는 합성 데이터 프리트레이닝의 효과는 어느 정도인가?

주요 결과

  • 다중모달 융합을 갖춘 MFCN은 DSSE-200, ICDAR2015, SectLabel 데이터세트에서 외관 기반 기준선에 비해 세분화 성능을 크게 향상시킨다.
  • 텍스트 임베딩 맵의 도입은 섹션 제목, 캡션, 목록, 단락 등 의미 클래스의 정확도를 향상시킨다.
  • 비지도 태스크는 이득을 제공하며 재구성 손실과 결합될 때 일관성 손실이 상당한 향상을 기여한다.
  • 임베딩 맵에 실제(정답) 텍스트를 사용하면 OCR에서 추출한 텍스트나 텍스트 정보가 없는 경우보다 성능이 크게 향상되며 정확한 텍스트 맥락의 가치를 나타낸다.
  • ICDAR2015에서 이 모형은 이진 버전에서 비텍스트에 대해 IoU 94.5, 텍스트에 대해 91.0, 도면 영역에 대해 77.1의 IoU를 달성하여 이러한 범주에서 이전 방법들을 능가한다.
  • SectLabel에서 섹션 제목(0.919), 캡션(0.893), 목록(0.793)의 경쟁력 있는 F1 점수를 달성하는 한편 도형과 표도 식별한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.