Skip to main content
QUICK REVIEW

[논문 리뷰] Donut: Document Understanding Transformer without OCR

Geewook Kim, Teakgyu Hong|arXiv (Cornell University)|2021. 11. 30.
Handwritten Text Recognition Techniques참고 문헌 55인용 수 15
한 줄 요약

이 논문은 OCR를 완전히 회피하는 도큐먼트 이해를 위한 비전-언어 트랜스포머인 Donut을 제안한다. 사전 훈련을 위해 합성 문서 이미지 생성기를 사용하며, 엔드 투 엔드 모델은 공개 및 산업 기준 테스트에서 최고 성능을 달성한다. 이로 인해 OCR 관련 계산 비용과 오류 전파를 제거한다.

ABSTRACT

Understanding document images (e.g., invoices) has been an important research topic and has many applications in document processing automation. Through the latest advances in deep learning-based Optical Character Recognition (OCR), current Visual Document Understanding (VDU) systems have come to be designed based on OCR. Although such OCR-based approach promise reasonable performance, they suffer from critical problems induced by the OCR, e.g., (1) expensive computational costs and (2) performance degradation due to the OCR error propagation. In this paper, we propose a novel VDU model that is end-to-end trainable without underpinning OCR framework. To this end, we propose a new task and a synthetic document image generator to pre-train the model to mitigate the dependencies on large-scale real document images. Our approach achieves state-of-the-art performance on various document understanding tasks in public benchmark datasets and private industrial service datasets. Through extensive experiments and analysis, we demonstrate the effectiveness of the proposed model especially with consideration for a real-world application.

연구 동기 및 목표

  • OCR 기반 시각적 문서 이해(VDU) 시스템에 내재된 높은 계산 비용과 오류 전파 문제를 해결한다.
  • 사전 훈련을 위한 합성 문서 이미지 생성기를 도입하여 대규모 실재 문서 데이터셋에 대한 의존도를 줄인다.
  • OCR 파이프라인 없이 문서 이미지에 직접 작용하는 엔드 투 엔드로 훈련 가능한 VDU 모델을 개발한다.
  • 공개 기준 테스트와 사내 산업 데이터셋 양쪽에서 최고 성능을 달성한다.
  • 실세계 문서 처리 응용 프로그램에서의 실용적 효과성을 입증한다.

제안 방법

  • OCR 없이 문서 구조와 의미를 학습할 수 있도록, 사전 훈련을 위한 새로운 문서 이미지에서 텍스트 생성 작업을 제안한다.
  • 비전-언어 모델을 사전 훈련하기 위한 다양한 실재성 있는 훈련 데이터를 생성하기 위해 합성 문서 이미지 생성기를 설계한다.
  • 합성 및 실재 문서 이미지에서 엔드 투 엔드로 비전-언어 트랜스포머를 훈련하여, 이미지를 직접 구조화된 텍스트 출력으로 매핑한다.
  • 비용이 많이 드는 실세계 레이블이 부여된 문서 데이터셋에 대한 의존도를 줄이기 위해 합성 데이터 기반 자기지도 사전 훈련을 활용한다.
  • 비디오 특징과 해당 텍스트 토큰을 동시에 인코딩하고, 자동회귀 방식으로 텍스트를 생성하는 트랜스포머 기반 아키텍처를 사용한다.
  • 제한된 실세계 레이블이 부여된 데이터를 사용하여 최종 문서 이해 작업에 모델을 피지컬 트레이닝한다.

실험 결과

연구 질문

  • RQ1OCR에 의존하지 않고도 비전-언어 트랜스포머가 문서 이해에서 높은 성능을 낼 수 있는가?
  • RQ2합성 데이터 생성 전략이 실세계 배포를 위한 문서 이해 모델 사전 훈련에 얼마나 효과적인가?
  • RQ3OCR를 제거하면 문서 이해 시스템의 계산 비용과 오류 전파가 줄어드는가?
  • RQ4제안된 모델은 공개 및 비공개 기준 테스트에서 OCR 기반 베이스라인과 비교해 어떻게 성능을 내는가?
  • RQ5모델이 실세계 산업 문서 처리 시나리오에 얼마나 잘 일반화되는가?

주요 결과

  • Donut은 OCR을 사용하지 않고도 여러 공개 문서 이해 기준 테스트에서 최고 성능을 달성한다.
  • OCR 파이프라인을 제거함으로써 계산 비용을 크게 줄여 기존 VDU 시스템에서 주요 병목 현상을 해소한다.
  • OCR에서 발생하는 오류 전파가 완전히 방지되어 저품질 또는 복잡한 문서 이미지에서도 더 견고한 예측을 가능하게 한다.
  • 합성 데이터 사전 훈련 전략 덕분에 실세계 레이블이 제한된 데이터로도 뛰어난 성능을 발휘한다.
  • 모델는 사내 산업 데이터셋에 대해 강력한 일반화 능력을 보이며 실용적 적용 가능성을 확인한다.
  • 광범위한 아블레이션 연구를 통해 합성 데이터 생성 및 엔드 투 엔드 훈련 파라다임의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.