Skip to main content
QUICK REVIEW

[논문 리뷰] Abstractive Information Extraction from Scanned Invoices (AIESI) using End-to-end Sequential Approach

S. V. Patel, Dvijesh Bhatt|arXiv (Cornell University)|2020. 09. 12.
Stock Market Forecasting Methods참고 문헌 16인용 수 12
한 줄 요약

이 논문은 BERT 임베딩과 ResNet50를 활용해 글자, 시각적, 공간적 특징을 경계 상자 수준에서 통합하는 엔드 투 엔드 순차 모델인 AIESI(Abstractive Information Extraction from Scanned Invoices)를 제안한다. 이 모델은 단어 수준의 BiLSTM을 사용하며, SROIE 데이터셋에서 88.2%의 F1 스코어를 기록하여 문자 수준 및 단어 수준의 BiLSTM 기준 모델을 능가하여 핵심 파rameter 추출의 정확도 향상과 비연속 태깅 감소를 입증한다.

ABSTRACT

Recent proliferation in the field of Machine Learning and Deep Learning allows us to generate OCR models with higher accuracy. Optical Character Recognition(OCR) is the process of extracting text from documents and scanned images. For document data streamlining, we are interested in data like, Payee name, total amount, address, and etc. Extracted information helps to get complete insight of data, which can be helpful for fast document searching, efficient indexing in databases, data analytics, and etc. Using AIESI we can eliminate human effort for key parameters extraction from scanned documents. Abstract Information Extraction from Scanned Invoices (AIESI) is a process of extracting information like, date, total amount, payee name, and etc from scanned receipts. In this paper we proposed an improved method to ensemble all visual and textual features from invoices to extract key invoice parameters using Word wise BiLSTM.

연구 동기 및 목표

  • 스캐닝된 영수증에서 핵심 영수증 파라미터(예: 날짜, 총액, 수취인 이름 등)를 높은 정확도와 낮은 모호성으로 추출하는 데 도전한다.
  • 이질적인 영수증 구조 간에 일반화되지 못하는 규칙 기반 및 분류 기반 KIPE 방법의 한계를 극복한다.
  • 단어나 문자가 아닌 경계 상자를 원자 단위로 모델링하여 핵심 파라미터 추출 시 비연속적이거나 잘못된 태깅을 줄인다.
  • 딥 컨텍스트 텍스트 임베딩(BERT)과 함께 시각적 특징(ResNet50를 통한)과 공간적 특징(정규화된 좌표, 면적 비율)을 통합하여 성능을 향상시킨다.
  • 자동 회계 및 데이터 아카이빙과 같은 상업적 응용 분야를 위한 강력하고 확장 가능하며 다국어 처리가 가능한 문서 처리를 가능하게 한다.

제안 방법

  • 각 영수증 영역를 텍스트, 시각적, 공간적 특징으로 표현하는 경계 상자 수준의 표현 방식을 사용한다.
  • 컨텍스트 텍스트 임베딩을 위해 BERT-base를 활용하며, 명명된 실체는 #NAME#으로, 숫자는 #NUMBER#으로 매핑하여 강건성을 확보한다.
  • 자르기 전 경계 상자에서 시각적 임베딩을 추출하기 위해 ResNet50를 적용하여 레이아웃 및 폰트 특성 등을 캡처한다.
  • 수작업으로 만든 공간적 특징을 통합: 정규화된 좌표, 문서 대비 면적 비율, 영역 당 문자 밀도.
  • 768차원 BERT 임베딩, 128차원 시각적 특징, 6차원 공간적 특징을 결합하여 각 경계 상자에 대한 통합 벡터를 생성한다.
  • 결합된 특징 벡터를 기반으로 단어 수준의 BiLSTM 분류기를 훈련하여 각 경계 상자에 대해 핵심 파라미터 레이블(예: 'date', 'total')을 예측한다.

실험 결과

연구 질문

  • RQ1다양한 레이아웃을 가진 스캔된 영수증에서 깊이 있는 컨텍스트 텍스트 임베딩과 함께 시각적 및 공간적 특징을 통합하면 핵심 정보 추출 정확도가 향상되는가?
  • RQ2문자 수준 또는 단어 수준의 시퀀스 태깅보다 경계 상자 수준의 분류가 비연속적이거나 잘못된 레이블 예측을 줄이는 데 더 효과적인가?
  • RQ3실세계 영수증 데이터셋에서 제안된 엔드 투 엔드 모델은 규칙 기반 및 전통적인 분류 기반 KIPE 방법보다 어떻게 성능을 내는가?
  • RQ4시각적 및 공간적 특징이 이질적인 영수증 구조 간의 일반화에 얼마나 기여하는가?
  • RQ5이 모델은 상업적 응용 분야에서 확장 가능하고 다국어 처리가 가능한 고정밀도 및 저지연 처리를 달성할 수 있는가?

주요 결과

  • 제안된 모델은 SROIE 데이터셋에서 88.2%의 F1 스코어를 기록하여 문자 수준 BiLSTM(75.4%)과 단어 수준 BiLSTM(83.4%) 기준 모델을 뚜렷이 앞서며 성능 향상을 입증한다.
  • 시각적 및 공간적 특징의 통합은 더 일관되고 정확한 레이블링을 이끌어내어 시퀀스 기반 모델에서 흔히 발생하는 비연속 태깅 문제를 줄인다.
  • 경계 상자 수준의 분류 방식은 텍스트가 분할되거나 비정상적인 형식으로 되어 있어도 핵심 파라미터의 정확한 국소화 및 레이블링을 가능하게 한다.
  • 모델은 영수증의 구조적 다양성에 대해 강건성을 보이며, 문서 집약적 분야에서의 실세계 적용에 적합하다.
  • 성능은 초기 OCR 및 경계 상자 검출의 정확도에 크게 의존하며, 국소화가 부정확하면 전체 파ipeline 성능이 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.