Skip to main content
QUICK REVIEW

[논문 리뷰] Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding

Chuwei Luo, Guozhi Tang|arXiv (Cornell University)|2022. 06. 27.
Handwritten Text Recognition Techniques인용 수 6
한 줄 요약

Bi-VLDoc는 시각적 정보가 풍부한 문서 이해를 위한 이중 방향 시각-언어 사전 훈련 프레임워크를 제안하며, 하이브리드 어텐션 메커니즘과 세 가지 새로운 사전 훈련 작업(BTIA, RWTP, TIPA)을 활용하여 다중 모odal 간 상호작용을 향상시킨다. 이는 양식 이해(93.44%), 영수증 정보 추출(97.84%), 문서 분류(97.12%), 문서 시각적 QA에서 최신 기술 수준을 넘어선 성능을 기록하며, 이전 모델 대비 최대 1.26% 향상된 성능을 보였다.

ABSTRACT

Multi-modal document pre-trained models have proven to be very effective in a variety of visually-rich document understanding (VrDU) tasks. Though existing document pre-trained models have achieved excellent performance on standard benchmarks for VrDU, the way they model and exploit the interactions between vision and language on documents has hindered them from better generalization ability and higher accuracy. In this work, we investigate the problem of vision-language joint representation learning for VrDU mainly from the perspective of supervisory signals. Specifically, a pre-training paradigm called Bi-VLDoc is proposed, in which a bidirectional vision-language supervision strategy and a vision-language hybrid-attention mechanism are devised to fully explore and utilize the interactions between these two modalities, to learn stronger cross-modal document representations with richer semantics. Benefiting from the learned informative cross-modal document representations, Bi-VLDoc significantly advances the state-of-the-art performance on three widely-used document understanding benchmarks, including Form Understanding (from 85.14% to 93.44%), Receipt Information Extraction (from 96.01% to 97.84%), and Document Classification (from 96.08% to 97.12%). On Document Visual QA, Bi-VLDoc achieves the state-of-the-art performance compared to previous single model methods.

연구 동기 및 목표

  • 기존 문서 사전 훈련 모델에서 제한된 이중 방향 다중 모달 간 상호작용 문제를 해결하기 위해.
  • 시각 및 언어 모달리티에서의 감독 신호를 활용하여 다중 모달 표현 학습을 향상시키기 위해.
  • 세분화된 위치 수준의 어텐션과 정렬을 통해 레이아웃 인식 이해를 향상시키기 위해.
  • 다양한 시각적 정보가 풍부한 문서 이해 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.
  • 문서 AI에서 텍스트, 레이아웃, 시각적 특징의 효과적인 공동 모델링을 가능하게 하기 위해.

제안 방법

  • 시각과 언어 모달리티 간 상호 감독을 가능하게 하는 이중 방향 시각-언어 감독 전략을 도입한다.
  • 대표성 학습 중 교차 모달 특징을 동적으로 융합하기 위해 시각-언어 하이브리드 어텐션 메커니즘을 제안한다.
  • 세 가지 새로운 사전 훈련 작업을 설계: BTIA(이중 방향 텍스트-이미지 정렬), RWTP(지역별 텍스트 예측), TIPA(텍스트 이미지 위치 인식).
  • 언어 감독을 통한 시각 재구성 방식을 통해 텍스트 토큰을 해당 시각 영역과 정렬한다.
  • 정밀한 위치 인식 어텐션을 가능하게 하여, 특히 분할되거나 다중 영역에 퍼진 텍스트 블록에 대해 텍스트에서 이미지로의 어텐션을 향상시킨다.
  • 스팬 추출을 위한 토큰 수준 분류기를 사용하여 텍스트, 시각, 레이아웃 임베딩의 통합 시퀀스로 미세 조정을 수행한다.

실험 결과

연구 질문

  • RQ1이중 방향 시각-언어 감독 전략은 시각적 정보가 풍부한 문서 이해에서 다중 모달 표현 학습을 향상시키는가?
  • RQ2언어 감독을 통한 시각 재구성은 텍스트 콘텐츠와 시각적 특징 간 정렬을 어떻게 향상시키는가?
  • RQ3세분화된 레이아웃 인식은 문서 수준 작업의 성능 향상에 어느 정도 기여하는가?
  • RQ4하이브리드 어텐션 메커니즘은 시각 및 언어 특징을 효과적으로 융합하여 문서 이해를 향상시키는가?
  • RQ5이중 방향 목표를 공통으로 가진 공동 사전 훈련은 다양한 문서 이해 벤치마크에서 일관된 최신 기술 수준의 성능을 달성하는가?

주요 결과

  • Bi-VLDoc는 양식 이해에서 F1 점수 93.44%를 기록하여 이전 최신 기술 수준인 85.14% 대비 8.3% 향상되었다.
  • 영수증 정보 추출에서 Bi-VLDoc는 F1 점수 97.84%를 달성하여 이전 최신 기술 수준인 96.01%에서 향상되었다.
  • 문서 분류에서 Bi-VLDoc는 정확도 97.12%를 기록하여 이전 최신 기술 수준인 96.08%를 초월했다.
  • 문서 시각적 QA에서 Bi-VLDoc는 ANLS 점수 84.70을 기록하여 LayoutLM v2 대비 1.26% 포인트 높은 성능을 보였다.
  • 시각화 결과는 Bi-VLDoc가 양방향 어텐션 패턴을 학습하여 텍스트와 시각 토큰이 상호로 주목함을 확인했으며, LayoutLM v2의 단방향 어텐션과는 다릅니다.
  • 사례 연구에서는 Bi-VLDoc가 텍스트 토큰을 해당 시각 영역와 정렬함으로써 HEADER와 같은 엔티티를 정확히 식별하는 반면, LayoutLM v2는 이러한 경우에서 실패함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.