Skip to main content
QUICK REVIEW

[논문 리뷰] VisualMRC: Machine Reading Comprehension on Document Images

Ryota Tanaka, Kyosuke Nishida|arXiv (Cornell University)|2021. 01. 27.
Multimodal Machine Learning Applications참고 문헌 47인용 수 4
한 줄 요약

이 논문은 문서 이미지에서 레이아웃, 텍스트, 시각적 콘텐츠를 이해하여 개괄적 답변을 생성해야 하는 시각적 기계 독해를 위한 새로운 데이터셋 VisualMRC와 모델을 소개한다. T5에서 시각적 레이아웃 및 주목성 특징을 추가로 미세조정한 제안된 LayoutT5 모델은 기본 순서-순서 모델과 최신 VQA 모델보다 성능이 뛰어나지만, 인간의 성능에 비해 여전히 열등하다.

ABSTRACT

Recent studies on machine reading comprehension have focused on text-level understanding but have not yet reached the level of human understanding of the visual layout and content of real-world documents. In this study, we introduce a new visual machine reading comprehension dataset, named VisualMRC, wherein given a question and a document image, a machine reads and comprehends texts in the image to answer the question in natural language. Compared with existing visual question answering (VQA) datasets that contain texts in images, VisualMRC focuses more on developing natural language understanding and generation abilities. It contains 30,000+ pairs of a question and an abstractive answer for 10,000+ document images sourced from multiple domains of webpages. We also introduce a new model that extends existing sequence-to-sequence models, pre-trained with large-scale text corpora, to take into account the visual layout and content of documents. Experiments with VisualMRC show that this model outperformed the base sequence-to-sequence models and a state-of-the-art VQA model. However, its performance is still below that of humans on most automatic evaluation metrics. The dataset will facilitate research aimed at connecting vision and language understanding.

연구 동기 및 목표

  • 복잡한 레이아웃과 시각적 콘텐츠를 포함한 실제 문서 이미지에 대한 기계 독해의 격차를 해소하기 위해.
  • 단순한 시각적 기반보다 자연어 이해 및 생성에 중점을 둔 문서 이미지에서의 데이터셋을 개발하기 위해.
  • 문서 이미지의 여러 텍스트 및 시각적 요소를 통합하여 개괄적 답변을 생성하기 위해 모델이 추론할 수 있도록 하기 위해.
  • 기존 순서-순서 모델의 언어 생성 능력을 시각적 독해에 그대로 적용하면서 치명적인 기억 상실을 방지하기 위해.
  • 실제 디지털 문서에 대한 인간 수준의 이해에 도달하기 위해 시각-언어 모델을 발전시키기 위해.

제안 방법

  • 저자들은 다양한 웹 도메인에서 유래한 10,000개 이상의 문서 이미지와 함께, 약 30,000개 이상의 질문-답변 쌍을 포함하는 VisualMRC 데이터셋을 구축했다. 이는 개괄적 추론이 요구되는 질문-답변 쌍을 포함한다.
  • 레이아웃 인식이 가능한 이해를 가능하게 하기 위해, 의미적 클래스(예: 목록, 표, 차트 등)로 주석이 찍힌 관심 영역(ROIs)을 포함한다.
  • T5 인코더-디코더 아키텍처를 확장하여 시각적 레이아웃 임베딩과 보조 주목성 검출 헤드를 추가한 새로운 모델인 LayoutT5를 제안한다.
  • 모델은 대규모 텍스트 코퍼스에서 사전 훈련하고, 질문-답변 쌍과 시각적 레이아웃 특징을 사용하여 VisualMRC에서 미세조정한다.
  • 문서 이미지에서 시각적 특징은 Faster R-CNN 검출기를 사용하여 ROIs를 국소화하고 분류한 후, 위치 임베딩 및 레이아웃 임베딩으로 인코딩된다.
  • 언어 생성 능력을 유지하면서 시각 정보를 통합하기 위해 답변 생성과 주목성 예측을 동시에 수행하는 다중 작업 학습 목표를 사용한다.

실험 결과

연구 질문

  • RQ1기존 순서-순서 모델이 자연어 생성 능력을 유지하면서 문서 이미지에서의 시각적 기계 독해에 효과적으로 적용될 수 있는가?
  • RQ2시각적 레이아웃 및 콘텐츠 정보를 통합함으로써 순수 텍스트 기반 모델에 비해 문서 수준의 질의 응답에서 성능이 향상되는가?
  • RQ3텍스트-텍스트 작업에 대해 훈련된 시각-언어 모델이 복잡한 레이아웃과 혼합된 시각적 요소를 포함한 문서 이미지로 일반화할 수 있는 정도는 어느 정도인가?
  • RQ4제안된 LayoutT5 모델은 문서 이미지의 이해 및 답변 생성에서 최신 VQA 모델보다 어떻게 비교되는가?
  • RQ5도표나 시각적 객체에 관해 시각적 문서 이해에서 주로 나타나는 실패 유형은 무엇인가?

주요 결과

  • LayoutT5 모델은 텍스트 입력으로만 미세조정된 기본 T5 및 BART 모델보다 성능이 뛰어나, 시각적 레이아웃 통합의 유용성을 입증한다.
  • LayoutT5는 최신 VQA 모델인 M4C보다 VisualMRC 데이터셋에서 더 뛰어난 성능을 보였으며, 이는 개괄적 문서 QA에서의 우수성을 시사한다.
  • 도표나 시각적 속성(예: 객체의 색상)을 포함한 질문에 대한 모델의 성능은 여전히 제한되어 있어, 시각적 객체 이해에서의 주요 실패 유형임을 드러낸다.
  • 자동 평가 지표에서 인간 성능과의 격차가 크다는 점으로 볼 때, VisualMRC의 개괄적 답변 생성 과제는 기존 VQA 데이터셋보다 더 복잡한 추론을 요구한다.
  • 보조 주목성 검출 작업 덕분에 시각적 미세조정 과정에서 치명적인 기억 상실을 방지하여 사전 훈련된 모델의 언어 생성 품질을 유지할 수 있었다.
  • 다양한 문서 유형과 장문의 개괄적 답변을 포함함으로써, 이 데이터셋은 실제 문서에서 고급 자연어 이해(NLU) 및 자연어 생성(NLG) 능력을 평가하는 데 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.