Skip to main content
QUICK REVIEW

[논문 리뷰] UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model

Jiabo Ye, Anwen Hu|arXiv (Cornell University)|2023. 10. 08.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

UReader는 다중모odal 대규모 언어모델(MLLM)에 지시어 튜닝을 적용하여 OCR 불필요한 통합적이고 시각적 위치 기반 언어 이해 프레임워크를 도입하며, 하류 미세조정 없이도 10개 과제 중 8개에서 최고 성능을 기록한다. 이는 고해상도 이미지를 처리하기 위해 고정된 저해상도 시각 인식기와 함께 형태에 맞는 자르기 모듈을 활용하고, 최소한의 파rameter 업데이트로 보조 텍스트 읽기 및 핵심 포인트 생성 과제를 통해 텍스트 및 의미 이해를 향상시킨다.

ABSTRACT

Text is ubiquitous in our visual world, conveying crucial information, such as in documents, websites, and everyday photographs. In this work, we propose UReader, a first exploration of universal OCR-free visually-situated language understanding based on the Multimodal Large Language Model (MLLM). By leveraging the shallow text recognition ability of the MLLM, we only finetuned 1.2% parameters and the training cost is much lower than previous work following domain-specific pretraining and finetuning paradigms. Concretely, UReader is jointly finetuned on a wide range of Visually-situated Language Understanding tasks via a unified instruction format. To enhance the visual text and semantic understanding, we further apply two auxiliary tasks with the same format, namely text reading and key points generation tasks. We design a shape-adaptive cropping module before the encoder-decoder architecture of MLLM to leverage the frozen low-resolution vision encoder for processing high-resolution images. Without downstream finetuning, our single model achieves state-of-the-art ocr-free performance in 8 out of 10 visually-situated language understanding tasks, across 5 domains: documents, tables, charts, natural images, and webpage screenshots. Codes and instruction-tuning datasets will be released.

연구 동기 및 목표

  • 문서, 표, 차트, 자연 이미지, 웹페이지와 같은 다양한 이미지 유형에서 OCR 불필요한 통합적이고 시각적 위치 기반 언어 이해를 가능하게 하기 위해.
  • 도메인 특화 사전학습을 피하고 고정된 MLLM에 저비용 지시어 튜닝을 적용하여 학습 비용을 줄이기 위해.
  • 같은 지시어 형식을 사용하는 보조 지시어 튜닝 과제인 텍스트 읽기 및 핵심 포인트 생성을 통해 시각-텍스트 및 의미 이해를 향상시키기 위해.
  • 형태에 맞는 자르기 모듈을 통해 고정된 저해상도 시각 인식기를 고해상도 이미지에 효과적으로 활용할 수 있도록 하여 텍스트의 무결성을 유지하기 위해.
  • 하류 미세조정 없이도 10개 벤치마크 과제에서 최고 성능을 달성하기 위해.

제안 방법

  • 모든 시각적 위치 기반 언어 이해 과제를 단일 MLLM에서 공동 미세조정이 가능한 통합 지시어 튜닝 형식으로 재구성하기 위해.
  • 시각-텍스트 및 의미 이해를 향상시키기 위해 동일한 지시어 형식을 사용하는 두 가지 보조 과제인 텍스트 읽기 및 핵심 포인트 생성 도입하기 위해.
  • 비율에 따라 고해상도 이미지를 지역 패치로 나누어 텍스트 명료성과 왜곡을 줄이는 형태에 맞는 자르기 모듈 설계하기 위해.
  • 각 자른 패치에 대해 트레이너블 시각 개요기 적용하고, 공간 인식을 유지하기 위해 학습 가능한 자르기 위치 임베딩을 사용하여 특징 연결하기 위해.
  • 자르기로 인한 정보 손실을 줄이기 위해 리사이징된 전역 이미지를 함께 피드백 제공하기 위해.
  • 모델의 1.2%만 업데이트하는 방식으로 MLLM 미세조정을 수행하여 이전의 도메인 특화 사전학습 접근 방식에 비해 학습 비용을 크게 절감하기 위해.

실험 결과

연구 질문

  • RQ1단일 MLLM이 도메인 특화 사전학습 없이도 다양한 도메인에서 OCR 불필요한 통합적이고 시각적 위치 기반 언어 이해를 달성할 수 있는가?
  • RQ2보조 과제를 통한 지시어 튜닝이 시각-언어 과제에서 텍스트 인식 및 의미 이해를 얼마나 효과적으로 향상시키는가?
  • RQ3형태에 맞는 자르기 전략이 고정된 저해상도 시각 인식기를 고해상도 이미지 이해에 효과적으로 활용할 수 있는가?
  • RQ4모델이 문서, 표, 차트, 자연 이미지, 웹페이지 등 다양한 이미지 유형에 대해 얼마나 잘 일반화되는가?
  • RQ5OCR 불필요 정확도와 학습 효율성 측면에서 기존 방법과 비교해 모델 성능은 어떠한가?

주요 결과

  • UReader는 하류 미세조정 없이도 5개 도메인의 10개 시각적 위치 기반 언어 이해 과제 중 8개에서 최고 성능을 기록한다.
  • 형태에 맞는 자르기 모듈은 고정 그리드 자르기 대비 3.5 BLEU 점수 향상(21.4에서 24.9 BLEU1)을 통해 텍스트 읽기 성능을 향상시키며, 텍스트 왜곡을 줄인다.
  • 보조 텍스트 읽기 과제는 이미지에서 텍스트 시퀀스를 추출하고 재구성하는 데 모델 능력을 크게 향상시키며, 평가 세트에서 BLEU4 점수 11.7을 기록한다.
  • 모델는 강력한 zero-shot 일반화 능력을 보이며, 관련 영역에 주의를 기울여 표에서 첫 번째 영화를 식별하거나 총계를 계산하는 복잡한 질문에 정확하게 답할 수 있다.
  • UReader는 차트에 대해 개방형 핵심 포인트 생성을 성공적으로 수행하지만, 복잡한 시각적 구조에 대한 오해와 환각 현상으로 인해 성능에 한계가 있다.
  • 모델는 오직 1.2%의 파rameter만 미세조정하여 이전의 엔드 투 엔드 또는 두 단계 접근 방식보다 훨씬 낮은 학습 비용을 기록하며 높은 효율성을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.