[논문 리뷰] TAP: Text-Aware Pre-training for Text-VQA and Text-Caption
이 논문은 시각-언어 사전학습에서 OCR로부터 추출한 시나리오 텍스트를 명시적으로 통합함으로써 Text-VQA 및 Text-Caption 작업을 위한 다중모态 표현 학습을 향상시키는 Text-Aware Pre-training (TAP)를 제안한다. TAP는 마스크된 언어 모델링, 이미지-텍스트 매칭, 상대적 공간 위치 예측이라는 세 가지 새로운 사전학습 작업을 도입하여, 텍스트 단어, 시각적 객체, 시나리오 텍스트 간의 정렬을 크게 향상시켰으며, 대규모 OCR-CC 데이터셋에서 사전학습한 결과, TextVQA에서 +8.3% 정확도, TextCaps에서 +10.2 CIDEr를 기록하여 최신 기술 수준을 달성하였다.
In this paper, we propose Text-Aware Pre-training (TAP) for Text-VQA and Text-Caption tasks. These two tasks aim at reading and understanding scene text in images for question answering and image caption generation, respectively. In contrast to the conventional vision-language pre-training that fails to capture scene text and its relationship with the visual and text modalities, TAP explicitly incorporates scene text (generated from OCR engines) in pre-training. With three pre-training tasks, including masked language modeling (MLM), image-text (contrastive) matching (ITM), and relative (spatial) position prediction (RPP), TAP effectively helps the model learn a better aligned representation among the three modalities: text word, visual object, and scene text. Due to this aligned representation learning, even pre-trained on the same downstream task dataset, TAP already boosts the absolute accuracy on the TextVQA dataset by +5.4%, compared with a non-TAP baseline. To further improve the performance, we build a large-scale dataset based on the Conceptual Caption dataset, named OCR-CC, which contains 1.4 million scene text-related image-text pairs. Pre-trained on this OCR-CC dataset, our approach outperforms the state of the art by large margins on multiple tasks, i.e., +8.3% accuracy on TextVQA, +8.6% accuracy on ST-VQA, and +10.2 CIDEr score on TextCaps.
연구 동기 및 목표
- 기존의 시각-언어 사전학습 방법이 시나리오 텍스트를 포착하는 데에 한계가 있음을 해결하기 위해.
- 하류의 Text-VQA 및 Text-Caption 작업을 위한 텍스트 단어, 시각적 객체, 시나리오 텍스트 간의 공동 표현 학습을 향상시키기 위해.
- OCR로 추출한 시나리오 텍스트를 추가 입력 모odal로 명시적으로 통합하는 사전학습 프레임워크를 개발하기 위해.
- 모델 성능 향상을 위한 더 큰 규모의 시나리오 텍스트가 풍부한 이미지-텍스트 데이터셋(OCR-CC)을 구축하기 위해.
제안 방법
- 사전학습 중에 OCR로부터 추출한 시나리오 텍스트 토큰과 해당하는 시각적 바운딩 박스를 추가 입력 모달로 통합한다.
- 시나리오 텍스트 토큰을 마스크된 입력에 포함시켜 다중모달 정렬을 향상시키는 마스크된 언어 모델링(MLM) 작업을 제안한다.
- 이미지와 텍스트 입력 간의 관련성을 평가하는 이미지-텍스트 매칭(ITM) 작업을 설계하며, 이는 시나리오 텍스트를 포함한다.
- 시나리오 텍스트와 시각적 객체 간의 공간 관계를 학습하기 위해 상대적(공간적) 위치 예측(RPP) 작업을 도입한다.
- 140만 개의 시나리오 텍스트 관련 이미지-텍스트 쌍을 포함한 새로운 대규모 데이터셋인 OCR-CC에서 모델을 사전학습한다.
- 텍스트 단어, 시각적 객체, 시나리오 텍스트 영역 간의 잠재적 정렬을 학습하기 위해 크로스 어텐션을 갖춘 다중모달 트랜스포머를 사용한다.
실험 결과
연구 질문
- RQ1사전학습 단계에서 시나리오 텍스트를 명시적으로 통합하면 Text-VQA 및 Text-Caption 작업을 위한 다중모달 표현 학습이 향상되는가?
- RQ2시나리오 텍스트를 포함한 사전학습이 텍스트 단어, 시각적 객체, 시나리오 텍스트 영역 간의 정렬에 어떤 영향을 미치는가?
- RQ3표준 시각-언어 데이터셋과 비교해 대규모 시나리오 텍스트가 풍부한 데이터셋(OCR-CC)에서 사전학습을 수행할 경우 어떤 영향을 미치는가?
- RQ4제안된 사전학습 작업들(MLM, ITM, RPP)이 하류 성능에 기여하는 정도는 어느 정도인가?
- RQ5TAP는 시각적 및 텍스트 모달 정렬에만 의존하는 비-TAP 모델의 실패 케이스를 수정할 수 있는가?
주요 결과
- TAP는 동일한 하류 데이터에서 사전학습 및 미세조정을 수행했을 때, TextVQA 데이터셋에서 비-TAP 기준보다 정확도가 +5.4%p 향상되었다.
- OCR-CC 데이터셋에서 사전학습한 TAP는 TextVQA에서 +8.3% 정확도를 기록하여 이전 최신 기술 수준의 방법을 초월하였다.
- TAP는 ST-VQA에서 +8.6% 향상되고, TextCaps에서 +10.2 CIDEr 향상되어 다양한 작업에 걸쳐 강력한 일반화 능력을 보였다.
- 공동 언어 정렬 분석 결과 시나리오 텍스트 언어 정렬은 7배 증가했고, 시나리오 텍스트 시각 정렬은 2배 증가하여 개선된 공동 표현 학습을 검증하였다.
- 정성적 결과 분석을 통해 TAP는 다단어 엔티티 질의에 대해 정확한 답변 생성을 가능하게 하는 장기간의 텍스트 스트림에 걸쳐 여러 시나리오 텍스트 토큰을 정확히 지문하는 데 성공하였다.
- TAP는 다수의 시나리오 텍스트 토큰을 장기간의 텍스트 스트림에 걸쳐 정확하게 지문함으로써, 복잡한 공간 관계와 중간 객체를 통한 참조, 어색한 질문의 재구성 등에 대해 올바르게 대응함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.