[논문 리뷰] TAG: Boosting Text-VQA via Text-aware Visual Question-answer Generation
이 논문은 다중모달 트랜스포머를 사용해 OCR 토큰에 기반한 질문을 생성함으로써, 이미지 내에 존재하는 활용도가 낮은 현장 텍스트에서 고품질이고 다양한 QA 쌍을 합성하는 텍스트 인식 시각질의 질문 응답 생성 프레임워크인 TAG를 제안한다. 기존의 Text-VQA 데이터셋에 이러한 합성 쌍을 추가함으로써, 추가적인 인간 레이블링 없이도 TextVQA 및 ST-VQA에서 모델 성능을 크게 향상시켰으며, 거대한 외부 데이터로 사전 훈련된 모델들을 능가하는 최신 기술 수준(SOTA)의 성능을 달성하였다.
Text-VQA aims at answering questions that require understanding the textual cues in an image. Despite the great progress of existing Text-VQA methods, their performance suffers from insufficient human-labeled question-answer (QA) pairs. However, we observe that, in general, the scene text is not fully exploited in the existing datasets -- only a small portion of the text in each image participates in the annotated QA activities. This results in a huge waste of useful information. To address this deficiency, we develop a new method to generate high-quality and diverse QA pairs by explicitly utilizing the existing rich text available in the scene context of each image. Specifically, we propose, TAG, a text-aware visual question-answer generation architecture that learns to produce meaningful, and accurate QA samples using a multimodal transformer. The architecture exploits underexplored scene text information and enhances scene understanding of Text-VQA models by combining the generated QA pairs with the initial training data. Extensive experimental results on two well-known Text-VQA benchmarks (TextVQA and ST-VQA) demonstrate that our proposed TAG effectively enlarges the training data that helps improve the Text-VQA performance without extra labeling effort. Moreover, our model outperforms state-of-the-art approaches that are pre-trained with extra large-scale data. Code is available at https://github.com/HenryJunW/TAG.
연구 동기 및 목표
- 기존 Text-VQA 데이터셋에서 QA 쌍의 레이블링 부족 문제를 해결하기 위해, 이미지 내에 풍부하게 존재하는 현장 텍스트를 효율적으로 활용하고자 한다.
- 인간 레이블링 없이도 미사용된 현장 텍스트를 활용해 다양하고 고품질의 QA 쌍을 생성할 수 있는 방법을 개발하고자 한다.
- OCR 토큰과 시각적 맥락에서 유래한 합성 QA 샘플을 사용해 훈련 데이터를 증강함으로써 Text-VQA 모델 성능을 향상시키고자 한다.
- 텍스트 인식 기반 생성을 통한 데이터 증강이 거대한 외부 데이터로 사전 훈련된 모델들을 능가할 수 있음을 입증하고자 한다.
제안 방법
- TAG는 답변(OCR 토큰), 검출된 객체의 시각적 특징, 현장 텍스트 임베딩을 입력으로 받아 맥락적으로 관련성이 높은 질문을 생성하는 다중모달 트랜스포머 아키텍처를 사용한다.
- 모델은 기존에 레이블링된 QA 쌍으로 훈련되고, 원래 레이블링에 포함되지 않은 OCR 토큰을 사용하여 새로운 QA 쌍을 생성하도록 미세조정된다.
- 품질과 훈련 효율성을 균형 잡기 위해, 입력 답변 선택은 가장 큰 경계 상자(Bounding box)를 가진 OCR 토큰을 선택함으로써 최적화된다.
- 프레임워크는 QA 생성을 최종 VQA 훈련과 분리함으로써 확장 가능한 데이터 증강이 가능하도록 설계되었다.
- 질문의 관련성과 사실적 일관성을 보장하기 위해 객체 검출 및 OCR 출력에서 유도된 시각-의미적 특징을 활용한다.
- 이 방법은 TextVQA 및 ST-VQA에 모두 적용되며, 생성된 QA 쌍은 원본 훈련 데이터와 병합되어 최신 기술 수준의 VQA 모델을 미세조정하는 데 사용된다.
실험 결과
연구 질문
- RQ1이미지 내에 존재하는 활용도가 낮은 현장 텍스트를 인간 레이블링 없이도 고품질이고 다양한 QA 쌍을 생성하는 데 활용할 수 있는가?
- RQ2거대 규모의 데이터로 사전 훈련된 모델들과 비교했을 때, 텍스트 인식 기반 QA 생성은 최종 Text-VQA 성능 향상에 얼마나 효과적인가?
- RQ3시각적 객체, OCR 토큰, 답변 선택 전략이 생성된 QA 쌍의 품질에 기여하는 정도는 어떠한가?
- RQ4TAG를 통한 합성 데이터 증강이 거대한 사전 훈련에 의존하는 기존 최신 기술 수준의 방법들을 능가할 수 있는가?
주요 결과
- TAG는 답변, 객체, OCR 입력을 모두 사용할 경우 TextVQA에서 제약 조건 설정 하에서 52.54%의 검증 정확도를 달성하였으며, 어떤 모odal도 생략한 실험보다 뛰어난 성능을 보였다.
- TAP(140만 개의 추가 사전 훈련 샘플 사용)보다 ST-VQA에서 정확도는 2.70%p 향상되고 ANLS는 0.022 향상되었다.
- 가장 큰 OCR 토큰 3개를 답변 후보로 사용할 경우, 가장 큰 토큰 하나만 사용하는 전략보다 성능이 0.19%p 향상되었지만, 훈련 시간이 증가하는 비용이 수반되었다.
- 절단 실험을 통해 답변, 객체, OCR 세 가지 모달이 모두 필수적임을 확인하였으며, 시각적 및 텍스트 모달을 동시에 제거할 경우 성능이 최대 3.78% 감소하였다.
- ST-VQA 테스트 세트에서 ANLS 점수 0.602를 기록하여, 추가 사전 훈련이나 모델 수정 없이도 새로운 SOTA를 수립하였다.
- 이 방법은 두 벤치마크에서 M4C 및 TAP를 모두 뛰어넘었으며, 거대한 외부 데이터로 사전 훈련된 모델들을 능가하는 합성 데이터 생성의 잠재력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.