[논문 리뷰] Structured Multimodal Attentions for TextVQA
이 논문은 시각적 객체, OCR 토큰, 그리고 그들 간의 상호관계를 이질적인 그래프 주의망을 통해 공동으로 추론함으로써 텍스트 기반 시각질문응답을 향상시키는 엔드 투 엔드 모델인 구조화된 다중모odal 주의(SMA)를 제안한다. SMA는 질문 조건에 맞는 그래프 주의망과 반복적 답변 생성을 통합하여 TextVQA와 ST-VQA에서 최신 기준 성능을 달성하며, 이는 이전 방법들을 능가하고 TextVQA 챌린지 2020에서 1등을 차지했다.
In this paper, we propose an end-to-end structured multimodal attention (SMA) neural network to mainly solve the first two issues above. SMA first uses a structural graph representation to encode the object-object, object-text and text-text relationships appearing in the image, and then designs a multimodal graph attention network to reason over it. Finally, the outputs from the above modules are processed by a global-local attentional answering module to produce an answer splicing together tokens from both OCR and general vocabulary iteratively by following M4C. Our proposed model outperforms the SoTA models on TextVQA dataset and two tasks of ST-VQA dataset among all models except pre-training based TAP. Demonstrating strong reasoning ability, it also won first place in TextVQA Challenge 2020. We extensively test different OCR methods on several reasoning models and investigate the impact of gradually increased OCR performance on TextVQA benchmark. With better OCR results, different models share dramatic improvement over the VQA accuracy, but our model benefits most blessed by strong textual-visual reasoning ability. To grant our method an upper bound and make a fair testing base available for further works, we also provide human-annotated ground-truth OCR annotations for the TextVQA dataset, which were not given in the original release. The code and ground-truth OCR annotations for the TextVQA dataset are available at https://github.com/ChenyuGAO-CS/SMA
연구 동기 및 목표
- 특히 OCR 기반 추론에 있어 최신 기준 VQA 모델의 이미지 내 텍스트 읽기 및 추론 능력의 한계를 해결한다.
- 구조화된 그래프를 사용하여 객체, 텍스트, 그리고 그 상호작용 간의 복잡한 관계를 모델링함으로써 다중모달 추론을 향상시킨다.
- 기존의 분류형 답변 헤드의 제약을 극복하기 위해 M4C에서 영감을 얻은 반복적이고 생성형 답변 생성 메커니즘을 채택한다.
- OCR 오류로부터 추론 성능을 분리하기 위해 인간이 애너테이션한 참조값 OCR 애너테이션을 제공함으로써 TextVQA에 대한 공정한 벤치마크를 확립한다.
- OCR 품질이 전체 VQA 정확도에 미치는 영향을 조사하고, 더 나은 추론 모델이 향상된 OCR에서 더 큰 이점을 얻는다는 점을 입증한다.
제안 방법
- 질문을 여섯 가지 구성요소로 분해하는 질문 자기주의 모듈을 제안한다: 객체, 객체-객체, 객체-텍스트, 텍스트, 텍스트-텍스트, 텍스트-객체 관계.
- 상대적 거리와 질문 구성요소를 기반으로 객체와 OCR 토큰을 노드로, 관계(예: 공간적, 의미적)를 간선으로 하는 이질적 그래프를 구축한다.
- 질문 유도 특징을 사용하여 특정 노드 및 간선 유형의 주의 업데이트를 안내하는 질문 조건에 맞는 그래프 주의망(GCN)을 적용한다.
- 전체적 맥락(질문, 객체, 텍스트)과 국소적 OCR 임베딩을 결합하여 반복적으로 답변을 생성하는 글로벌-로컬 주의 기반 답변 모듈을 도입하며, 성능 향상을 위해 일반적인 <begin> 토큰 대신 요약된 특징으로 대체한다.
- OCR 토큰과 일반 어휘에 대한 주의를 통해 반복적 디코딩을 수행함으로써 탄력적이고 다중 토큰 답변 생성이 가능하게 한다.
- 인간이 애너테이션한 참조값 OCR을 사용한 새로운 상한 평가 기법을 활용하여 추론 성능를 OCR 품질에서 분리한다.
실험 결과
연구 질문
- RQ1시각적 객체, OCR 토큰, 그리고 그 상호작용 간의 관계를 명시적으로 모델링함으로써 TextVQA에 대한 다중모달 추론을 어떻게 향상시킬 수 있는가?
- RQ2표준 주의 메커니즘과 비교했을 때 질문 인식 그래프 주의망을 통합함으로써 다중모달 VQA에서 답변 생성 성능는 얼마나 향상되는가?
- RQ3OCR 정확도가 향상될수록 추론 모델의 성능는 어떻게 변화하는가? 그리고 제안된 모델은 더 나은 OCR에서 비례 이상의 이점을 얻는가?
- RQ4OCR 오류가 제거된 상황에서 TextVQA의 진정한 추론 성능 상한은 무엇이며, 인간 성능과 비교해보면 어떠한가?
- RQ5TextVQA와 같은 오픈 어휘, 다중 토큰 답변 설정에서 생성형, 반복적 답변 생성 메커니즘이 분류형 기반 모델을 능가할 수 있는가?
주요 결과
- SMA는 TextVQA 검증 세트에서 50.8%의 ANLS 점수를 기록하여, 전부 pretraining을 사용하지 않은 모델들보다 뛰어나며, TextVQA 챌린지 2020에서 1등을 차지했다.
- ST-VQA 데이터셋에서 SMA는 첫 번째 두 번째 작업(강력한 및 약한 맥락화)에서 새로운 최고 성능을 기록했으며, 각각 0.483과 0.486의 ANLS 점수를 기록했고, 오픈 어휘 작업에서도 경쟁력 있는 성능을 보였다.
- 참조값 OCR을 사용할 경우, SMA는 TextVQA에서 68.81%의 상한 정확도를 기록했으며, 이는 모델의 추론 능력이 여전히 인간 수준 성능에 크게 못 미친다는 것을 보여준다.
- 참조값 OCR을 사용했을 때 9.68%의 정확도 향상을 기록했으며, 이는 LoRRA(5.72%)와 M4C(8.51%)보다 뚜렷이 높은 수준으로, 더 뛰어난 추론 및 답변 능력을 지닌다는 것을 시사한다.
- 제안된 글로벌-로컬 주의 모듈은 일반적인 <begin> 토큰 대신 요약된 전반적 특징을 통합함으로써 원본 M4C 베이스라인 대비 약 0.5% 성능 향상을 이뤘다.
- SBD-Trans OCR는 Rosetta-ml과 Rosetta-en을 능가하며, Hmean 값이 0.5244를 기록했고, 이를 사용하는 모델들은 특히 SMA처럼 더 나은 OCR 품질에서 가장 큰 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.