[논문 리뷰] From Two to One: A New Scene Text Recognizer with Visual Language Modeling Network
이 논문은 시각적 및 언어적 이해를 통합함으로써 훈련 중에 비전 모델에 내재된 언어 능력을 부여함으로써 새로운 시나리오 텍스트 인식기인 VisionLAN을 제안한다. 문자가 가림되는 것을 시뮬레이션하기 위해 마스크된 언어 인식 모듈을 사용하고, 맥락을 활용하기 위해 시각적 추론 모듈을 도입함으로써, 외부 언어 모델이 필요 없이 일괄적이고 효율적이며 강건한 텍스트 인식을 실현하는 동시에, 39% 빠른 추론 속도를 달성한다.
In this paper, we abandon the dominant complex language model and rethink the linguistic learning process in the scene text recognition. Different from previous methods considering the visual and linguistic information in two separate structures, we propose a Visual Language Modeling Network (VisionLAN), which views the visual and linguistic information as a union by directly enduing the vision model with language capability. Specially, we introduce the text recognition of character-wise occluded feature maps in the training stage. Such operation guides the vision model to use not only the visual texture of characters, but also the linguistic information in visual context for recognition when the visual cues are confused (e.g. occlusion, noise, etc.). As the linguistic information is acquired along with visual features without the need of extra language model, VisionLAN significantly improves the speed by 39% and adaptively considers the linguistic information to enhance the visual features for accurate recognition. Furthermore, an Occlusion Scene Text (OST) dataset is proposed to evaluate the performance on the case of missing character-wise visual cues. The state of-the-art results on several benchmarks prove our effectiveness. Code and dataset are available at https://github.com/wangyuxin87/VisionLAN.
연구 동기 및 목표
- 기존의 이단계 시나리오 텍스트 인식 방법에서의 비효율성과 시각적 및 언어적 정보의 열악한 융합 문제를 해결하기 위해.
- 외부 언어 모델에 의존하는 것을 줄이기 위해, 훈련 중에 비전 모델이 자율적으로 언어 맥락을 학습하고 활용할 수 있도록 하기 위해.
- 가림, 노이즈, 흐림과 같은 도전적인 조건에서도 텍스트 인식의 강건성을 향상시키기 위해.
- 문자 수준의 시각적 신호가 손실된 상황에서의 성능 평가를 위한 새로운 벤치마크인 OST를 제안하기 위해.
- 언어 모델링을 비전 기반 아키텍처에 직접 통합함으로써, 고속과 고정확도를 유지하는 일괄적 인식 파이프라인을 구현하기 위해.
제안 방법
- 비전 모델이 훈련 중에 언어 맥락을 추론할 수 있도록 하는 통합 아키텍처인 시각 언어 모델링 네트워크(VisionLAN)를 도입한다.
- 지표 문자 인덱스를 기반으로 문자 수준의 마스크 맵을 생성하는 마스크된 언어 인식 모듈(MLM)을 활용하여, 훈련 중에 시각적 가림을 시뮬레이션한다.
- 가려진 시각적 특징에서 텍스트를 예측하기 위해 시각적 추론 모듈(VRM)을 사용함으로써, 모델이 직접 시각 공간 내에서 맥락 기반 언어적 종속성을 학습할 수 있도록 한다.
- 시각적 신호가 열악해졌을 때 언어 맥락을 활용해 특징을 적응적으로 향상시키도록 비전 모델을 훈련함으로써, 추론 시 외부 언어 모델이 필요 없도록 한다.
- 약한 지도 기반 보완 학습을 활용하여, 위치와 맥락에 기반해 누락된 문자 신호를 국소화하는 유의미한 마스크 맵을 생성한다.
- 테스트 시점에 MLM을 제거하고, 향상된 특징을 가진 비전 모델만 사용함으로써 언어 모델링에 추가적인 계산 비용이 발생하지 않도록 한다.
실험 결과
연구 질문
- RQ1비전 모델이 훈련 중에 자율적으로 언어 맥락을 학습하고 활용함으로써, 시각적 열악성 상황에서도 인식 성능을 향상시킬 수 있는가?
- RQ2단일 네트워크 아키텍처 내에서 시각적 및 언어적 모델링을 통합함으로써, 이단계 접근 방식에 비해 계산 비용을 줄이고 정확도를 향상시킬 수 있는가?
- RQ3문자 수준의 시각적 특징이 손실되거나 손상되었을 경우, 제안된 방법이 얼마나 효과적으로 텍스트를 인식할 수 있는가?
- RQ4장문의 텍스트나 라틴 알파벳 외의 언어, 예를 들어 중국어와 같은 언어에 대해서도 모델이 일반화 가능한가?
- RQ5비전 특징 공간 내에서 언어 맥락을 종합적으로 학습함으로써 모델 성능이 얼마나 향상되는가?
주요 결과
- VisionLAN은 단일 네트워크 내에서 시각적 및 언어적 정보를 통합함으로써 기준 모델 대비 평균 정확도를 7.3% 향상시켰다.
- 외부 언어 모델이 필요 없어지면서 이전의 이단계 접근 방식에 비해 추론 속도가 39% 향상되었다.
- 장문의 중국어 벤치마크인 TRW15에서 VisionLAN은 88.7%의 정확도를 기록하여 이전의 SOTA(SRN)보다 3.2% 높은 성능을 보였다.
- 제안된 오클루전 시나리오 텍스트(OST) 데이터셋에서 VisionLAN은 손실된 문자 수준의 시각적 신호를 처리하는 데 있어 뛰어난 강건성을 입증했다.
- 정성적 결과에서 VisionLAN은 'e'와 'f'와 같은 혼동하기 쉬운 문자를 올바르게 식별하고, 맥락 기반으로 배경 간섭을 억제하는 데 성공했다.
- 마스크된 언어 인식 모듈은 문자 수준의 시각적 신호를 성공적으로 국소화했으며, 왜곡되거나 반복된 문자에 대해서도 일반화 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.