[논문 리뷰] MixNet: Toward Accurate Detection of Challenging Scene Text in the Wild
MixNet는 어려운 실생활 조건에서 작은, 굽은, 다중 방향의 시나리오 텍스트를 정확하게 검출하기 위해 하이브리드 CNN-Transformer 아키텍처를 제안한다. 고해상도 특징 추출을 위한 특징 셔플 네트워크(FSNet)와 텍스트 중심선을 모델링하는 중심 트랜스포머 블록(CTBlock)을 결합함으로써, Total-Text에서 90.5%의 F1 스코어와 ArT에서 79.7%의 F1 스코어를 기록하며 여러 시나리오 텍스트 검출 벤치마크에서 최고 성능을 달성한다.
Detecting small scene text instances in the wild is particularly challenging, where the influence of irregular positions and nonideal lighting often leads to detection errors. We present MixNet, a hybrid architecture that combines the strengths of CNNs and Transformers, capable of accurately detecting small text from challenging natural scenes, regardless of the orientations, styles, and lighting conditions. MixNet incorporates two key modules: (1) the Feature Shuffle Network (FSNet) to serve as the backbone and (2) the Central Transformer Block (CTBlock) to exploit the 1D manifold constraint of the scene text. We first introduce a novel feature shuffling strategy in FSNet to facilitate the exchange of features across multiple scales, generating high-resolution features superior to popular ResNet and HRNet. The FSNet backbone has achieved significant improvements over many existing text detection methods, including PAN, DB, and FAST. Then we design a complementary CTBlock to leverage center line based features similar to the medial axis of text regions and show that it can outperform contour-based approaches in challenging cases when small scene texts appear closely. Extensive experimental results show that MixNet, which mixes FSNet with CTBlock, achieves state-of-the-art results on multiple scene text detection datasets.
연구 동기 및 목표
- 불규칙한 조명과 노이즈가 있는 실생활 환경에서 작은, 굽은, 다중 방향의 시나리오 텍스트를 검출하는 과제를 해결한다.
- ResNet과 HRNet와 같은 표준 CNN 백본의 고해상도 특징 유지 및 노이즈 간섭 감소의 한계를 극복한다.
- 윤곽 기반 방법을 초월해 전반적인 기하학적 구조를 모델링함으로써 임의의 형태를 가진 텍스트의 검출 정확도를 향상시킨다.
- CNN의 국소적 특징 추출 능력과 트랜스포머의 전반적 공간 추론 능력을 활용하는 하이브리드 아키텍처를 개발한다.
제안 방법
- 컨볼루션 특징 추출 중 저해상도 및 고해상도 특징 맵 간의 특징 교환을 가능하게 하는 특징 셔플 네트워크(FSNet)를 제안한다.
- FSNet 내에서 고해상도 특징 학습을 깊이 있게 만들고 특징 표현 품질을 향상시키기 위해 새로운 특징 셔플 전략을 도입한다.
- 텍스트 중심선과 윤곽을 따라 특징를 샘플링하여 전반적인 기하학적 레이아웃을 모델링하는 중심 트랜스포머 블록(CTBlock)을 설계한다.
- 후처리된 히트맵을 사용해 원초기 텍스트 윤곽을 추출하고, 중심선 특징을 샘플링하여 트랜스포머에 입력해 경계를 정밀하게 보정한다.
- 초기 윤곽에 학습된 정점 오프셋을 적용하여 정밀한 최종 텍스트 마스크를 생성한다.
- FSNet을 백본으로 사용하고 CTBlock을 결합하여 엔드 투 엔드 시나리오 텍스트 검출을 구현함으로써 척도 불변성과 노이즈에 강한 특징 학습을 가능하게 한다.
실험 결과
연구 질문
- RQ1깊은 신경망 아키텍처는 소규모 시나리오 텍스트 검출을 위한 고해상도 특징 표현을 향상시키면서도 노이즈 민감도를 줄일 수 있는가?
- RQ2윤곽 대신 중심선을 모델링할 경우, 조밀하게 배치되거나 굽은 텍스트 영역에서 검출 정확도에 어떤 영향을 미치는가?
- RQ3하이브리드 CNN-Transformer 아키텍처는 기존의 최고 성능 방법보다 임의의 형태를 가진 시나리오 텍스트 검출 벤치마크에서 승리할 수 있는가?
- RQ4FSNet 내의 제안된 특징 셔플 메커니즘은 ResNet과 HRNet와 같은 표준 백본에 비해 특징 품질과 검출 성능 측면에서 어떻게 비교되는가?
주요 결과
- MixNet는 Total-Text 데이터셋에서 기존 방법보다 1.5%포인트 높은 새로운 SOTA F1 스코어 90.5%를 기록한다.
- ArT 데이터셋에서 MixNet는 F1 스코어 79.7%를 달성하여 TextFuseNet 대비 재현율 3.9%포인트 향상과 F1 스코어 1.1%포인트 향상을 기록한다.
- MSRA-TD500에서 MixNet는 다중 방향 텍스트 검출에 대해 기존 방법 대비 2.1%포인트 향상된 F-측정치 89.4%를 달성한다.
- FSNet 백본은 기준 모델에 통합될 때 ResNet50 대비 검출 F1 스코어를 2.1%포인트 향상시킨다.
- FSNet 백본에 CTBlock 컴포넌트를 추가하면 F1 스코어가 추가로 0.5%포인트 향상된다.
- 다양한 데이터셋에서의 정성적 예시를 통해 MixNet는 소형, 굽은, 조밀하게 배열된 텍스트 검출에서 일관된 우수성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.