[논문 리뷰] Mask TextSpotter v3: Segmentation Proposal Network for Robust Scene Text Spotting
Mask TextSpotter v3는 종단 간 스크린 텍스트 스포팅에서 앵커 기반 RPN을 대체하기 위해 세그멘테이션 프로포절 네트워크(SPN)를 도입하여 임의의 형태와 회전된 텍스트 인스턴스에 대해 정확하고 다각형 형태의 프로포절을 가능하게 한다. SPN에서 생성한 프로포절에 하드 RoI 마스킹을 적용함으로써 배경 노이즈와 인접한 텍스트 인스턴스를 억제하고, 최신 기술 수준의 성능을 달성하여 Rotated ICDAR 2013에서 21.9%, Total-Text에서 5.9%, IC15에서 7.1% 향상된 성능을 기록하였다. 일반 어휘를 사용한 결과이다.
Recent end-to-end trainable methods for scene text spotting, integrating detection and recognition, showed much progress. However, most of the current arbitrary-shape scene text spotters use region proposal networks (RPN) to produce proposals. RPN relies heavily on manually designed anchors and its proposals are represented with axis-aligned rectangles. The former presents difficulties in handling text instances of extreme aspect ratios or irregular shapes, and the latter often includes multiple neighboring instances into a single proposal, in cases of densely oriented text. To tackle these problems, we propose Mask TextSpotter v3, an end-to-end trainable scene text spotter that adopts a Segmentation Proposal Network (SPN) instead of an RPN. Our SPN is anchor-free and gives accurate representations of arbitrary-shape proposals. It is therefore superior to RPN in detecting text instances of extreme aspect ratios or irregular shapes. Furthermore, the accurate proposals produced by SPN allow masked RoI features to be used for decoupling neighboring text instances. As a result, our Mask TextSpotter v3 can handle text instances of extreme aspect ratios or irregular shapes, and its recognition accuracy won't be affected by nearby text or background noise. Specifically, we outperform state-of-the-art methods by 21.9 percent on the Rotated ICDAR 2013 dataset (rotation robustness), 5.9 percent on the Total-Text dataset (shape robustness), and achieve state-of-the-art performance on the MSRA-TD500 dataset (aspect ratio robustness). Code is available at: https://github.com/MhLiao/MaskTextSpotterV3
연구 동기 및 목표
- 극단적인 종횡비, 비정규형 형태, 고밀도 방향성을 가진 텍스트를 탐지하는 데 있어 RPN 기반 방법의 한계를 해결한다.
- RPN이 생성하는 축에 맞춰진 직사각형 프로포절이 여러 텍스트 인스턴스를 하나의 RoI로 통합하는 문제를 해결한다.
- 정확한 다각형 프로포절을 통해 인접한 텍스트 인스턴스를 분리함으로써 인식의 강건성을 향상시킨다.
- 수동으로 설계된 앵커가 없는 프로포절 네트워크를 개발하고, 임의의 형태 텍스트 탐지에 대응한다.
- 다양한 과제를 수반하는 벤치마크에서 뛰어난 성능을 달성한다: 회전, 종횡비, 형태, 소형 텍스트 인스턴스
제안 방법
- 앵커 없는 SPN을 제안하여 축에 맞춰진 직사각형 대신 정확한 다각형 프로포절을 생성한다.
- SPN을 활용해 극단적인 종횡비 또는 비정규형 형태의 텍스트 인스턴스와 더 잘 맞는 정밀한 임의의 형태 프로포절을 생성한다.
- SPN에서 생성한 프로포절에 하드 RoI 마스킹을 적용하여 배경 노이즈와 인접한 텍스트 인스턴스를 억제한다.
- SPN을 Mask TextSpotter v2 프레임워크에 통합하여 종단 간 훈련이 가능한 스크린 텍스트 스포터를 구축한다.
- 마스킹된 RoI 특징을 인식에 활용하여 각 RoI가 단일 텍스트 인스턴스만 포함하도록 보장한다.
- 다양한 형태의 텍스트 인스턴스를 정확히 탐지하고 인식하기 위해 다각형 애너테이션을 활용한 통합 아키텍처로 종단 간 훈련을 수행한다.
실험 결과
연구 질문
- RQ1앵커 없는 프로포절 네트워크가 자연 환경에서 임의의 형태와 회전된 텍스트의 탐지 및 인식을 향상시킬 수 있는가?
- RQ2RPN을 SPN으로 대체함으로써 특히 고밀도 방향성 환경에서 여러 텍스트 인스턴스가 하나의 RoI로 통합되는 현상을 줄일 수 있는가?
- RQ3SPN에서 생성한 프로포절에 하드 RoI 마스킹을 적용하면 개별 텍스트 인스턴스를 분리함으로써 인식 정확도를 향상시킬 수 있는가?
- RQ4극단적인 종횡비, 비정규형 형태, 소형 텍스트 인스턴스를 포함한 벤치마크에서 제안된 방법의 성능은 어떠한가?
- RQ5RPN 기반 최신 기술 수준의 방법에 비해 SPN 기반 접근 방식이 얼마나 강건성을 향상시키는가?
주요 결과
- Mask TextSpotter v3는 Rotated ICDAR 2013 데이터셋에서 21.9%의 상대적 향상을 기록하여 뛰어난 회전 강건성을 입증하였다.
- Total-Text 데이터셋에서 인식 F-측정치가 5.9% 향상되어 비정규형 형태 텍스트에 대한 형태 강건성이 향상됨을 확인하였다.
- MSRA-TD500 데이터셋에서 최신 기술 수준의 성능을 달성하여 장거리 텍스트 라인에서 극단적인 종횡비에 대한 강건성을 입증하였다.
- 9만 개의 일반 어휘를 사용하여 IC15 데이터셋에서 TextDragon을 7.1% 초월하여 소형 및 저해상도 텍스트 인스턴스에서 뛰어난 성능을 보였다.
- SPN 기반 하드 RoI 마스킹은 네 가지 아블레이션 변형 중에서 최고의 성능을 기록하여 개별 텍스트 인스턴스를 효과적으로 분리함을 입증하였다.
- 극단적인 회전 각도인 90°에서도 높은 정확도를 유지하지만, 인식 방향의 모호성으로 인해 약간의 오류가 남아 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.