[논문 리뷰] Mask R-CNN with Pyramid Attention Network for Scene Text Detection
이 논문은 다중 방향성(IA-2015, ICDAR-2017 MLT) 및 곡선 문자(Scut-CTW1500) 벤치마크에서 단일 스케일, 단일 모델 추론만을 사용하여 최신 기술 성능(SOTA)을 달성하기 위해 피라미드 주의망(PAN) 백본을 통합한 마스크 R-CNN 기반의 시나리오 텍스트 검출 프레임워크를 제안한다. 이는 특징 표현을 향상시키고 텍스트 유사 배경으로 인한 잘못된 경고를 억제하기 위해 개선된 특징 표현을 제공한다.
In this paper, we present a new Mask R-CNN based text detection approach which can robustly detect multi-oriented and curved text from natural scene images in a unified manner. To enhance the feature representation ability of Mask R-CNN for text detection tasks, we propose to use the Pyramid Attention Network (PAN) as a new backbone network of Mask R-CNN. Experiments demonstrate that PAN can suppress false alarms caused by text-like backgrounds more effectively. Our proposed approach has achieved superior performance on both multi-oriented (ICDAR-2015, ICDAR-2017 MLT) and curved (SCUT-CTW1500) text detection benchmark tasks by only using single-scale and single-model testing.
연구 동기 및 목표
- 고정밀도와 높은 내성으로 자연 풍경 이미지 내의 다중 방향성 및 곡선 문자를 검출하는 과제를 해결하기 위해.
- 표준 백본 대신 피라미드 주의망(PAN)을 사용하여 마스크 R-CNN의 특징 표현을 향상시켜 텍스트 검출 성능을 개선하기 위해.
- 강화된 특징 학습을 통해 텍스트 유사 배경 패턴으로 인한 잘못된 경고를 줄이기 위해.
- 다중 스케일 테스트나 인식 헤드 통합에 의존하지 않고도 표준 벤치마크에서 최신 기술 성능을 달성하기 위해.
제안 방법
- 마스크 R-CNN의 특징 계층과 표현을 향상시키기 위해 피라미드 주의망(PAN)을 새로운 백본으로 통합한다.
- PAN의 크로스 스케일 특징 집합 및 주의 메커니즘을 활용하여 복잡한 형태의 텍스트 인스턴스 검출 성능을 향상시킨다.
- 통합된 인스턴스 세그멘테이션 프레임워크를 통해 마스크 예측을 통해 직선 및 곡선 텍스트를 동시에 검출한다.
- 다중 스케일 또는 앙상블 추론이 필요 없도록 단일 스케일 테스트를 사용하는 단일 모델 추론을 구현한다.
- 표준 마스크 R-CNN 아키텍처를 유지하되, 특징 추출기만 PAN으로 교체하여 개선된 특징 학습을 달성한다.
- 시나리오 텍스트 데이터셋에서 표준 검출 및 세그멘테이션 헤드를 사용하여 엔드 투 엔드 학습을 수행한다.
실험 결과
연구 질문
- RQ1표준 백본 대비 PAN이 마스크 R-CNN의 특징 표현을 시나리오 텍스트 검출에 있어 향상시키는가?
- RQ2제안된 방법은 텍스트 유사 배경으로 인한 잘못된 경고를 효과적으로 억제하는가?
- RQ3단일 스케일, 단일 모델 추론만을 사용하여 다중 방향성 및 곡선 텍스트 검출 벤치마크에서 최신 기술 성능을 달성할 수 있는가?
- RQ4ICDAR-2015, ICDAR-2017 MLT 및 SCUT-CTW1500에서 PAN을 통한 마스크 R-CNN는 이전의 최신 기술 방법과 비교해 어떻게 성능을 내는가?
주요 결과
- ICDAR-2017 MLT에서 제안된 방법은 다중 스케일 테스트 없이도 F-측정치 0.743을 기록하여 가장 가까운 이전 방법(0.707)을 초월한다.
- ICDAR-2015에서 모델은 재현율 0.815, 정밀도 0.908을 기록한 F-측정치 0.859를 달성했으며, 이는 이 벤치마크에서 보고된 최고 성능이다.
- SCUT-CTW1500에서 모델은 F-측정치 0.850을 기록하여 새로운 SOTA를 수립했으며, 이는 이전 방법들(예: CTD+TLOC의 0.734)을 크게 앞서며 성능을 뛰어넘었다.
- 모든 데이터셋에서 PAN은 FPN보다 일관되게 뛰어난 성능을 보였으며, ICDAR-2017 MLT에서 ResNet50를 사용할 경우 정밀도가 4.3%p 상승했다.
- 정성적 결과 분석을 통해 PAN은 텍스트처럼 보이는 무늬(예: 텍스트 유사 무늬)로 인한 잘못된 경고를 효과적으로 억제하는 것으로 나타났다.
- 곡선, 다중 방향성, 저해상도 텍스트 유형에 걸쳐 뛰어난 성능 유지를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.