[논문 리뷰] Mask is All You Need: Rethinking Mask R-CNN for Dense and Arbitrary-Shaped Scene Text Detection
이 논문은 밀도 높고 임의의 모양을 가진 시나리오 텍스트 검출을 위한 재구상된 Mask R-CNN 프레임워크인 MAYOR를 제안한다. 이는 마스크 헤드에서의 학습 혼란과 극단적인 종횡비를 가진 텍스트에 대한 앵커 매칭의 열악함이라는 두 가지 핵심 문제를 해결한다. 디컨볼루션-컨볼루션 디코더를 MLP 디코더로 대체하고 인스턴스 인식 마스크 학습을 도입함으로써, MAYOR는 외부 데이터를 사용한 DAST1500에서 88.3%의 F-측정치와 Total-Text에서 88.9%의 F-측정치를 기록하며 다섯 개의 벤치마크에서 최고 성능을 달성한다.
Due to the large success in object detection and instance segmentation, Mask R-CNN attracts great attention and is widely adopted as a strong baseline for arbitrary-shaped scene text detection and spotting. However, two issues remain to be settled. The first is dense text case, which is easy to be neglected but quite practical. There may exist multiple instances in one proposal, which makes it difficult for the mask head to distinguish different instances and degrades the performance. In this work, we argue that the performance degradation results from the learning confusion issue in the mask head. We propose to use an MLP decoder instead of the "deconv-conv" decoder in the mask head, which alleviates the issue and promotes robustness significantly. And we propose instance-aware mask learning in which the mask head learns to predict the shape of the whole instance rather than classify each pixel to text or non-text. With instance-aware mask learning, the mask branch can learn separated and compact masks. The second is that due to large variations in scale and aspect ratio, RPN needs complicated anchor settings, making it hard to maintain and transfer across different datasets. To settle this issue, we propose an adaptive label assignment in which all instances especially those with extreme aspect ratios are guaranteed to be associated with enough anchors. Equipped with these components, the proposed method named MAYOR achieves state-of-the-art performance on five benchmarks including DAST1500, MSRA-TD500, ICDAR2015, CTW1500, and Total-Text.
연구 동기 및 목표
- 한 개의 프포절 내에 여러 인스턴스가 포함되는 밀도 높은 텍스트 케이스에서 Mask R-CNN 기반의 시나리오 텍스트 검출기 성능 저하 문제를 해결하기 위해.
- 한 개의 RoI 내에서 겹치거나 여러 인스턴스가 예측될 때 발생하는 마스크 헤드 내 학습 혼란 문제를 해결하기 위해.
- 고정된 앵커 설계를 적응형 레이블 할당으로 대체하여 종횡비가 극단적인 텍스트 인스턴스에 대한 앵커 매칭을 향상시키기 위해.
- 마스크 브랜치 내에서 전역 인스턴스 표현을 강화함으로써 임의의 모양과 굴곡진 텍스트의 강력한 검출을 가능하게 하기 위해.
제안 방법
- 마스크 헤드의 표준 '디컨볼루션-컨볼루션' 디코더를 특징 혼란을 줄이고 마스크 예측 정밀도를 향상시키기 위해 학습 가능한 MLP 디코더로 교체한다.
- 인스턴스 인식 마스크 학습을 도입하여, 마스크 헤드가 각 픽셀을 텍스트 또는 비텍스트로 분류하는 것이 아니라 전체 인스턴스의 완전한 형태를 예측하도록 한다.
- RPN에서 적응형 레이블 할당(Adaptive Label Assignment, ALA)을 제안하여 종횡비가 극단적인 텍스트 인스턴스가 충분한 앵커와 매칭되도록 하여 학습 안정성과 재현율을 향상시킨다.
- RoI 특징 표현을 활용하여 마스크 헤드가 각 인스턴스에 대해 완전하고, 컴act하며, 분리된 마스크를 재구성하도록 이끈다.
- 정확도와 경계 정밀도를 동시에 최적화하기 위해 마스크 예측에 교차 엔트로피 손실과 딱 손실을 함께 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
- 일반화성을 입증하기 위해 COCO에서 추론 분석을 수행하며, DAST1500, MSRA-TD500, ICDAR2015, CTW1500, Total-Text의 다섯 개 공개 벤치마크에서 방법을 검증한다.
실험 결과
연구 질문
- RQ1디컨볼루션-컨볼루션 디코더를 MLP 디코더로 교체하면 밀도 높은 텍스트 상황에서 마스크 예측 품질에 어떤 영향을 미치는가?
- RQ2인스턴스 인식 마스크 학습이 마스크 헤드 내 학습 혼란을 줄이고 마스크의 컴팩트성 및 분리도를 향상시키는 데 얼마나 기여하는가?
- RQ3적응형 레이블 할당이 종횡비가 극단적인 텍스트 인스턴스의 검출 성능을 얼마나 향상시키는가?
- RQ4기존 최고 성능 기준 모델들과 비교해 볼 때, 제안된 방법은 임의의 모양과 굴곡진 텍스트 검출에서 어떤 성능을 보이는가?
- RQ5제안된 프레임워크는 시나리오 텍스트 검출을 넘어 일반 인스턴스 세그멘테이션 벤치마크인 COCO에서도 일반화가 가능한가?
주요 결과
- MAYOR는 DAST1500에서 88.3%의 F-측정치를 기록하며 이전 최고 성능 기준 모델들보다 유의미한 격차를 확보하며 최고 성능을 달성한다.
- CTW1500에서는 외부 데이터 없이 85.3%의 F-측정치, MLT 사전학습을 적용하면 86.1%의 F-측정치를 기록하며, TextSnake나 DB와 같은 기존 방법들을 능가한다.
- Total-Text에서는 외부 데이터 없이 86.3%의 F-측정치, MLT 사전학습을 적용하면 88.9%의 F-측정치를 기록하며, SD보다 2% 높은 성능을 기록하고 새로운 최고 성능을 수립한다.
- 모델은 분할 예측을 줄임으로써 COCO에서 마스크 AP를 35.1%에서 35.6%로 향상시켜 긴, 얇은 인스턴스에 대한 일반화 능력을 입증한다.
- 추론 분석 결과, MLP 디코더와 인스턴스 인식 마스크 학습 모두 밀도 높고 굴곡진 텍스트 상황에서 성능 향상에 크게 기여함을 확인했다.
- 적응형 레이블 할당 메커니즘이 긴, 얇은 텍스트에 대해 양성 샘플 할당을 효과적으로 증가시켜 재현율과 다양한 데이터셋에서의 강건성을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.