[논문 리뷰] MSR: Multi-Scale Shape Regression for Scene Text Detection
이 논문은 장면 텍스트 검출을 위한 다중 척도 형태 회귀 네트워크인 MSR을 제안한다. 이는 사각형의 꼭짓점 대신 조밀한 경계점 예측을 통해 길이와 방향이 다양한 직선 및 곡선 텍스트 라인의 정확한 국소화를 가능하게 한다. 가장 가까운 경계점으로 회귀하고 다중 척도 특징을 융합함으로써 MSR은 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성했으며, CTW1500에서 기준 모델 대비 21.1점의 f-스코어 향상을 기록했고, ICDAR2015 및 MSRA-TD500에서도 뛰어난 성능을 보였다.
State-of-the-art scene text detection techniques predict quadrilateral boxes that are prone to localization errors while dealing with straight or curved text lines of different orientations and lengths in scenes. This paper presents a novel multi-scale shape regression network (MSR) that is capable of locating text lines of different lengths, shapes and curvatures in scenes. The proposed MSR detects scene texts by predicting dense text boundary points that inherently capture the location and shape of text lines accurately and are also more tolerant to the variation of text line length as compared with the state of the arts using proposals or segmentation. Additionally, the multi-scale network extracts and fuses features at different scales which demonstrates superb tolerance to the text scale variation. Extensive experiments over several public datasets show that the proposed MSR obtains superior detection performance for both curved and straight text lines of different lengths and orientations.
연구 동기 및 목표
- 긴 곡선 또는 기울어진 텍스트 라인의 국소화 정확도를 높이기 위해 사각형 기반 검출의 높은 회귀 오차 문제를 해결하기 위해.
- 초소형 또는 초거대 텍스트가 자주 누락되거나 부분적으로 검출되는 장면 텍스트의 큰 척도 변동 문제를 해결하기 위해.
- 특히 곡선 및 비정규적인 방향을 가진 라인에 대해 꼭짓점 예측을 대체하여 경계점 회귀로 전환함으로써 텍스트 형태 다양성에 대한 강건성을 향상시키기 위해.
- 다양한 텍스트 크기에 대응하기 위해 다양한 척도에서 특징을 융합하는 다중 척도 네트워크를 설계하여 검출 성능 향상시키기 위해.
- 다양한 데이터셋에서 직선 및 곡선 텍스트 라인에 대해 뛰어난 검출 정확도를 달성하는 엔드 투 엔드 학습 가능한 시스템을 개발하기 위해.
제안 방법
- 각 텍스트 픽셀을 가장 가까운 경계점으로 회귀하는 형태 회귀 모듈을 제안하여 정확한 텍스트 국소화를 위한 조밀한 경계점 생성하기.
- 예측된 모든 경계점을 연결하여 형성된 오목 다각형을 사용해 전체 텍스트 인스턴스를 표현함으로써 유연한 형태 모델링 가능하게 하기.
- 다양한 수신장 크기를 가진 특징을 추출하고 융합하기 위해 병렬 브랜치를 가진 다중 척도 네트워크 도입하여 척도 변동에 대한 강건성 향상시키기.
- 저수준 및 고수준 특징을 다양한 척도 간에 융합하는 다중 척도 특징 융합 전략을 적용하여 소형 및 대형 텍스트 인스턴스 검출 성능 향상시키기.
- 경계점 회귀 손실과 형태 일관성 손실을 포함하는 병합된 손실 함수를 사용해 전체 네트워크를 엔드 투 엔드로 학습시키기.
- 기준 모델로 EAST 프레임워크를 활용하고 다중 척도 아키텍처 및 형태 회귀를 추가하여 직접 비교 및 분석가능하게 하기.
실험 결과
연구 질문
- RQ1사각형 꼭짓점 예측 대비 조밀한 경계점 회귀가 긴 또는 곡선 텍스트 라인의 국소화 오차를 줄이는 데 효과적인가?
- RQ2다중 척도 특징 융합이 텍스트 크기의 큰 변동에 대응하여 검출 성능 향상에 얼마나 효과적인가?
- RQ3형태 회귀와 다중 척도 아키텍처를 결합함으로써 다양한 장면 텍스트 데이터셋에서 일관된 성능 향상이 이루어지는가?
- RQ4제안된 방법이 사각형 상자에 의존하는 최신 기술 수준의 방법보다 직선 및 곡선 텍스트 라인 모두 더 높은 정확도로 검출할 수 있는가?
- RQ5다중 척도 네트워크와 형태 회귀 각각이 전체 검출 성능에 기여하는 정도는 어떠한가?
주요 결과
- CTW1500에서 제안된 MSR은 f-스코어 81.5를 기록했으며, 기준 모델인 EAST 모델(60.4) 대비 21.1점 향상되어 다중 척도 및 형태 회귀 요소를 병합함으로써 큰 성과를 달성했다.
- MSRA-TD500에서 MSR은 최신 기술 수준의 f-스코어를 달성했으며, 특히 곡선 및 긴 텍스트 라인 검출에서 TextSnake와 같은 전용 방법보다 최대 3.4점 높은 성능를 보였다.
- 절단 분석 결과, 형태 회귀만으로도 f-스코어가 17.0점 향상되었고, 다중 척도만으로도 6.9점 향상되었으며, 두 요소의 조합 시 가장 높은 성능 향상을 기록했다.
- CTW1500에서 MSR은 높은 재현율(78.3%)과 정밀도(85.0%)를 기록하여 소형 및 대형 텍스트 인스턴스 모두에 대해 강력한 성능를 보였다.
- ICDAR2015에서 MSR은 단일 척도 테스트에서도 경쟁 가능한 정확도와 속도를 확보하여 직선 및 다중 방향 텍스트 라인을 포함한 다양한 데이터셋에 넓은 적용 가능성을 보였다.
- 시각적 결과에서 MSR은 기준 모델 및 다른 최신 기술 수준 방법 대비 긴 또는 곡선 라인에서 끊어진 또는 누락된 검출을 줄이는 데 성공했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.