Skip to main content
QUICK REVIEW

[논문 리뷰] ArbiText: Arbitrary-Oriented Text Detection in Unconstrained Scene

Daitao Xing, Zichen Li|arXiv (Cornell University)|2017. 11. 30.
Handwritten Text Recognition Techniques참고 문헌 31인용 수 6
한 줄 요약

ArbiText는 SSD 프레임워크 내에서 원형 앵커와 피라미드 풀링 모듈을 사용하여 제약 없는 환경에서 임의의 방향을 가진 텍스트를 제안 없이 단일 스포트 검출기로 처리한다. 직사각형 앵커를 원형 앵커로 대체하고 다중 척도 특징 학습을 통합함으로써, ICDAR 2015에서 75.9%의 F-스코어와 MSRA-TD500에서 75.0%의 F-스코어를 기록하며, 12.1 FPS의 속도를 달성하여 난이도 높은 조건에서 기울어진, 다국어 및 장문 텍스트 검출에 있어 뛰어난 정확도와 효율성을 입증한다.

ABSTRACT

Arbitrary-oriented text detection in the wild is a very challenging task, due to the aspect ratio, scale, orientation, and illumination variations. In this paper, we propose a novel method, namely Arbitrary-oriented Text (or ArbText for short) detector, for efficient text detection in unconstrained natural scene images. Specifically, we first adopt the circle anchors rather than the rectangular ones to represent bounding boxes, which is more robust to orientation variations. Subsequently, we incorporate a pyramid pooling module into the Single Shot MultiBox Detector framework, in order to simultaneously explore the local and global visual information, which can, therefore, generate more confidential detection results. Experiments on established scene-text datasets, such as the ICDAR 2015 and MSRA-TD500 datasets, have demonstrated the supe rior performance of the proposed method, compared to the state-of-the-art approaches.

연구 동기 및 목표

  • 고정되지 않은 자연 환경에서 방향, 척도, 다국어 텍스트를 고정된 정확도와 효율성으로 검출하는 데 도전하는 것.
  • 스트리트 텍스트에서 방향과 종횡비 변화에 대응하기 어려운 직사각형 앵커의 한계를 극복하는 것.
  • 피라미드 풀링 모듈을 통한 局소 및 전역 시각적 특징 융합을 통해 검출의 강건성을 향상시키는 것.
  • 영역 제안 네트워크의 필요성을 제거하여 계산 효율성을 향상시키는 것.
  • 변동 크기의 원형 앵커로 인해 발생하는 모호한 양성 샘플을 처리하기 위해 새로운 마스크 손실 함수를 개발하는 것.

제안 방법

  • 기울어진, 임의의 방향을 가진 텍스트 바운딩 박스를 더 잘 표현하기 위해 직사각형 앵커 대신 원형 앵커를 사용한다.
  • SSD 프레임워크에 피라미드 풀링 모듈을 통합하여 다중 척도 특징을 추출하고 국소적 및 전역적 맥락을 유지한다.
  • 변동 크기의 원형 앵커에 대해 양성 샘플 할당의 모호함을 해결하기 위해 새로운 마스크 클래스를 포함한 수정된 손실 함수를 적용한다.
  • 정규화된 크롭, 수평 반전, 임의의 회전(±15°에서 ±90°)을 포함한 데이터 증강 기법을 적용하여 강건성을 향상시킨다.
  • 중복 검출을 억제하기 위해 후처리 단계에서 국소성 인식 비최대 억제(Locality-Aware Non-Maximum Suppression, LANMS)를 적용한다.
  • 경량 VGG-16 백본을 사용하여 엔드 투 엔드로 학습하고, ICDAR 2015 및 MSRA-TD500 데이터셋에서 미세조정한다.

실험 결과

연구 질문

  • RQ1다양한 척도와 방향에서 임의의 방향을 가진 텍스트 검출에 있어 원형 앵커가 직사각형 앵커를 능가할 수 있는가?
  • RQ2피라미드 풀링 모듈을 통합함으로써 스트리트 텍스트에서 다중 척도 맥락을 포착함으로써 검출 성능이 향상되는가?
  • RQ3제안 없이 단일 스포트 검출기가 높은 추론 속도를 유지하면서도 최신 기술 수준(SOTA)의 정확도를 달성할 수 있는가?
  • RQ4제안된 마스크 손실 함수는 변동 크기의 원형 앵커와 모호한 양성 샘플을 효과적으로 처리하는가?
  • RQ5아키텍처 변경 없이도 장문 텍스트 및 다국어 텍스트, 비라틴 문자를 포함한 텍스트에 일반화할 수 있는가?

주요 결과

  • ArbiText는 ICDAR 2015 Incidental Text 데이터셋에서 75.9%의 F-스코어를 기록하여 이전 SOTA 방법(Seglink)보다 0.9% 포인트 높게 기록한다.
  • MSRA-TD500 데이터셋에서 ArbiText는 F-스코어 75.0%를 기록하며, F-메이저 측정 기준으로 최고 성능을 기록한 방법과 동일한 성능을 달성하면서도 가장 높은 추론 속도인 12.1 FPS를 기록한다.
  • 모델은 하이퍼파라미터 조정 없이도 장문 텍스트 및 다국어 텍스트, 영어와 중국어 혼합 텍스트에 대해 강력한 일반화 성능을 보였다.
  • 원형 앵커의 사용은 특히 곡선이나 기울어진 텍스트 상황에서 방향 변화에 대한 검출 강건성을 크게 향상시켰다.
  • 제안된 마스크 손실 함수는 양성 샘플 할당의 모호함을 효과적으로 해결하여 정밀도와 재현율 향상에 기여했다.
  • 실패 케이스 분석을 통해 곡선형 및 손글씨 텍스트 검출에 한계가 있음을 확인하였으며, 이는 변형 가능한 텍스트 형태를 모델링하는 데 향후 개선 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.