Skip to main content
QUICK REVIEW

[논문 리뷰] Few Could Be Better Than All: Feature Sampling and Grouping for Scene Text Detection

Jingqun Tang, Wenqing Zhang|arXiv (Cornell University)|2022. 03. 29.
Handwritten Text Recognition Techniques인용 수 11
한 줄 요약

이 논문은 다중 척도 특징 맵에서 몇 가지 대표적인 특징만 선택함으로써 배경 노이즈와 계산 비용을 크게 줄이는 새로운 트랜스포머 기반의 시나리오 텍스트 검출 프레임워크를 제안한다. 샘플링된 특징들을 트랜스포머를 통해 군집화함으로써, NMS와 같은 후처리 작업 없이도 다양한 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 극단적인 척도 및 종횡비 변동이 있는 데이터셋에서 뛰어난 정확도와 효율성을 입증한다.

ABSTRACT

Recently, transformer-based methods have achieved promising progresses in object detection, as they can eliminate the post-processes like NMS and enrich the deep representations. However, these methods cannot well cope with scene text due to its extreme variance of scales and aspect ratios. In this paper, we present a simple yet effective transformer-based architecture for scene text detection. Different from previous approaches that learn robust deep representations of scene text in a holistic manner, our method performs scene text detection based on a few representative features, which avoids the disturbance by background and reduces the computational cost. Specifically, we first select a few representative features at all scales that are highly relevant to foreground text. Then, we adopt a transformer for modeling the relationship of the sampled features, which effectively divides them into reasonable groups. As each feature group corresponds to a text instance, its bounding box can be easily obtained without any post-processing operation. Using the basic feature pyramid network for feature extraction, our method consistently achieves state-of-the-art results on several popular datasets for scene text detection.

연구 동기 및 목표

  • 시나리오 텍스트 검출에서 극단적인 척도 및 종횡비 변동 문제를 해결하기 위해.
  • 대표적인 특징에 집중함으로써 트랜스포머 기반 검출에서 계산 오버헤드와 배경 간섭을 줄이기 위해.
  • NMS 및 앵커 생성과 같은 후처리 작업이 필요 없도록 하기 위해.
  • 엔드 투 엔드 특징 샘플링 및 군집화를 통해 검출 정확도와 효율성을 향상시키기 위해.
  • 항공 영상에서의 기울어진 물체 검출 작업으로 이 방법의 효과를 확장하기 위해.

제안 방법

  • 백본 네트워크에서 특징을 추출하기 위해 다중 척도 특징 피라미드 네트워크를 사용한다.
  • 픽셀 수준에서 신뢰도 점수 맵을 예측하여 텍스트 관련 영역를 식별하고, 이러한 점수를 기반으로 상위-N개의 특징을 샘플링한다.
  • 샘플링된 특징들을 공간적 맥락을 유지하기 위해 학습 가능한 위치 임베딩과 연결한다.
  • 트랜스포머 인코더가 샘플링된 특징 간의 관계를 모델링하여 자기 어텐션을 통해 암묵적으로 인스턴스 수준의 표현으로 군집화한다.
  • 각 군집은 단일 텍스트 인스턴스에 대응하며, 후처리 없이 직접 바운딩 박스 예측이 가능하다.
  • 전체 파이프라인은 엔드 투 엔드로 훈련되어 특징 샘플링과 군집화의 공동 최적화가 가능하다.

실험 결과

연구 질문

  • RQ1모든 특징이 아닌 몇 가지 대표적인 특징에 집중함으로써 트랜스포머 기반 검출기가 시나리오 텍스트 검출에서 더 나은 성능을 낼 수 있는가?
  • RQ2특징 샘플링이 고해상도 특징 맵에서 배경 간섭을 줄이고 효율성을 향상시키는가?
  • RQ3트랜스포머의 어텐션 메커니즘이 샘플링된 특징들을 의미 있는 텍스트 인스턴스 표현으로 효과적으로 군집화할 수 있는가?
  • RQ4정확도와 추론 비용 측면에서 제안된 방법이 최신 기술 수준의 검출기들과 비교해 어떻게 성능을 내는가?
  • RQ5이 방법은 항공 영상의 시나리오 이해와 같은 다른 기울어진 물체 검출 작업으로 일반화될 수 있는가?

주요 결과

  • 제안된 방법은 ICDAR2015, ICDAR2017-MLT, EAST 데이터셋에서 최신 기술 수준 성능을 달성했으며, 다중 척도 테스트 조건에서 ICDAR2015에서 AP 87.42, ICDAR2017-MLT에서 AP 87.55를 기록했다.
  • 기울어진 물체 검출을 위한 DOTA-v1.0 데이터셋에서 다중 척도 테스트로 79.59 AP50를 달성했으며, KLD보다 1.32 AP50 높은 성능을 보였다.
  • ResNet-50와 다중 척도 테스트 조건에서 ICDAR2015에서 89.81 AP50를 기록했으며, 이는 이전의 SOTA 방법을 초월했다.
  • 제거 분석 결과, 특징 샘플링이 계산 비용을 줄이고 배경 노이즈에 대한 강건성을 향상시킨다는 것이 확인되었다.
  • 이 방법은 임의의 형태의 텍스트 및 기울어진 텍스트 검출에서도 잘 작동하여, 표준 시나리오 텍스트 검출을 넘어서 일반화 능력을 입증했다.
  • 강력한 성능에도 불구하고, 겹치는 텍스트 인스턴스에 대해 얽히고설킨 특징 표현으로 인해 어려움을 겪는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.