Skip to main content
QUICK REVIEW

[논문 리뷰] Character Region Awareness for Text Detection

Youngmin Baek, Bado Lee|arXiv (Cornell University)|2019. 04. 03.
Handwritten Text Recognition Techniques참고 문헌 37인용 수 58
한 줄 요약

CRAFT는 region 및 affinity 맵을 이용한 약하게 지도 학습 전략으로 개별 문자를 탐지하여, 미세 조정 없이도 여러 곡선/텍스트-임의 데이터셋에서 최첨단 결과를 달성합니다.

ABSTRACT

Scene text detection methods based on neural networks have emerged recently and have shown promising results. Previous methods trained with rigid word-level bounding boxes exhibit limitations in representing the text region in an arbitrary shape. In this paper, we propose a new scene text detection method to effectively detect text area by exploring each character and affinity between characters. To overcome the lack of individual character level annotations, our proposed framework exploits both the given character-level annotations for synthetic images and the estimated character-level ground-truths for real images acquired by the learned interim model. In order to estimate affinity between characters, the network is trained with the newly proposed representation for affinity. Extensive experiments on six benchmarks, including the TotalText and CTW-1500 datasets which contain highly curved texts in natural images, demonstrate that our character-level text detection significantly outperforms the state-of-the-art detectors. According to the results, our proposed method guarantees high flexibility in detecting complicated scene text images, such as arbitrarily-oriented, curved, or deformed texts.

연구 동기 및 목표

  • 임의 모양의 텍스트를 단어 단위 박스보다 강건하게 탐지하도록 동기를 부여합니다.
  • 문자 영역을 로컬리즈하고 이를 텍스트 인스턴스로 연결하는 문자 중심 탐지 프레임워크를 제안합니다.
  • 문자 주석이 없는 실제 데이터에서 학습하기 위한 약하게 지도된 그라운드 트루스 생성 메커니즘을 개발합니다.
  • 곡선 및 다각형 텍스트가 있는 데이터세트에서 최첨단 성능을 입증합니다.
  • 전체 텍스트 인스턴스가 아닌 문자를 지역화함으로써 스케일 변화에 대한 강건성을 보여줍니다.]
  • methodKeepingNumUnknownInJSON

제안 방법

  • 완전 합성 신경망 백본(VGG-16 with skip connections)이 두 개의 히트맵을 출력합니다: 문자 영역 스코어와 문자 친화성 스코어.
  • 그라운드 트루스 생성은 문자 상자에 왜곡된 가우시안 히트맵을 사용하여 영역 및 친화 레이블을 만듭니다.
  • 약하게 지도된 학습은 워터쉐드로 단어 수준 주석을 문자 수준 상자로 나누어 신뢰도 맵으로 가중치를 두어 실제 이미지에 대한 의사 그라운드 트루트를 생성합니다.
  • 학습은 합성(SynthText) 데이터와 실제 세계의 단어 수준 데이터의 조합으로, 불완전한 의사 GT에 대비한 신뢰도 가중 손실을 사용합니다.
  • 추론은 영역 맵과 친화 맵을 임계값으로 이진화하고 연결 성분 레이블링을 적용하여 단어 수준의 사각형 상자를 산출하며, 곡선 텍스트에 대한 다각형 스타일 후처리를 선택적으로 적용합니다.

실험 결과

연구 질문

  • RQ1문자가 중심이 된 표현이 irregular한 모양의 텍스트(곡선, 길고 임의로 변형된 텍스트)에 대해 단어 중심 탐지기보다 더 좋은 성능을 낼 수 있나요?
  • RQ2약하게 지도된 학습이 실제 데이터에서 명시적 문자 주석 없이도 효과적인 문자 수준 탐지를 가능하게 하나요?
  • RQ3친화 맵을 통한 문자 수준 연결이 스케일, 방향 및 원근 왜곡에 대한 강건성에 어떤 영향을 미치나요?
  • RQ4다양한 주석 스타일(직사각형, 사각형, 다각형)을 가진 데이터세트 간에 광범위한 파인 튜닝 없이 일반화할 수 있나요?

주요 결과

  • CRAFT는 사각형 데이터셋(ICDAR 2013/2015/2017, MSRA-TD500)에서 최첨단 성능을 달성하며 H-mean 점수가 강력합니다(예: IC13: 95.2 H; IC15: 86.9 H; IC17: 73.9 H) 및 IC13에서 8.6 FPS를 보고합니다.
  • 다각형 타입 데이터셋(TotalText, CTW-1500)에서 CRAFT는 높은 H-측정치를 달성합니다(TotalText: 83.6; CTW-1500: 83.5).
  • 끝부터 끝까지 탐지기(end-to-end detectors)와 비교하면, CRAFT는 인식에 대해 엔드 투 엔드로 학습되지 않았음에도 불구하고 경쟁력 있는 H-값을 제공합니다(TotalText: 83.6; CTW-1500: 83.5).
  • 다중 스케일 테스트 없이도 강건한 성능을 보여주며, 전체 텍스트 인스턴스가 아닌 문자 간의 관계에 초점을 맞춘 작은 수용 필드(small receptive fields)로 intra- 및 inter-character 관계에 집중합니다.
  • 보조 LinkRefiner는 CTW-1500 스타일 다각형 주석 처리의 처리를 개선하여 긴 곡선 텍스트의 친화성을 다듬고 다각형 결과를 향상시킵니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.