Skip to main content
QUICK REVIEW

[논문 리뷰] Curved Text Detection in Natural Scene Images with Semi- and Weakly-Supervised Learning

Xugong Qin, Yu Zhou|arXiv (Cornell University)|2019. 08. 27.
Handwritten Text Recognition Techniques참고 문헌 33인용 수 5
한 줄 요약

이 논문은 비용이 많이 드는 픽셀 수준의 애너테이션에 대한 의존도를 줄이기 위해 소량의 픽셀 수준 데이터와 대규모 직사각형 수준 또는 비애너테이션 데이터를 활용함으로써 곡선 텍스트 검출을 위한 준감독 및 약한 감독 프레임워크를 제안한다. 제한된 픽셀 애너테이션 데이터로 훈련된 베이스라인 모델을 이용해 진짜 바운딩 박스를 활용해 가짜 마스크 애너테이션을 생성하는 방법을 사용하며, '로컬' 전략이 다른 전략보다 우수하며, 단지 10%의 픽셀 수준 데이터와 90%의 약한 애너테이션 데이터로도 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Detecting curved text in the wild is very challenging. Recently, most state-of-the-art methods are segmentation based and require pixel-level annotations. We propose a novel scheme to train an accurate text detector using only a small amount of pixel-level annotated data and a large amount of data annotated with rectangles or even unlabeled data. A baseline model is first obtained by training with the pixel-level annotated data and then used to annotate unlabeled or weakly labeled data. A novel strategy which utilizes ground-truth bounding boxes to generate pseudo mask annotations is proposed in weakly-supervised learning. Experimental results on CTW1500 and Total-Text demonstrate that our method can substantially reduce the requirement of pixel-level annotated data. Our method can also generalize well across two datasets. The performance of the proposed method is comparable with the state-of-the-art methods with only 10% pixel-level annotated data and 90% rectangle-level weakly annotated data.

연구 동기 및 목표

  • 자연 풍경 이미지 내 곡선 텍스트 검출에 있어 비용이 많이 드는 픽셀 수준 애너테이션에 대한 의존도를 줄이기 위해.
  • 제한된 픽셀 수준 데이터와 풍부한 약한 또는 비애너테이션 데이터를 효과적으로 활용할 수 있는 준감독 및 약한 감독 학습 프레임워크를 개발하기 위해.
  • 최소한의 완전한 애너테이션 데이터로 CTW1500 및 Total-Text와 같은 다양한 데이터셋 간의 일반화 성능을 향상시키기 위해.
  • 약한 감독 설정에서 진짜 바운딩 박스를 활용해 곡선 텍스트의 공간적 및 구조적 세부 정보를 유지하는 새로운 가짜 마스크 애너테이션 생성 전략을 설계하기 위해.

제안 방법

  • 다중 작업 네트워크가 동시에 바운딩 박스 위치 추정, 텍스트/비텍스트 분류, 인스턴스 수준 마스크 예측을 수행하도록 훈련된다.
  • 베이스라인 모델은 소량의 픽셀 수준 애너테이션 데이터(예: 다각형 마스크)로 먼저 훈련된다.
  • 베이스라인 모델은 세 가지 전략(단순, 필터, 로컬)을 사용해 비애너테이션 또는 직사각형 애너테이션 데이터에 대해 가짜 애너테이션을 생성한다.
  • '로컬' 전략은 진짜 바운딩 박스를 제안으로 사용하고 직접적으로 가짜 마스크 애너테이션을 생성함으로써 노이즈를 최소화하고 정확도를 향상시킨다.
  • 재귀적 훈련이 적용되며, 한 라운드에서 예측된 출력이 다음 라운드의 지도 학습으로 사용되어 반복적 개선이 가능하다.
  • 제안된 방법은 비애너테이션 또는 약한 레이블이 부여된 데이터에서 생성된 가짜 레이블 데이터와 원본 애너테이션을 결합함으로써 준감독 및 약한 감독 학습을 통합한다.

실험 결과

연구 질문

  • RQ110%의 픽셀 수준 애너테이션 데이터와 90%의 직사각형 수준 약한 애너테이션 데이터만으로 곡선 텍스트 검출기가 효과적으로 훈련될 수 있는가?
  • RQ2약한 레이블이 부여된 바운딩 박스에서 어떻게 정확한 가짜 마스크 애너테이션을 생성할 수 있으며, 이 과정에서 곡선 텍스트의 공간적 및 구조적 세부 정보를 어떻게 유지할 수 있는가?
  • RQ3제안된 프레임워크는 CTW1500 및 Total-Text와 같은 다양한 데이터셋 간에 잘 일반화되는가?
  • RQ4나이브, 필터, 로컬 전략 중 어느 것이 약한 감독 설정 하에서 F-스코어 및 리콜 측면에서 가장 높은 성능을 내는가?
  • RQ5예를 들어 CTW1500에서 훈련된 모델이 다른 데이터셋(예: Total-Text)으로 전이될 수 있는가? 이때 직사각형 수준의 애너테이션만으로도 효과적인 일반화가 가능한가?

주요 결과

  • '로컬' 전략은 CTW1500에서 10%의 픽셀 수준 데이터와 90%의 직사각형 수준 데이터로 훈련했을 때 F-스코어 76.0%를 기록했으며, Total-Text에서는 78.1%를 달성하여 베이스라인 및 다른 전략을 모두 능가한다.
  • CTW1500에서 '로컬' 전략는 베이스라인 F-스코어를 9.9% 향상시켰으며, 위치 추정 네트워크의 완전한 지도 학습 덕분에 리콜 향상이 두드러졌다.
  • Total-Text에서 '로컬' 전략는 F-스코어 78.1%를 기록했으며, 완전한 지도 학습으로 훈련된 최신 기술 수준 방법(78.4%)과 매우 유사한 성능을 달성했다.
  • 필터 전략는 CTW1500에서 나이브 전략 대비 정밀도를 1.7% 향상시켜 더 나은 가짜 양성(false positive) 억제 효과를 보였다.
  • '로컬' 전략는 데이터셋 간 일반화 성능이 뛰어나, CTW1500에서 10%의 픽셀 수준 데이터로 훈련된 모델이 Target 도메인 애너테이션이 전혀 없이 Total-Text에서 F-스코어 78.1%를 달성했다.
  • 재귀적 훈련은 다수의 라운드에 걸쳐 일관된 성능 향상을 이끌었으며, '로컬' 전략는 가장 빠른 수렴 속도와 가장 높은 포화 수준를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.