Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly-Supervised Arbitrary-Shaped Text Detection with Expectation-Maximization Algorithm

Mengbiao Zhao, Wei Feng|arXiv (Cornell University)|2020. 12. 01.
Handwritten Text Recognition Techniques참고 문헌 40인용 수 4
한 줄 요약

이 논문은 윤곽 기반 검출기와 다양한 약한 지도 형태(이미지 수준 태그, 굵은, 느슨한, 조밀한 경계 상자)를 활용하여, 기하학적 형태가 임의인 텍스트 검출을 위한 기대최대화(EM) 기반의 약한 지도 학습 프레임워크를 제안한다. 단지 10%의 다각형 수준 태그와 90%의 약한 태그 데이터만을 사용함에도 불구하고, 성능이 완전 지도 학습 모델과 유사한 수준에 도달하였으며, CTW1500, Total-Text, ICDAR-ArT 벤치마크에서 기존 최고 성능 모델보다도 뛰어난 성능을 보였다.

ABSTRACT

Arbitrary-shaped text detection is an important and challenging task in computer vision. Most existing methods require heavy data labeling efforts to produce polygon-level text region labels for supervised training. In order to reduce the cost in data labeling, we study weakly-supervised arbitrary-shaped text detection for combining various weak supervision forms (e.g., image-level tags, coarse, loose and tight bounding boxes), which are far easier for annotation. We propose an Expectation-Maximization (EM) based weakly-supervised learning framework to train an accurate arbitrary-shaped text detector using only a small amount of polygon-level annotated data combined with a large amount of weakly annotated data. Meanwhile, we propose a contour-based arbitrary-shaped text detector, which is suitable for incorporating weakly-supervised learning. Extensive experiments on three arbitrary-shaped text benchmarks (CTW1500, Total-Text and ICDAR-ArT) show that (1) using only 10% strongly annotated data and 90% weakly annotated data, our method yields comparable performance to state-of-the-art methods, (2) with 100% strongly annotated data, our method outperforms existing methods on all three benchmarks. We will make the weakly annotated datasets publicly available in the future.

연구 동기 및 목표

  • 임의의 형태 텍스트 검출을 위한 다각형 수준 태그의 높은 태깅 비용을 줄이기 위해 쉽게 확보할 수 있는 약한 지도 형태를 활용하고자 한다.
  • 제한된 강한 태그와 풍부한 약한 태그를 효과적으로 융합하는 약한 지도 학습 프레임워크를 개발하고자 한다.
  • 다양한 약한 지도 형식과 호환되는 윤곽 기반 검출기를 설계하여 일반화 능력과 학습 효율성을 향상시키고자 한다.
  • 약한 지도 학습이 강한 지도 학습 모델과 유사한 성능을 달성하면서도 태깅 노력의 극도로 감소시킬 수 있음을 입증하고자 한다.

제안 방법

  • 먼저 텍스트 제안을 생성하고, 이후 정밀한 윤곽을 회귀하는 윤곽 기반의 임의의 형태 텍스트 검출기를 제안하며, 이는 약한 지도 형태와 잘 맞는다.
  • 이미지 수준 태그, 굵은, 느슨한, 조밀한 경계 상자로 구성된 네 가지의 약한 지도 형태를 도입하며, 각 형태는 점점 더 적은 태깅 시간을 요구한다.
  • E단계에서는 가능한 잠재적인 다각형 태그에 대한 확률 분포를 추정하고, M단계에서는 가짜 레이블이 부여된 다각형을 사용해 모델 가중치를 갱신하는 EM 유사 최적화 알고리즘을 적용한다.
  • 초기 EM 프로세스를 위해 소량의 강한 태그 데이터로 사전 학습된 모델을 사용하여 수렴 속도와 최종 성능을 향상시킨다.
  • 노이즈가 있는 가짜 레이블의 영향을 줄이기 위해 신뢰도 가중 손실 함수를 적용한다.
  • 반복적인 EM 학습 라운드를 수행하며, 첫 두 라운드 동안 성능이 향상되나, 세 번째 라운드에서는 가짜 레이블의 오류 누적로 인해 성능이 정체되거나 저하된다.

실험 결과

연구 질문

  • RQ1이미지 수준 태그나 경계 상자와 같은 약한 지도 형태가 태깅 비용을 크게 줄이면서도 높은 검출 정확도를 유지할 수 있는가?
  • RQ2EM 기반의 학습 프레임워크는 제한된 강한 태그와 풍부한 약한 태그를 효과적으로 활용하여 임의의 형태 텍스트 검출에 얼마나 효과적인가?
  • RQ3다양한 약한 지도 형태(예: 조밀한 vs. 느슨한 경계 상자)가 모델 성능과 태깅 효율성에 미치는 영향은 어떠한가?
  • RQ4강한 태그가 전체 데이터의 10%에 불과할 때, 약한 지도 학습 모델이 완전 지도 학습 모델의 성능에 얼마나 가까이 도달할 수 있는가?

주요 결과

  • 단지 10%의 강한 태그 데이터와 90%의 약한 태그 데이터만을 사용함에도 불구하고, 제안된 방법은 CTW1500, Total-Text, ICDAR-ArT에서 기존 완전 지도 학습 최고 성능 모델과 유사한 F-측정치를 달성하였다.
  • 100%의 강한 태그 데이터를 사용할 경우, 모든 세 벤치마크에서 기존의 방법들을 초월하여 더 높은 정확도를 보였다. 이는 완전 지도 학습 조건에서도 뛰어난 정확도를 입증한다.
  • 신뢰도 가중 손실 함수는 F-측정치 약 2.1~2.5% 향상으로 이어졌으며, 노이즈가 있는 가짜 레이블의 영향을 줄였다.
  • 첫 두 번의 EM 학습 라운드 동안 성능이 향상되었지만, 세 번째 라운드에서는 가짜 레이블의 오류 누적이 발생하여 성능이 정체되거나 저하되었다.
  • 'Equal Time'과 'Equal Number' 약한 태그 정책은 'Strong' 정책(완전한 다각형 태깅)보다 F-측정치에서 3.9% 이상 뛰어나 성과 대비 비용 효율성이 뛰어나다는 것을 보여주었다.
  • 느슨한 경계 상자는 가장 비용 효율적인 약한 지도 형태였으며, 다각형 태깅에 80%의 예산을, 약한 태그에 20%의 예산을 할당했을 때 최고의 성능을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.