Skip to main content
QUICK REVIEW

[논문 리뷰] Chinese Street View Text: Large-scale Chinese Text Reading with Partially Supervised Learning

Yipeng Sun, Jiaming Liu|arXiv (Cornell University)|2019. 09. 17.
Handwritten Text Recognition Techniques참고 문헌 41인용 수 6
한 줄 요약

이 논문은 430,000장의 이미지를 포함한 대규모 중국어 스트리트 뷰 텍스트 데이터셋 C-SVT를 소개한다. 이 데이터셋에는 30,000장의 완전히 주석 처리된 이미지와 400,000장의 약한 주석 처리된 이미지가 포함되어 있다. 본 논문은 온라인 프로포절 매칭(OPM) 모듈을 갖춘 부분적 지도 학습 프레임워크를 제안하여, 완전한 주석과 약한 주석을 동시에 학습함으로써 동일한 레이블링 비용에서 완전 지도 학습 대비 종합 F-스코어를 4.03% 향상시키고, ICDAR 2017-RCTW에서 최고 성능을 달성한다.

ABSTRACT

Most existing text reading benchmarks make it difficult to evaluate the performance of more advanced deep learning models in large vocabularies due to the limited amount of training data. To address this issue, we introduce a new large-scale text reading benchmark dataset named Chinese Street View Text (C-SVT) with 430,000 street view images, which is at least 14 times as large as the existing Chinese text reading benchmarks. To recognize Chinese text in the wild while keeping large-scale datasets labeling cost-effective, we propose to annotate one part of the CSVT dataset (30,000 images) in locations and text labels as full annotations and add 400,000 more images, where only the corresponding text-of-interest in the regions is given as weak annotations. To exploit the rich information from the weakly annotated data, we design a text reading network in a partially supervised learning framework, which enables to localize and recognize text, learn from fully and weakly annotated data simultaneously. To localize the best matched text proposals from weakly labeled images, we propose an online proposal matching module incorporated in the whole model, spotting the keyword regions by sharing parameters for end-to-end training. Compared with fully supervised training algorithms, this model can improve the end-to-end recognition performance remarkably by 4.03% in F-score at the same labeling cost. The proposed model can also achieve state-of-the-art results on the ICDAR 2017-RCTW dataset, which demonstrates the effectiveness of the proposed partially supervised learning framework.

연구 동기 및 목표

  • 야외에서 중국어 텍스트 읽기 작업을 위한 대규모, 다양한 종류의 데이터와 비용 효율적인 훈련 데이터의 부족을 해결하기 위해.
  • 대규모 데이터셋에 대해 정밀한 바운딩 박스 및 텍스트 레이블 주석을 제공하는 데 드는 높은 주석 비용을 줄이기 위해.
  • 완전히 주석 처리된 데이터와 약하게 주석 처리된 데이터를 효과적으로 활용할 수 있는 통합된 딥 러닝 프레임워크를 개발하여 종합적인 텍스트 검출 및 인식을 수행하기 위해.
  • 완전 지도 학습 기반 모델을 초월하여 중국어 텍스트 읽기 모델의 일반화 능력과 성능을 향상시키기 위해.

제안 방법

  • 각 텍스트 영역에 대해 바운딩 박스와 텍스트 레이블을 포함한 완전한 지도 학습 방식으로 30,000장의 이미지를 주석 처리한다.
  • 추가로 400,000장의 이미지를 확보하고, 텍스트 영역에 대한 키워드만 제공하는 약한 레이블로 주석 처리함으로써 주석 비용을 크게 절감한다.
  • 완전한 주석과 약한 주석을 동시에 학습할 수 있는 부분적 지도 학습 기반의 종합 텍스트 읽기 모델을 설계한다.
  • 공유된 파라미터를 사용해 약한 레이블과 텍스트 프로포절을 동적으로 매칭하는 온라인 프로포절 매칭(OPM) 모듈을 도입하여 종합적인 훈련을 가능하게 한다.
  • 공유된 백본 네트워크를 사용해 특징을 추출하고, 별도의 검출 및 인식 헤드를 통해 공유된 표현을 활용해 공동 최적화를 수행한다.
  • 검출, 인식, 프로포절 매칭 목적함수를 조합한 다중 작업 손실을 사용하여, 약한 주석 처리된 영역이 진짜 키워드와 일치하도록 한다.

실험 결과

연구 질문

  • RQ1부분적 지도 학습 프레임워크는 대규모 약한 주석 처리된 데이터를 효과적으로 활용하여 중국어 텍스트 읽기 성능을 향상시킬 수 있는가?
  • RQ2제안된 OPM 모듈은 약한 주석에서 텍스트 영역을 정확히 국소화하는 데 있어 표준 검출 헤드보다 우수한가?
  • RQ3약한 주석 처리된 데이터를 추가로 활용할 경우, 완전 지도 학습 대비 인식 정확도와 일반화 능력은 어느 정도 향상되는가?
  • RQ4제안된 방법은 ICDAR 2017-RCTW와 같은 벤치마크 데이터셋에서 최고 성능을 달성하는가?

주요 결과

  • 제안된 부분적 지도 학습 모델은 C-SVT 데이터셋에서 동일한 레이블링 비용으로 완전 지도 학습 대비 종합 F-스코어를 4.03% 향상시켰다.
  • OPM 모듈은 임계값 τ=0.1에서 57%의 재현율과 97%의 정밀도를 기록하여, 약한 레이블에서 키워드 영역을 효과적으로 국소화함을 입증했다.
  • 400,000장의 약한 주석 처리된 이미지를 추가로 활용함으로써 평균 편집 거리(AED)가 1장당 3.3 감소하였고, 다중 해상도 테스트를 통해 AED는 22.1로 추가로 감소하여 새로운 최고 성능을 달성했다.
  • 약한 주석 처리된 데이터로 훈련할 경우, 인식 브랜치의 정확도가 40.20%에서 48.33%로 향상되어, 인식 작업에 대해 약한 지도 학습의 가치를 입증했다.
  • C-SVT의 완전 주석 처리된 부분으로 훈련된 모델은 CTW로 훈련된 모델보다 우수한 성능을 보였으며, ICDAR 2017-RCTW에서 F-스코어 58.21%를 기록하여 CTW 기반 훈련 모델의 43.41%를 상회했다.
  • ICDAR 2017-RCTW에서 최고 성능을 기록하여, 제안된 부분적 지도 학습 프레임워크의 일반화 능력과 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.