Skip to main content
QUICK REVIEW

[논문 리뷰] Traditional Chinese Synthetic Datasets Verified with Labeled Data for Scene Text Recognition

Yi‐Chang Chen, Yu‐Chuan Chang|arXiv (Cornell University)|2021. 11. 26.
Handwritten Text Recognition Techniques참고 문헌 13인용 수 4
한 줄 요약

이 논문은 전통적 중화어 도시 텍스트 인식(STR)을 위한 합성 데이터 생성 프레임워크를 소개하며, 폰트, 배경, 텍스트 속성의 다양성을 활용해 2,000만 개 이상의 다양한 합성 이미지를 생성한다. 새로 제작한 TC-STR 7,000단어 기준으로 평가된 결과, 합성 데이터로 사전 훈련하고 실제 데이터로 미세조정한 모델이 89.64%의 정확도를 기록하여 인간 레이블이 거의 없는 데이터로도 성능 향상이 뚜렷하게 이루어짐을 보여준다.

ABSTRACT

Scene text recognition (STR) has been widely studied in academia and industry. Training a text recognition model often requires a large amount of labeled data, but data labeling can be difficult, expensive, or time-consuming, especially for Traditional Chinese text recognition. To the best of our knowledge, public datasets for Traditional Chinese text recognition are lacking. This paper presents a framework for a Traditional Chinese synthetic data engine which aims to improve text recognition model performance. We generated over 20 million synthetic data and collected over 7,000 manually labeled data TC-STR 7k-word as the benchmark. Experimental results show that a text recognition model can achieve much better accuracy either by training from scratch with our generated synthetic data or by further fine-tuning with TC-STR 7k-word.

연구 동기 및 목표

  • 전통적 중화어 도시 텍스트 인식(STR)을 위한 공개적이고 고품질의 데이터셋 부족 문제를 해결하기 위해.
  • 실제 세계의 텍스트 다양성을 모방하는 확장 가능한 합성 데이터 생성 프레임워크를 개발하여 저비용·고용량의 훈련 데이터를 확보하기 위해.
  • 신뢰할 수 있는 STR 모델 평가를 위한 수작업으로 레이블링된 실제 세계 기반 기준 데이터셋(TC-STR 7,000단어)을 구축하기 위해.
  • 합성 데이터의 다양성—특히 배경과 폰트 다양성—이 모델의 일반화 능력과 정확도에 미치는 영향을 평가하기 위해.
  • 합성 데이터로 사전 훈련한 후 제한된 실제 데이터로 미세조정하는 방법이 실제 데이터로만 훈련하는 것보다 성능이 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 합성 데이터 엔진은 다단계 파이프라인을 통해 도시 텍스트 이미지를 생성한다: 정제된 사전과 위키백과 제목에서 단어 샘플링, 임의 삽입을 통한 문자 간격 조절, 175종의 다양한 폰트를 활용한 렌더링.
  • 텍스트 렌더링은 다양한 폰트 크기, 색상, 테두리 효과, 기울임, 왜곡, 노이즈를 포함하여 실제 세계의 다양성을 시뮬레이션한다.
  • 배경은 단순한 solid 색상과 실제 이미지에서 유도된 복잡한 와이드 배경을 모두 포함하여 현실감과 다양성을 향상시킨다.
  • 모델 아키텍처는 TPS 변환, 특징 추출을 위한 ResNet, 시퀀스 모델링을 위한 BiLSTM, 시퀀스 예측을 위한 CTC를 사용한다.
  • 제거 분석(ablation studies)을 통해 배경, 폰트, 장면, 단어 다양성이 모델 성능에 기여하는 정도를 분리하여 평가한다.
  • 미세조정은 합성 데이터로 사전 훈련된 모델과 실제 TC-STR 7,000단어 데이터셋의 일부를 사용하여 데이터 증강을 적용해 수행한다.

실험 결과

연구 질문

  • RQ1최소한의 실제 레이블이 필요한 상황에서 합성 데이터 생성 프레임워크가 전통적 중화어 도시 텍스트 인식 모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2배경, 폰트, 텍스트 왜곡, 단어 다양성의 변화가 STR 모델의 일반화 능력과 정확도에 어떤 영향을 미치는가?
  • RQ3합성 데이터로 사전 훈련한 후 실제 데이터로 미세조정하는 방법이 실제 데이터로만 훈련하는 것보다 성능이 뛰어나게 되는가?
  • RQ4합성 데이터에 복잡하고 와이드한 배경을 포함시킬 경우, 단순한 배경보다 모델의 강건성 향상에 얼마나 기여하는가?
  • RQ5합성 데이터는 전통적 중화어 STR에서 비용이 많이 드는 인간 레이블링의 필요성을 얼마나 줄일 수 있는가?

주요 결과

  • 2,000만 장의 합성 이미지로 사전 훈련하고 TC-STR 7,000단어 데이터셋의 일부를 사용해 미세조정한 모델이 89.64%의 정확도를 기록하여 실제 데이터로만 훈련한 모델보다 뛰어난 성능을 보였다.
  • 합성 데이터로만 사전 훈련한 모델이 TC-STR-테스트 세트에서 83.51%의 정확도를 기록하여 합성 이미지의 품질과 현실감을 입증했다.
  • 배경 다양성이 성능에 가장 큰 영향을 미쳤다; 단순한 배경만으로 훈련한 모델은 상당히 낮은 정확도를 보였다.
  • 폰트 다양성이 핵심적이었다—오직 하나의 폰트(소스한산)만 사용할 경우 모델의 일반화 능력과 정확도가 떨어졌다.
  • 단어 다양성 역시 성능에 상당한 영향을 미쳤다—단어 사전의 90%를 제거하면 인식 정확도가 떨어졌다.
  • 미세조정 단계에서의 데이터 증강은 여전히 미미한 향상만을 가져다주어, 합성 데이터가 충분한 다양성을 이미 포괄하고 있음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.