[논문 리뷰] Text recognition on images using pre-trained CNN
이 논문은 사전 훈련된 VGG-16 CNN과 데이터 증강 기법을 사용한 텍스트 인식 시스템을 제안하며, 테스트 데이터에서 98.16%의 정확도와 IIIT-5K-Dataset에서 95.62%의 정확도를 달성하였다. 이 방법은 ImageNet에서의 전이 학습을 활용하고, 회전, 스케일링, 가우시안 블러를 적용하여 현장 텍스트 인식 작업의 강건성과 성능을 향상시켰다.
A text on an image often stores important information and directly carries high level semantics, makes it as important source of information and become a very active research topic. Many studies have shown that the use of CNN-based neural networks is quite effective and accurate for image classification which is the basis of text recognition. It can also be more enhanced by using transfer learning from pre-trained model trained on ImageNet dataset as an initial weight. In this research, the recognition is trained by using Chars74K dataset and the best model results then tested on some samples of IIIT-5K-Dataset. The research results showed that the best accuracy is the model that trained using VGG-16 architecture applied with image transformation of rotation 15°, image scale of 0.9, and the application of gaussian blur effect. The research model has an accuracy of 97.94% for validation data, 98.16% for test data, and 95.62% for the test data from IIIT-5K-Dataset. Based on these results, it can be concluded that pre-trained CNN can produce good accuracy for text recognition, and the model architecture that used in this study can be used as reference material in the development of text detection systems in the future
연구 동기 및 목표
- 사전 훈련된 CNN의 현장 텍스트 인식 작업에 대한 효과를 조사하기 위해.
- 회전, 스케일링, 가우시안 블러와 같은 특정 데이터 증강 기법이 모델 성능에 미치는 영향을 평가하기 위해.
- IIIT-5K-Dataset과 같은 미사용 데이터셋에 대한 모델의 일반화 능력을 평가하기 위해.
- 고정확도 텍스트 인식을 위한 최적의 모델 아키텍처와 하이퍼파라미터 조합을 규명하기 위해.
제안 방법
- 텍스트 인식을 위해 Chars74K 데이터셋을 사용하여 사전 훈련된 VGG-16 모델을 미세조정하기 위해.
- 강건성을 향상시키기 위해 이미지의 회전(15°), 스케일링(0.9), 가우시안 블러를 통한 데이터 증강을 적용하기 위해.
- 특징 학습을 향상시키기 위해 ImageNet 사전 훈련 가중치로 모델을 초기화함으로써 전이 학습을 사용하기 위해.
- 분류를 위해 교차 엔트로피 손실과 Adam 옵timizer를 사용하여 모델을 엔드 투 엔드로 훈련하기 위해.
- 일반화 능력을 측정하기 위해 검증, 테스트 및 IIIT-5K-Dataset 분할에서 성능을 평가하기 위해.
실험 결과
연구 질문
- RQ1사전 훈련된 CNN은 현장 텍스트 인식 작업에서 높은 정확도를 달성할 수 있는가?
- RQ2특정 데이터 증강 기법이 텍스트 인식 모델의 성능에 어떤 영향을 미치는가?
- RQ3최고의 정확도를 얻기 위한 최적의 모델 아키텍처와 데이터 증강 조합은 무엇인가?
- RQ4훈련된 모델은 IIIT-5K-Dataset과 같은 미사용 데이터셋에 얼마나 잘 일반화되는가?
주요 결과
- 최고의 성능을 보인 모델은 VGG-16에 회전, 스케일링, 가우시안 블러 증강을 적용하여 검증 데이터에서 97.94%의 정확도를 달성하였다.
- Chars74K 데이터셋의 테스트 세트에서 98.16%의 정확도를 기록하여 강력한 일반화 능력을 보였다.
- IIIT-5K-Dataset에서 95.62%의 정확도를 유지하여 다양한 텍스트 이미지로의 효과적인 전이 가능성을 보여주었다.
- VGG-16 아키텍처와 특정 데이터 증강 기법의 조합이 인식 성능 향상에 크게 기여하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.