Skip to main content
QUICK REVIEW

[논문 리뷰] Bengali Handwritten Character Classification using Transfer Learning on Deep Convolutional Neural Network

Swagato Chatterjee, Rwik Kumar Dutta|arXiv (Cornell University)|2019. 02. 25.
Handwritten Text Recognition Techniques인용 수 11
한 줄 요약

이 논문은 벵골어 손글씨 문자 인식(Bengali HCR)을 위해 전이학습 기반 접근법을 제안하며, BanglaLekha-Isolated 데이터셋에서 미세조정된 ResNet50을 사용하여 단 47 에포크 만에 96.12%의 정확도를 달성한다. 수정된 원 사이클 정책과 최적화된 이미지 입력 크기 전략을 활용함으로써, 더 빠른 수렴 속도를 보이며 기존의 앙상블 기법을 사용하지 않은 비앙상블 기법들보다 뛰어난 성능을 보인다.

ABSTRACT

In this paper, we propose a solution which uses state-of-the-art techniques in Deep Learning to tackle the problem of Bengali Handwritten Character Recognition ( HCR ). Our method uses lesser iterations to train than most other comparable methods. We employ Transfer Learning on ResNet 50, a state-of-the-art deep Convolutional Neural Network Model, pretrained on ImageNet dataset. We also use other techniques like a modified version of One Cycle Policy, varying the input image sizes etc. to ensure that our training occurs fast. We use the BanglaLekha-Isolated Dataset for evaluation of our technique which consists of 84 classes (50 Basic, 10 Numerals and 24 Compound Characters). We are able to achieve 96.12% accuracy in just 47 epochs on BanglaLekha-Isolated dataset. When comparing our method with that of other researchers, considering number of classes and without using Ensemble Learning, the proposed solution achieves state of the art result for Handwritten Bengali Character Recognition. Code and weight files are available at https://github.com/swagato-c/bangla-hwcr-present.

연구 동기 및 목표

  • 딥 러닝을 활용한 벵골어 손글씨 문자 인식(HCR)에서 낮은 정확도와 높은 훈련 비용 문제를 해결하기 위해.
  • 기본 문자, 숫자, 복합 문자를 포함한 복잡한 84개 클래스 데이터셋에서 인식 성능을 향상시키기 위해.
  • 효율적인 훈련 전략을 통해 훈련 반복 수를 줄이면서도 높은 정확도를 유지하기 위해.
  • 앙상블 학습 기법을 사용하지 않고도 새로운 최신 기술 수준의 성능 기록을 수립하기 위해.

제안 방법

  • 이미지넷 데이터셋에서 사전 훈련된 ResNet50 모델을 벵골어 HCR에 대해 미세조정함으로써 전이학습을 적용한다.
  • 수정된 원 사이클 정책을 사용하여 학습률 스케줄링을 최적화함으로써 수렴 속도를 가속화하고 모델 일반화 능력을 향상시킨다.
  • 훈련 중에 입력 이미지 크기를 다양하게 조절하여 모델의 강인성과 성능을 향상시킨다.
  • 모델은 기본 문자 50개, 숫자 10개, 복합 문자 24개를 포함한 BanglaLekha-Isolated 데이터셋에서 훈련된다.
  • 아키텍처와 훈련 파이프라인은 정확도를 극대화하면서도 훈련 에포크 수를 최소화하도록 설계된다.

실험 결과

연구 질문

  • RQ1ResNet50를 활용한 전이학습이 더 적은 훈련 에포크 수로도 높은 정확도를 달성할 수 있는가?
  • RQ2수정된 원 사이클 정책은 HCR 작업에서 수렴 속도와 모델 정확도에 어떤 영향을 미치는가?
  • RQ3입력 이미지 크기를 다양하게 조절하는 것이 미세조정된 ResNet50 모델의 성능에 어떤 영향을 미치는가?
  • RQ4제안된 방법은 앙상블 학습 기법을 사용하지 않고도 BanglaLekha-Isolated 데이터셋에서 최신 기술 수준의 성능을 달성하는가?

주요 결과

  • 제안된 방법은 벵골어 손글씨 문자 84개 클래스를 포함한 BanglaLekha-Isolated 데이터셋에서 96.12%의 탑-1 정확도를 달성한다.
  • 이 모델은 단지 47개의 훈련 에포크 만에 이 정확도에 도달하여 다른 최신 기술 수준의 방법들보다 훈련 시간을 크게 단축시킨다.
  • ResNet50를 활용한 전이학습과 수정된 원 사이클 정책의 조합은 정확도를 희생시키지 않고도 더 빠른 수렴을 가능하게 한다.
  • 이 방법은 동일한 벤치마크에서 기존의 비앙상블 접근법들을 능가하며, 벵골어 HCR 분야에서 새로운 최신 기술 수준의 성능을 확립한다.
  • 훈련 중에 입력 크기를 최적화함으로써 기본, 숫자, 복합 문자 등 다양한 문자 유형에 대해 모델이 강인함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.