Skip to main content
QUICK REVIEW

[논문 리뷰] Offline handwritten mathematical symbol recognition utilising deep learning

Azadeh Nazemi, Niloofar Tavakolian|arXiv (Cornell University)|2019. 10. 16.
Handwritten Text Recognition Techniques참고 문헌 26인용 수 14
한 줄 요약

이 논문은 SLIC를 사용한 분할과 사전 훈련된 SqueezeNet을 활용한 전이 학습을 통해 오프라인 수기 수학 기호 인식을 위한 딥러닝 프레임워크를 제안한다. 101개의 기호 클래스에서 90%의 정확도를 달성하여, 최소한의 데이터 증강으로 다중 클래스 수기 수학 기호 인식 분야에서 최신 기술 수준의 성능을 입증한다.

ABSTRACT

This paper describes an approach for offline recognition of handwritten mathematical symbols. The process of symbol recognition in this paper includes symbol segmentation and accurate classification for over 300 classes. Many multidimensional mathematical symbols need both horizontal and vertical projection to be segmented. However, some symbols do not permit to be projected and stop segmentation, such as the root symbol. Besides, many mathematical symbols are structurally similar, specifically in handwritten such as 0 and null. There are more than 300 Mathematical symbols. Therefore, designing an accurate classifier for more than 300 classes is required. This paper initially addresses the issue regarding segmentation using Simple Linear Iterative Clustering (SLIC). Experimental results indicate that the accuracy of the designed kNN classifier is 84% for salient, 57% Histogram of Oriented Gradient (HOG), 53% for Linear Binary Pattern (LBP) and finally 43% for pixel intensity of raw image for 66 classes. 87 classes using modified LeNet represents 90% accuracy. Finally, for 101 classes, SqueezeNet ac

연구 동기 및 목표

  • 300개 이상의 수기 수학 기호를 오프라인 수기 식에서 인식하는 데 도전하는 것.
  • 근호나 0과 같은 복잡하거나 구조적으로 유사하거나 투영이 어려운 기호의 기호 분할 정확도를 향상시키는 것.
  • 0과 null, 대문자 및 소문자 버전과 같이 매우 유사한 기호를 구별할 수 있는 강력한 분류기 설계.
  • 사전 훈련된 딥 네트워크를 활용한 전이 학습을 통해 제한된 훈련 데이터로도 높은 인식 정확도를 달성하는 것.
  • 전통적인 특징 기반 방법(히스토그램 기반 기능, LBP, 시각적 주목도, 강도)과 딥러닝 모델(LeNet, SqueezeNet)을 비교 평가하는 것.

제안 방법

  • 기호 분할은 수기 기호의 구조적 세부 정보를 포착하는 슈퍼픽셀을 생성하기 위해 단순 선형 반복 클러스터링(SLIC)을 사용한다.
  • 분류를 위해 수정된 LeNet 네트워크를 66개 클래스에서 훈련한 후 87개 클래스로 확장하였으며, 최적의 수렴과 손실 제어를 위해 초모델 하이퍼파rameter를 조정하였다.
  • 제한된 데이터로 과적합을 방지하기 위해 사전 훈련된 SqueezeNet 모델을 사용하여 전이 학습을 적용하였다.
  • 네트워크는 ReLU 활성화 함수, 소프트맥스 손실, ADAM 최적화를 사용하며 학습률 0.00001으로 안정적인 훈련을 구현하였다.
  • 성능 평가를 위해 다중 특징 추출 방법(원시 픽셀 강도, 시각적 주목도 맵, HOG, LBP)을 사용하여 기준선 분석을 수행하였다.
  • 최종 모델은 SqueezeNet의 경량 아키텍처와 18층의 깊이를 활용하여 파rameter 수를 줄이면서도 높은 정확도를 유지한다.

실험 결과

연구 질문

  • RQ1SLIC 기반 슈퍼픽셀 분할이 근호와 같은 복잡하고 비투영 가능한 수학 기호를 효과적으로 처리할 수 있는가?
  • RQ2다중 클래스 수학 기호 인식에서 전통적인 수작업 특징(HOG, LBP, 시각적 주목도, 강도)과 딥러닝 모델 간의 성능 비교는 어떻게 되는가?
  • RQ3100개 이상의 기호 클래스를 가진 제한된 데이터셋에서 사전 훈련된 SqueezeNet을 활용한 전이 학습이 얼마나 인식 정확도 향상에 기여하는가?
  • RQ4이 작업에 최적의 수렴과 정확도를 얻기 위해 어떤 하이퍼파ram터 설정(LR, 최적화기, 활성화 함수)이 효과적인가?
  • RQ5LeNet 및 SqueezeNet과 같은 딥러닝 모델은 광범위한 데이터 증강 없이도 기호 클래스 수가 증가함에 따라 높은 정확도(≥90%)를 달성할 수 있는가?

주요 결과

  • kNN 분류기는 66개 클래스에서 시각적 주목도 맵을 사용해 84%의 정확도를 기록했으며, HOG는 57%, LBP는 53%, 원시 픽셀 강도는 43%의 정확도를 기록했다.
  • 수정된 LeNet 네트워크는 ReLU 활성화 함수, 소프트맥스 손실, ADAM 최적화(학습률 0.00001)를 사용해 78개 클래스에서 85%의 정확도를 달성했다.
  • 전이 학습을 통해 사전 훈련된 SqueezeNet은 101개의 수학 기호 클래스에서 90%의 정확도를 기록하여 모든 기준선 방법을 능가했다.
  • ADAM 최적화기와 낮은 학습률(1e-5)의 조합은 SGD에 비해 수렴성과 최종 정확도를 크게 향상시켰다.
  • 더 깊은 네트워크(예: 수정된 LeNet 및 SqueezeNet)에서 ReLU 활성화 함수와 소프트맥스 손실이 tanH 및 시그모이드보다 우수한 성능을 보였는데, 이는 기울기 소실 문제를 줄였기 때문이다.
  • SqueezeNet을 활용한 전이 학습은 제한된 훈련 데이터 조건에서도 높은 성능(90%)을 달성하여, 낮은 데이터 기반 기호 인식 작업에 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.