Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Self-Taught Learning for Handwritten Character Recognition

Frédéric Bastien, Yoshua Bengio|arXiv (Cornell University)|2010. 09. 18.
Handwritten Text Recognition Techniques참고 문헌 24인용 수 13
한 줄 요약

이 논문은 손글씨 문자 인식 성능을 향상시키기 위해 확률적 데이터 증강을 활용한 딥 데스트플레인 학습을 제안한다. 노이즈, 변형, 배경 변화 등을 포함한 극도로 왜곡되거나 분포 외의 문자 이미지에서 깊이 있는 스택드 디노이징 오토에인코더(SDA)를 훈련시킴으로써, MNIST 숫자와 62개 클래스의 NIST 문자 인식에서 인간 수준의 성능을 달성하였으며, 얕은 모델과 이전 최고 성능 결과를 모두 능가하였다.

ABSTRACT

Recent theoretical and empirical work in statistical machine learning has demonstrated the importance of learning algorithms for deep architectures, i.e., function classes obtained by composing multiple non-linear transformations. Self-taught learning (exploiting unlabeled examples or examples from other distributions) has already been applied to deep learners, but mostly to show the advantage of unlabeled examples. Here we explore the advantage brought by {\em out-of-distribution examples}. For this purpose we developed a powerful generator of stochastic variations and noise processes for character images, including not only affine transformations but also slant, local elastic deformations, changes in thickness, background images, grey level changes, contrast, occlusion, and various types of noise. The out-of-distribution examples are obtained from these highly distorted images or by including examples of object classes different from those in the target test set. We show that {\em deep learners benefit more from out-of-distribution examples than a corresponding shallow learner}, at least in the area of handwritten character recognition. In fact, we show that they beat previously published results and reach human-level performance on both handwritten digit classification and 62-class handwritten character recognition.

연구 동기 및 목표

  • 손글씨 문자 인식에서 깊이 있는 아키텍처가 얕은 모델보다 분포 외 예제로부터 더 많은 이점을 얻는지 조사하기 위해.
  • 노이즈, 변형, 배경 변화와 같은 광범위한 데이터 증강이 청소된 실제 테스트 데이터로의 일반화에 어떤 영향을 미치는지 평가하기 위해.
  • 훈련 중 관련되지만 다른 문자 클래스를 함께 사용하는 다중 작업 학습이 목표 작업 성능 향상에 기여하는지 평가하기 위해.
  • 풍부한 레이블 데이터가 존재함에도 불구하고, 비지도 사전 훈련이 순수하게 지도 학습보다 더 나은 일반화를 가능하게 하는지 확인하기 위해.
  • 딥 러닝을 활용한 데스트플레인 학습이 이전 최고 성능 결과를 초월할 수 있음을 대규모 손글씨 문자 인식 벤치마크에서 입증하기 위해.

제안 방법

  • 저자는 아핀 변환, 기울기, 탄성 변형, 두께 변화, 배경 이미지, 대trast 이동, 가림, 노이즈 등을 포함한 극도로 왜곡된 문자 이미지를 생성하는 확률적 이미지 변환 시스템을 개발하였다.
  • 깊이 있는 아키텍처로 스택드 디노이징 오토에인코더(SDA)를 사용하였으며, 계층적인 특징 표현을 학습하기 위해 각 층을 단계적으로 디노이징 오토에인코딩을 통해 사전 훈련하였다.
  • SDA는 훈련 데이터를 확률적 변환 파이프라인을 사용해 증강하여 분포 외 예제를 시뮬레이션한 후, 레이블된 데이터를 사용해 지도 학습으로 미세 조정하였다.
  • 다중 작업 학습을 위해, 모든 62개의 문자 클래스(숫자, 대문자, 소문자)를 함께 훈련하고, 테스트 시에는 하위 집합(예: 숫자만)으로 비교하였다. 이는 고립된 작업에서 훈련된 모델과의 성능 비교를 포함한다.
  • 하이퍼파ram터는 검증 세트를 사용하여 선택하였으며, 성능 평가는 NIST 특수 데이터베이스 19의 청소된 테스트 세트에서 수행되었다.
  • 동일한 데이터 증강 및 평가 프로토콜을 사용하여, 훈련 시 흐트러진 데이터를 사용한 얕은 다층 퍼셉트론(MLP)과의 비교를 수행하였다.

실험 결과

연구 질문

  • RQ1손글씨 문자 인식에서 깊이 있는 아키텍처가 얕은 모델보다 분포 외 예제(예: 극도로 왜곡된 이미지)로부터 더 많은 이점을 얻는가?
  • RQ2증강된 분포 외 데이터로 훈련할 경우, 청소된 원래 테스트 데이터에서의 성능 향상은 어느 정도 이루어지는가?
  • RQ3다양한 관련된 문자 클래스로 훈련하는 다중 작업 학습이 깊이 있는 학습자에게 얕은 학습자보다 더 큰 이점을 제공하는가?
  • RQ4레이블 데이터가 풍부한 상황에서도, 비지도 학습을 통한 데스트플레인 학습이 다양한 비레이블 데이터를 활용해 일반화를 향상시킬 수 있는가?
  • RQ5비지도 사전 훈련과 데이터 증강을 통한 딥 러닝이 대규모 손글씨 문자 인식 작업에서 인간 수준의 성능을 달성할 수 있는가?

주요 결과

  • SDA 모델은 10개 클래스의 MNIST 숫자 인식 작업에서 테스트 오차율 1.4%를 기록하여 인간 수준의 성능을 달성하였으며, 동일한 테스트 세트에서 이전에 발표된 모든 결과를 뛰어넘었다.
  • 62개 클래스의 NIST 문자 인식 작업에서, SDA는 훈련 데이터를 왜곡된 상태로 사용했을 때(즉, NISTP) 테스트 오차율 18.7%를 기록하였으며, 동일 조건에서 얕은 MLP는 24.3%를 기록하여 상당한 성능 향상을 보였다.
  • 청소된 숫자 데이터에서 훈련된 SDA의 오차율 향상 비율은 93%였지만, MLP는 오직 -10%에 머물렀으며, 이는 깊이 있는 모델이 데이터 증강에서 훨씬 더 큰 이점을 얻음을 시사한다.
  • 모든 세 가지 작업(숫자, 대문자, 소문자)을 함께 훈련한 SDA는 각 작업을 별도로 훈련한 경우 대비 오차율을 27% 상대적으로 향상시켰지만, MLP는 숫자 작업에서 오직 5.6%의 상대적 향상만 기록하였다.
  • 청소된 데이터로만 훈련한 경우 대비, 극도로 왜곡된 데이터(P07)로 훈련한 SDA는 청소된 데이터에서 오차율을 228% 감소시켰으며, 이는 분포 외 예제로부터 강력한 일반화 능력을 보여준다.
  • NIST 특수 데이터베이스 19에서 SDA는 10개 클래스 및 62개 클래스 작업 모두에서 이전 최고 성능 방법들을 모두 능가하여, 발표 당시 기록된 바 가장 낮은 오차율을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.