Skip to main content
QUICK REVIEW

[논문 리뷰] DropSample: A New Training Method to Enhance Deep Convolutional Neural Networks for Large-Scale Unconstrained Handwritten Chinese Character Recognition

Weixin Yang, Lianwen Jin|arXiv (Cornell University)|2015. 05. 20.
Handwritten Text Recognition Techniques참고 문헌 57인용 수 4
한 줄 요약

이 논문은 깊이 학습된 합성곱 신경망(DCNNs)을 위한 새로운 학습 방법인 DropSample을 소개한다. 이 방법은 분류 신뢰도에 기반해 학습 샘플을 동적으로 재가중함으로써, 낮은 신뢰도를 보이는 샘플을 우선적으로 처리함으로써 학습 효율성을 향상시킨다. 대규모 비제약 조건의 중국어 한자 수기 인식에 적용된 DropSample은 도메인 특화 지식 레이어를 통합하여 각각 CASIA-OLHDWB 1.0, CASIA-OLHWDB 1.1 및 ICDAR 2013 데이터셋에서 97.33%, 97.06%, 97.51%의 최고 성능을 기록하였다.

ABSTRACT

Inspired by the theory of Leitners learning box from the field of psychology, we propose DropSample, a new method for training deep convolutional neural networks (DCNNs), and apply it to large-scale online handwritten Chinese character recognition (HCCR). According to the principle of DropSample, each training sample is associated with a quota function that is dynamically adjusted on the basis of the classification confidence given by the DCNN softmax output. After a learning iteration, samples with low confidence will have a higher probability of being selected as training data in the next iteration; in contrast, well-trained and well-recognized samples with very high confidence will have a lower probability of being involved in the next training iteration and can be gradually eliminated. As a result, the learning process becomes more efficient as it progresses. Furthermore, we investigate the use of domain-specific knowledge to enhance the performance of DCNN by adding a domain knowledge layer before the traditional CNN. By adopting DropSample together with different types of domain-specific knowledge, the accuracy of HCCR can be improved efficiently. Experiments on the CASIA-OLHDWB 1.0, CASIA-OLHWDB 1.1, and ICDAR 2013 online HCCR competition datasets yield outstanding recognition rates of 97.33%, 97.06%, and 97.51% respectively, all of which are significantly better than the previous best results reported in the literature.

연구 동기 및 목표

  • 대규모 비제약 조건의 수기 중국어 한자 인식(HCCR)에서 깊이 학습된 합성곱 신경망(DCNNs)의 효율성과 정확도를 향상시키는 것.
  • 이미 잘 인식되는 샘플에 대한 반복적인 학습으로 인한 DCNN의 비효율적 학습 문제를 해결하는 것.
  • 어려운 낮은 신뢰도 샘플에 집중할 수 있도록 동적으로 조정되는 샘플링 전략을 개발하는 것.
  • 모델 성능 향상을 위해 도메인 특화 지식을 CNN 아키텍처에 통합하는 것.

제안 방법

  • DropSample는 각 학습 샘플에 대해 학습 반복 후 DCNN의 소프트맥스 신뢰도 출력에 기반해 동적으로 조정되는 할당량 함수를 도입한다.
  • 낮은 분류 신뢰도를 보이는 샘플은 이후 학습 반복에서 더 높은 선택 확률을 부여받아 학습 영향력을 높인다.
  • 잘 분류된 높은 신뢰도 샘플은 점차 우선순위가 낮아지고 학습에서 제거되어 중복을 줄이고 효율성을 향상시킨다.
  • 기존 CNN 이전에 도메인 지식 레이어를 삽입하여 작업에 특화된 불변성과 구조적 사전 지식을 네트워크에 통합한다.
  • 동적 샘플링과 아키텍처 기반의 유도적 편향을 조합하여 특징 학습과 일반화 능력을 향상시킨다.
  • 학습 과정은 하드 예제에 집중함으로써 모델 용량을 반복적으로 정교화하며, 인지심리학의 레이트너 학습 상자 원리를 모방한다.

실험 결과

연구 질문

  • RQ1모델의 신뢰도에 기반해 학습 샘플을 동적으로 재가중하는 것이 HCCR에서 DCNN의 수렴성과 정확도를 향상시키는가?
  • RQ2낮은 신뢰도 샘플을 우선 처리하는 것이 학습 효율성과 최종 인식 성능에 어떤 영향을 미치는가?
  • RQ3도메인 특화 지식이 비제약 조건의 수기 중국어 한자 인식에서 DCNN 성능을 얼마나 향상시킬 수 있는가?
  • RQ4동적 샘플링과 아키텍처 기반의 유도적 편향을 조합했을 때 기존 학습 프로토콜에 비해 우수한 성능을 내는가?

주요 결과

  • DropSample는 CASIA-OLHDWB 1.0 데이터셋에서 97.33%의 인식 정확도를 달성하여 이전 최고 성능을 초월하였다.
  • CASIA-OLHWDB 1.1 데이터셋에서는 97.06%의 정확도를 기록하여 다양한 데이터 분포에 대한 강건성을 입증하였다.
  • ICDAR 2013 온라인 HCCR 벤치마크에서 97.51%의 인식률을 기록하여 새로운 최고 성능을 수립하였다.
  • DropSample와 도메인 특화 지식의 통합은 모델의 일반화 능력과 수렴 속도를 크게 향상시켰다.
  • 동적 샘플링 메커니즘은 높은 신뢰도 샘플의 우선순위를 낮춤으로써 학습 중복을 줄여 더 빠르고 효율적인 학습을 가능케 하였다.
  • 이 방법의 효과성은 세 가지 서로 다른 대규모 HCCR 벤치마크를 통해 검증되었으며, 일반화 가능성도 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.