Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Architecture based on Fuzzy Perceptual Representation For Online Multilingual Handwriting Recognition

Hanen Akouaydi, Sourour Njah|arXiv (Cornell University)|2019. 08. 01.
Handwritten Text Recognition Techniques참고 문헌 33인용 수 11
한 줄 요약

이 논문은 퍼지 지각 표현과 컨volution 리커런트 LSTM을 사용한 온라인 다국어 수기 인식을 위한 두 가지 딥러닝 기반 시스템을 제안한다. 첫 번째 시스템은 베타 타원형 모델을 활용해 지각적 스트로크 특징을 추출하고, 이를 LSTM을 통해 분류한다. 두 번째 시스템은 모바일 기기에서 얻은 (x, y, z) 궤적 데이터에 직접 ConvLSTM를 적용한다. 이 방법은 다양한 데이터베이스에서 라틴 및 아랍 문자에 대해 98% 이상의 인식 정확도를 달성하여 노이즈와 지각적 모호성에 강건함을 입증한다.

ABSTRACT

Due to the omnipresence of mobile devices, online handwritten scripts have become the most important feeding input to smartphones and tablet devices. To increase online handwriting recognition performance, deeper neural networks have extensively been used. In this context, our paper handles the problem of online handwritten script recognition based on extraction features system and deep approach system for sequences classification. Many solutions have appeared in order to facilitate the recognition of handwriting. Accordingly, we used an existent method and combined with new classifiers in order to get a flexible system. Good results are achieved compared to online characters and words recognition system on Latin and Arabic scripts. The performance of our two proposed systems is assessed by using five databases. Indeed, the recognition rate exceeds 98%.

연구 동기 및 목표

  • 지각 기반 특징 추출과 딥러닝을 활용해 다국어 스크립트의 온라인 수기 인식 성능을 향상시키는 것.
  • 글쓰기 속도, 스타일, 노이즈 등에 의한 변동성을 해소하기 위해 지각 전처리 프레임워크를 도입하는 것.
  • 다양한 스크립트에서 문자 수준 및 단어 수준의 인식을 동시에 처리할 수 있는 유연하고 강건한 시스템을 개발하는 것.
  • 실생활 모바일 기기에서 확보한 데이터와 표준 벤치마크에서 시스템 성능을 평가하는 것.
  • 스트로크 분할의 진단 잠재력을 활용해 신경학적 질환과 관련된 떨림 유발 수기 이상을 탐지하는 것.

제안 방법

  • 지각 시스템은 인간의 지각 법칙에 기반해 근접성과 유사성 원칙에 따라 수기 스트로크를 기본 지각 단위로 분할하는 데 베타 타원형 모델을 사용한다.
  • 스트로크는 기본 지각 코드(Basic Perceptual Codes, BCP)로 분류되며, 이를 LSTM 네트워크에 입력해 시퀀스 분류를 수행한다.
  • 두 번째 시스템은 모바일 기기에서 수집한 원시 (x, y, z) 궤적 데이터에 직접 ConvLSTM를 적용해 엔드 투 엔드 인식을 수행한다.
  • 수기의 지각적 불확실성을 모델링하기 위해 퍼지 논리와 퍼지 기반 참값 학습 전략을 시스템에 통합한다.
  • 노이즈에 대한 강건성을 평가하기 위해 학습 및 테스트 세트에 무작위 노이즈를 주입하고, 다양한 노이즈 수준에서 성능을 측정한다.
  • 베타 타원형 모델은 분할 외에도 노이즈 감소 및 신호 샘플링 등의 전처리 기능을 수행한다.

실험 결과

연구 질문

  • RQ1인간과 유사한 지각 법칙에 기반한 퍼지 지각 표현이 온라인 수기 인식 정확도를 향상시킬 수 있는가?
  • RQ2스트로크 분할에 베타 타원형 모델을 통합할 경우, 노이즈 조건 하에서 인식 성능 향상 정도는 어떠한가?
  • RQ3다국어 데이터셋에서 ConvLSTM 기반 엔드 투 엔드 시스템이 지각 특징 기반 접근 방식보다 얼마나 뛰어난가?
  • RQ4지각 모델은 뇌신경질환과 관련된 떨림 유발 수기 이상을 탐지하고 보조할 수 있는가?
  • RQ5수기에서 발생하는 지각 오류(예: '0'과 'O', 또는 '1'과 'l'의 모호성)는 인식 시스템에 어떤 영향을 미치며, 제안된 방법이 이러한 오류를 완화할 수 있는가?

주요 결과

  • 제안된 지각 기반 시스템(OnHSR-LSTM)은 고립된 단어에 대해 IRONOFF 데이터베이스에서 93%의 인식률을 기록했다.
  • ConvLSTM 기반 시스템(OnHR-convLSTM)은 IRONOFF 데이터베이스에서 98%의 인식률을 달성하여 지각 방법을 초월했다.
  • LMCA 및 수작업으로 분할된 ADAB 데이터베이스에서 OnHR-convLSTM 시스템은 98.5%의 인식 정확도를 기록하여 다국어 스크립트에서 뛰어난 성능을 입증했다.
  • 노이즈 추가 시, 전처리 없이 OnHR-convLSTM 시스템의 성능은 50.45%로 하락했지만, teta 및 4개의 EPCs를 사용할 경우 74.41%로 향상되어 전처리의 가치를 입증했다.
  • 베타 타원형 모델은 떨림 효과를 효과적으로 감소시켰으며, 시각화 결과에서 스트로크 트레이스에서 떨림을 제거한 것으로 확인되었다.
  • 문맥적 및 동적 특징을 활용함으로써 시스템은 '0'과 'O', 또는 '1'과 'l'과 같은 지각적 오류가 발생하는 문자에 대해 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.