Skip to main content
QUICK REVIEW

[논문 리뷰] Open Set Chinese Character Recognition using Multi-typed Attributes

Sheng He, Lambert Schomaker|arXiv (Cornell University)|2018. 08. 27.
Handwritten Text Recognition Techniques참고 문헌 31인용 수 7
한 줄 요약

이 논문은 Pinyin, 획 수, 부수, 입력 방법 코드(Cangjie, Zhengma, Wubi, 네자리)와 같은 다중 유형의 속성을 사용하여 제로샷 및 희소샷 학습을 가능하게 하는 새로운 오픈셋 중화자 recognition 방법을 제안한다. CNN은 이러한 속성을 예측하도록 훈련되며, 속성 공간 내의 거리 기반 메트릭을 통해 인식이 수행되며, 역사적 및 인쇄된 문자 데이터셋에서 미리 보지 않은 문자에 대해 강력한 일반화 성능을 달성한다.

ABSTRACT

Recognition of Off-line Chinese characters is still a challenging problem, especially in historical documents, not only in the number of classes extremely large in comparison to contemporary image retrieval methods, but also new unseen classes can be expected under open learning conditions (even for CNN). Chinese character recognition with zero or a few training samples is a difficult problem and has not been studied yet. In this paper, we propose a new Chinese character recognition method by multi-type attributes, which are based on pronunciation, structure and radicals of Chinese characters, applied to character recognition in historical books. This intermediate attribute code has a strong advantage over the common `one-hot' class representation because it allows for understanding complex and unseen patterns symbolically using attributes. First, each character is represented by four groups of attribute types to cover a wide range of character possibilities: Pinyin label, layout structure, number of strokes, three different input methods such as Cangjie, Zhengma and Wubi, as well as a four-corner encoding method. A convolutional neural network (CNN) is trained to learn these attributes. Subsequently, characters can be easily recognized by these attributes using a distance metric and a complete lexicon that is encoded in attribute space. We evaluate the proposed method on two open data sets: printed Chinese character recognition for zero-shot learning, historical characters for few-shot learning and a closed set: handwritten Chinese characters. Experimental results show a good general classification of seen classes but also a very promising generalization ability to unseen characters.

연구 동기 및 목표

  • 50,000개 이상의 잠재적 문자가 존재하고 새로운, 미리보지 않은 문자가 흔한 역사적 중화자 인식에서 오픈셋 인식의 과제를 해결한다.
  • 큰 규모의 균형 잡힌 훈련 세트가 필요하고 희귀하거나 미리보지 않은 문자에 일반화하지 못하는 전통적인 클로즈드셋 인식 모델의 한계를 극복한다.
  • 부수, 발음, 구조와 같은 상징적이고 공유 가능한 속성을 활용하여 문자 간 지식을 전이하고 훈련 데이터를 초월한 일반화를 향상시킨다.
  • 문자들을 압축되고 해석 가능한 속성 공간에 표현하여 자원이 제한된 상황, 예를 들어 희소샷 또는 제로샷 학습에서도 효과적인 인식을 가능하게 한다.

제안 방법

  • 중화자를 Pinyin(발음), 획 수, 레이아웃 구조, 입력 방법 코드(Cangjie, Zhengma, Wubi, 네자리 인코딩)의 네 그룹의 속성으로 표현한다.
  • 특성 공간 내에서의 거리 기반 메트릭을 사용하여 테스트 문자를 완전한 어휘 사전에 저장된 가장 가까운 알려진 문자와 매칭한다.
  • 기울기 보정을 위해 다섯 개의 회전 각도에서 배경 선의 폭을 평가하여 역사적 문서 이미지의 작은 기울기 각도를 추정하고 보정한다.
  • 다단계 문자 분할 파이프라인을 구현한다: (1) 연결 성분을 통한 후보 박스 검출, (2) 폭 대 높이 비율(>0.8) 기반 필터링, (3) 평균 문자 높이를 사전 지식으로 사용, (4) 큰 박스 분할, (5) 이웃 박스 통합, (6) 일관된 높이와 너비를 확보하기 위해 행 단위로 박스 정렬.
  • 흰색 픽셀의 연속 길이 분포를 활용하여 텍스트 라인을 탐지함으로써 표준 투영 방법에 비해 노이즈와 표 테두리에 더 강건한 성능을 확보한다.

실험 결과

연구 질문

  • RQ1부수, 발음, 구조와 같은 다중 유형의 속성이 미리 보지 않은 문자에 대한 일반화를 가능하게 하도록 중화자를 효과적으로 표현할 수 있는가?
  • RQ2CNN 기반의 속성 예측기가 오픈셋 인식 환경에서 희귀하거나 미리보지 않은 문자에 얼마나 잘 일반화되는가?
  • RQ3제로샷 및 희소샷 설정에서 속성 기반 인식이 전통적인 원핫 인식보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4제안된 분할 및 전처리 파이프라인은 노이즈가 많고 기울어진 역사적 문서 이미지에서 개별 문자를 신뢰성 있게 추출할 수 있는가?

주요 결과

  • 제안된 방법은 제로샷 및 희소샷 학습 환경에서 미리 보지 않은 문자에 대해 강력한 일반화 성능을 보이며, 훈련 분포를 초월한 안정성을 입증한다.
  • 인쇄된 중화자(제로샷)와 역사적 중화자(희소샷)에 대한 인식 성능은 전통적인 클로즈드셋 모델보다 뚜렷한 향상을 보였다.
  • 다중 유형의 속성 사용은 원핫 인코딩 대비 효과적인 분류 공간을 감소시켜 50,000개 이상의 잠재적 문자가 존재하는 환경에서도 확장 가능한 인식을 가능하게 했다.
  • CNN 기반의 속성 예측 모델은 문자 간 구조적 및 발음적 유사성을 포괄하는 이전에 학습된 표현을 성공적으로 학습했다.
  • 문자 분할 파이프라인은 붙어 있는 문자와 내부 노이즈를 효과적으로 처리하여 정확하고 일관된 문자 경계 상자(Bounding Box)를 생성했다.
  • 배경 선 폭 최대화 기반 기울기 보정은 Hough 변환에 의존하지 않고도 작은 기울기 각도를 신뢰성 있게 보정하여 후속 인식 정확도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.