Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-Shot Chinese Character Recognition with Stroke-Level Decomposition

Jingye Chen, Bin Li|arXiv (Cornell University)|2021. 06. 22.
Handwritten Text Recognition Techniques참고 문헌 16인용 수 6
한 줄 요약

이 논문은 영역 없는 중국어 문자 인식을 위한 스트로크 수준 분해 방법을 제안하며, 각 문자를 다섯 가지 기본 스트로크의 순서로 간주하여 문자 및 부수의 영역 없는 문제를 해결한다. 시amese 네트워크를 활용한 매칭 기반 전략을 통해 수작업, 인쇄, 현장 문자에서 최신 기술 성능을 달성하며, 최소한의 적응으로 한국어 문자로도 효과적으로 일반화된다.

ABSTRACT

Chinese character recognition has attracted much research interest due to its wide applications. Although it has been studied for many years, some issues in this field have not been completely resolved yet, e.g. the zero-shot problem. Previous character-based and radical-based methods have not fundamentally addressed the zero-shot problem since some characters or radicals in test sets may not appear in training sets under a data-hungry condition. Inspired by the fact that humans can generalize to know how to write characters unseen before if they have learned stroke orders of some characters, we propose a stroke-based method by decomposing each character into a sequence of strokes, which are the most basic units of Chinese characters. However, we observe that there is a one-to-many relationship between stroke sequences and Chinese characters. To tackle this challenge, we employ a matching-based strategy to transform the predicted stroke sequence to a specific character. We evaluate the proposed method on handwritten characters, printed artistic characters, and scene characters. The experimental results validate that the proposed method outperforms existing methods on both character zero-shot and radical zero-shot tasks. Moreover, the proposed method can be easily generalized to other languages whose characters can be decomposed into strokes.

연구 동기 및 목표

  • 기존의 자료 집약적인 모델이 테스트 세트에서 볼 수 없는 문자나 부수를 인식할 수 없는 영역 없는 중국어 문자 인식의 지속적인 문제를 해결한다.
  • 학습 데이터에 존재하지 않는 새로운 문자나 부수를 만났을 때 실패하는 문자 기반 및 부수 기반 방법의 한계를 극복한다.
  • 더 기본적이며 영역 없는 실패에 덜 취약한 기본 스트로크의 순서로 문자를 모델링함으로써 인간과 유사한 일반화 능력을 활용한다.
  • 일대다 매핑 문제(동일한 스트로크 순서를 공유하는 여러 문자)를 해결하기 위해 매칭 기반 전략을 개발하여 볼 수 없는 문자의 정확한 인식을 가능하게 한다.
  • 유사한 스트로크 구조를 가진 동아시아 문자들 간의 이식성을 보여주기 위해 한국어 문자로의 확장으로 교차 언어 일반화를 시연한다.

제안 방법

  • 유니코드 한 데이터베이스 기반으로 각 중국어 문자를 수평, 수직, 왼쪽 아래로 향하는, 오른쪽 아래로 향하는, 그리고 굽는 다섯 가지 기본 스트로크 유형으로 분해한다.
  • 엔코더-디코더 아키텍처를 사용하여 입력 문자 이미지에서 스트로크 순서를 예측하는 딥 러닝 모델을 훈련시키며, ResNet과 Transformer 구성 요소를 포함한다.
  • 일대다 문제(동일한 스트로크 순서를 공유하는 여러 문자)를 해결하기 위해 예측된 스트로크 순서를 후보 문자 임베딩과 비교하는 시amese 네트워크 기반 매칭 전략을 적용한다.
  • 두 단계의 디코딩 프로세스를 사용한다: 먼저 스트로크 순서를 예측하고, 그 다음에 학습된 임베딩을 사용해 가장 유사한 알려진 문자와 매칭한다.
  • 모든 가능한 문자의 임베딩을 사전에 저장할 필요 없이 후보 문자와 서포트 샘플의 임베딩만 저장함으로써 메모리 비용을 절감한다.
  • 유사한 스트로크 구조를 가진 한국어 문자에도 동일한 스트로크 기반 프레임워크를 적용함으로써 교차 언어 전이를 가능하게 한다. 이는 한국어 문자도 동일한 다섯 가지 스트로크 유형으로 분해되며, 일관된 쓰기 순서를 가진다.

실험 결과

연구 질문

  • RQ1스트로크 수준 분해 접근법이 중국어 문자 인식에서 문자 영역 없는 문제를 근본적으로 해결할 수 있는가?
  • RQ2제안된 방법은 기존의 부수 기반 방법이 애로를 겪는 부수 영역 없는 문제를 해결할 수 있는가?
  • RQ3스트로크 순서와 문자 간의 일대다 매핑을 해결하기 위해 사용된 매칭 기반 전략의 효과는 어떠한가?
  • RQ4이 모델은 스트로크 기반 문자 구조가 유사한 언어, 예를 들어 한국어에 대해 어느 정도 일반화되는가?
  • RQ5기존의 문자 기반 및 부수 기반 영역 없는 CCR 방법과 비교해 성능 및 효율성 측면에서 어떻게 성과를 내는가?

주요 결과

  • 제안된 방법은 문자 영역 없는 설정에서 CTW 데이터셋에서 85.29%의 정확도를 달성하여 기존 방법들(보이는 경우 89.25%는 달성하나 영역 없는 경우는 낮음)을 능가한다.
  • 부수 영역 없는 설정에서는 기존 접근법보다 크게 슈퍼어리어를 보이며, 볼 수 없는 부수에 대한 일반화 능력을 입증한다.
  • 한국어 문자 데이터셋에서 모델은 데이터의 80%로 훈련한 후 78.00%의 영역 없는 인식 정확도를 달성하여 교차 언어 전이 가능성의 타당성을 입증한다.
  • 모델은 도메인 간 일반화 능력이 뛰어나다: 더 명확한 스트로크 구조 덕분에 인쇄 예술 문자에서 가장 우수한 성능을 보이며, 수작업 및 현장 문자에서도 베이스라인을 능가한다.
  • 두 단계의 디코딩에도 불구하고, 분류 헤드의 크기가 작아(6개 클래스 대 다수의 부수) 스트로크 기반 방법의 시간 비용(1.24초/샘플)은 부수 기반 방법(1.38초)보다 낮다.
  • 한국어 문자에 대해 데이터의 20%로만 훈련한 경우 모델은 23.09%의 영역 없는 정확도를 달성하여 극소수 데이터에서도 강력한 소수 샘플 일반화 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.