Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Text-Independent Writer Identification based on word level data

Vineet Kumar, Suresh Sundaram|arXiv (Cornell University)|2022. 02. 21.
Handwritten Text Recognition Techniques참고 문헌 49인용 수 6
한 줄 요약

이 논문은 SIFT 키포인트와 사전 훈련된 CNN을 활용하여 계층적 특징을 추출하는 워드 레벨 이미지를 사용하는 오프라인, 텍스트 독립적 글자 식별 시스템을 제안한다. 엔트로피 기반 필터 가중치와 CNN 특징 맵에 대한 히스토그램 기반 기반의 기울기(HOG)를 적용하여 강건한 고정 크기의 표현을 도출하며, IAM에서 98.17%의 상위-1 정확도와 CVL에서 99.0%의 정확도를 달성하여 이전의 워드 레벨 방법들을 능가한다.

ABSTRACT

This paper proposes a novel scheme to identify the authorship of a document based on handwritten input word images of an individual. Our approach is text-independent and does not place any restrictions on the size of the input word images under consideration. To begin with, we employ the SIFT algorithm to extract multiple key points at various levels of abstraction (comprising allograph, character, or combination of characters). These key points are then passed through a trained CNN network to generate feature maps corresponding to a convolution layer. However, owing to the scale corresponding to the SIFT key points, the size of a generated feature map may differ. As an alleviation to this issue, the histogram of gradients is applied on the feature map to produce a fixed representation. Typically, in a CNN, the number of filters of each convolution block increase depending on the depth of the network. Thus, extracting histogram features for each of the convolution feature map increase the dimension as well as the computational load. To address this aspect, we use an entropy-based method to learn the weights of the feature maps of a particular CNN layer during the training phase of our algorithm. The efficacy of our proposed system has been demonstrated on two publicly available databases namely CVL and IAM. We empirically show that the results obtained are promising when compared with previous works.

연구 동기 및 목표

  • 입력 샘플에 특정 텍스트 내용이 필요하지 않은 텍스트 독립적 글자 식별 시스템을 개발하는 것.
  • SIFT 키포인트 영역에서 유도되는 크기가 변하는 특징 맵 문제를 해결하기 위해 HOG를 활용한 고정 크기 표현을 제안하는 것.
  • 딥 컨볼루션 특징 추출 시 계산 부담과 차원 수를 줄이기 위해 CNN 레이어에 대해 엔트로피 기반 필터 중요도 측정법을 도입하는 것.
  • 다양한 스케일의 SIFT 특징과 딥 컨볼루션 표현을 융합하여 워드 레벨 데이터에서의 글자 식별 정확도를 향상시키는 것.

제안 방법

  • SIFT는 워드 이미지 전반에 걸쳐 알로그래프, 문자 또는 그 조합 수준의 다중 추상화 수준에서 키포인트 영역을 탐지하도록 수정된다.
  • 이 키포인트 영역들은 사전 훈련된 CNN에 입력되어 척도 차이로 인해 크기가 다른 컨볼루션 특징 맵을 생성한다.
  • 특징 맵 크기를 정규화하기 위해 각 특징 맵에 대해 기울기 히스토그램(HOG)을 계산하여 고정 길이의 기술자(descriptor)를 생성한다.
  • 희소 주성분 분석(sparse PCA)을 HOG 특징에 적용하여 엔트로피 기반 중요도 측정법을 유도하며, 훈련 중에 정보가 많은 특징을 우선시하는 CNN 필터의 선택적 가중치를 부여할 수 있다.
  • 최종 특징 표현은 여러 CNN 레이어의 HOG 기술자들을 그들의 학습된 중요도 점수에 따라 가중하여 조합하여, 더 나은 분류 성능을 확보한다.
  • 최종 특징 벡터는 서포트 벡터 머신(SVM) 분류기로 훈련되며, 평균 분류 점수를 사용하여 페이지 수준 데이터에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1특정 텍스트 내용이 필요 없이 단지 워드 레벨 이미지만을 사용하여 텍스트 독립적 글자 식별 시스템이 높은 정확도를 달성할 수 있는가?
  • RQ2SIFT 키포인트 영역에서 유도된 크기가 변하는 CNN 특징 맵을 어떻게 고정 크기 표현으로 정규화하여 강건한 분류를 가능하게 할 수 있는가?
  • RQ3엔트로피 기반 필터 가중치 전략은 심층 특징 추출 시 차원 수와 계산 부담을 효과적으로 줄일 수 있을까, 동시에 분류 능력을 유지할 수 있는가?
  • RQ4SIFT 기반의 다중 스케일 특징과 CNN, HOG 표현을 융합하면 기존의 워드 레벨 방법들보다 글자 식별 정확도를 향상시킬 수 있는가?
  • RQ5여러 워드 샘플을 집계하여 분류하는 페이지 수준 데이터에서 시스템의 성능은 어떠한가?

주요 결과

  • 제안된 시스템은 IAM 데이터셋에서 98.17%의 상위-1 정확도를 달성하여 WordImagenet(95.8%), FragNet-64(96.3%), GR-RNN(96.4%)와 같은 최신 워드 레벨 방법들을 능가한다.
  • CVL 데이터셋에서는 99.0%의 상위-1 정확도를 기록하였으며, Tang과 Wu(99.7%) 및 Christlein 등(99.2%)과 유사한 성능을 보였지만, 동일한 텍스트 내용을 공유하는 글자들 간의 식별 도전 과제에도 불구하고 성능을 유지를 하였다.
  • 페이지 수준 데이터에서의 성능은 개별 워드 이미지보다 높았는데, 이는 다수의 워드 레벨 분류 점수를 집계함으로써 정확도가 향상되었기 때문이다.
  • 유사한 손글씨 스타일을 가진 다른 신원의 글자들 사이에서 잘못된 수용(false acceptances)이 발생하는 것으로 나타났으며, 이는 그림 6에서 확인할 수 있었고, 이는 스타일 유사성을 구분하는 데에 한계가 있음을 시사한다.
  • 엔트로피 기반 필터 가중치 전략은 정보가 많은 필터를 강조함으로써 계산 부담을 줄이고 특징 표현의 품질을 향상시키는 데 성공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.