Skip to main content
QUICK REVIEW

[논문 리뷰] Sequence-to-Label Script Identification for Multilingual OCR

Yasuhisa Fujii, Karel Driesen|arXiv (Cornell University)|2017. 08. 15.
Handwritten Text Recognition Techniques참고 문헌 9인용 수 4
한 줄 요약

이 논문은 다국어 OCR 스크립트 식별을 위한 순서에서 레이블로의 접근법을 제안하며, 이 작업을 엔코더-요약기 아키텍처로 설정하고 종단 간 훈련을 수행한다. 이전의 순서에서 순서로의 방법 대신 더 단순하고 효율적인 순서에서 레이블로의 모델로 대체함으로써, 232개 언어, 30개 스크립트로 구성된 데이터셋에서 스크립트 식별 오차율이 16% 감소하고, 스크립트 오식별로 인한 문자 오차율이 33% 감소하였다.

ABSTRACT

We describe a novel line-level script identification method. Previous work repurposed an OCR model generating per-character script codes, counted to obtain line-level script identification. This has two shortcomings. First, as a sequence-to-sequence model it is more complex than necessary for the sequence-to-label problem of line script identification. This makes it harder to train and inefficient to run. Second, the counting heuristic may be suboptimal compared to a learned model. Therefore we reframe line script identification as a sequence-to-label problem and solve it using two components, trained end-toend: Encoder and Summarizer. The encoder converts a line image into a feature sequence. The summarizer aggregates the sequence to classify the line. We test various summarizers with identical inception-style convolutional networks as encoders. Experiments on scanned books and photos containing 232 languages in 30 scripts show 16% reduction of script identification error rate compared to the baseline. This improved script identification reduces the character error rate attributable to script misidentification by 33%.

연구 동기 및 목표

  • 다국어 OCR에서 라인 수준의 스크립트 식별에 대해 이전의 순서에서 순서로의 모델이 효율성이 떨어지고 성능이 최적화되지 않는 문제를 해결하기 위해.
  • 작업을 순서에서 레이블 문제로 재정의함으로써 스크립트 식별 정확도를 향상시키고 계산 비용을 줄이기 위해.
  • 공유된 엔코더와 함께 다양한 요약기 아키텍처(예: Gate, LSTM, Mean, Max)를 조합하여 최적의 성능을 평가하기 위해.
  • 다국어 OCR 시스템에서 스크립트 오식별로 인한 문자 오차율을 줄이기 위해.
  • 혼합 스크립트 라인 처리에 대한 한계를 탐색하고 향후 종단 간 통합을 위한 방향을 제안하기 위해.

제안 방법

  • 이 방법은 인셉션 스타일의 컨볼루션 네트워크를 사용하여 라인 이미지를 깊이 특징의 시퀀스로 변환하는 엔코더를 사용한다.
  • 요약기 컴ponent는 Gate, LSTM, Mean, Max 풀링 등 다양한 아키텍처를 통해 특징 시퀀스를 단일 레이블(스크립트)로 요약한다.
  • Gate 요약기는 학습된 어텐션을 사용하여 특징적인 문자 특징, 예를 들어 독특한 키릴 문자나 데바나가리 문자를 강조한다.
  • 전체 시스템은 스크립트 분류 작업에 대해 교차 엔트로피 손실을 사용하여 종단 간 훈련된다.
  • 이전 방법의 문자 수준 예측에 대한 카운팅 히우리스틱을 직접적인 순서에서 레이블 분류로 대체한다.
  • 이 시스템은 스캔된 책과 사진을 포함한 다양한 데이터셋에서 평가되었으며, 이 데이터셋에는 30개 스크립트에 걸쳐 232개 언어가 포함되어 있다.

실험 결과

연구 질문

  • RQ1다국어 OCR에서 라인 수준의 스크립트 식별에 대해 순서에서 레이블로의 설정이 이전의 순서에서 순서로의 접근법을 능가할 수 있는가?
  • RQ2Gate, LSTM, Mean, Max 등 다양한 요약기 아키텍처는 정확도와 효율성 측면에서 어떻게 비교되는가?
  • RQ3개선된 스크립트 식별은 잘못 분류로 인한 문자 오차율을 어느 정도 줄일 수 있는가?
  • RQ4LSTM과 마찬가지로 순서 모델임에도 불구하고 Gate 요약기가 왜 LSTM을 능가하는가?
  • RQ5혼합 스크립트 라인을 처리할 때 현재의 라인 수준 스크립트 식별 접근법의 한계는 무엇인가?

주요 결과

  • 제안된 순서에서 레이블로의 방법은 이전의 순서에서 순서로의 베이스라인 대비 스크립트 식별 오차율을 16% 감소시켰다.
  • Gate 요약기는 학습된 어텐션을 활용하여 키릴 문자나 데바나가리 문자와 같은 특징적인 스크립트 특징에 집중함으로써 최고의 성능을 기록했다.
  • 향상된 스크립트 식별은 스크립트 오식별로 인한 문자 오차율을 33% 감소시켰다.
  • 보다 단순한 아키텍처 덕분에 이전의 순서에서 순서로의 모델보다 계산적으로 더 효율적이었다.
  • 사진 데이터에서 비라틴 스크립트를 처리할 때 오류율이 오라클 케이스 대비 두 배로 증가했으며, 이는 이러한 스크립트에 대한 훈련 데이터가 부족하기 때문이다.
  • LSTM 모델은 순서 모델링 능력이 있음에도 불구하고 Gate 요약기보다 성능이 떨어지지 않았으며, 이는 이 작업에 어텐션 메커니즘이 더 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.