[논문 리뷰] OrigamiNet: Weakly-Supervised, Segmentation-Free, One-Step, Full Page Text Recognition by learning to unfold
OrigamiNet는 2차원 텍스트 레이아웃을 1차원 시퀀스로 암묵적으로 펼치는 방식을 학습함으로써, 어떤 완전 컨volution 신경망 기반 단일 라인 텍스트 인식기라도 단일 순방향 프로세스로 전면 텍스트 인식을 수행할 수 있도록 하는 새로운, 약한 감독을 받는, 세그먼테이션 없는, 단단계 신경망 모듈을 제안한다. 이는 단지 세그먼테이션되지 않은 이미지-텍스트 쌍과 단일 순방향 프로세스만을 사용하여 IAM 및 ICDAR 2017 벤치마크에서 최고 수준의 문자 오류율을 달성한다.
Text recognition is a major computer vision task with a big set of associated challenges. One of those traditional challenges is the coupled nature of text recognition and segmentation. This problem has been progressively solved over the past decades, going from segmentation based recognition to segmentation free approaches, which proved more accurate and much cheaper to annotate data for. We take a step from segmentation-free single line recognition towards segmentation-free multi-line / full page recognition. We propose a novel and simple neural network module, termed extbf{OrigamiNet}, that can augment any CTC-trained, fully convolutional single line text recognizer, to convert it into a multi-line version by providing the model with enough spatial capacity to be able to properly collapse a 2D input signal into 1D without losing information. Such modified networks can be trained using exactly their same simple original procedure, and using only extbf{unsegmented} image and text pairs. We carry out a set of interpretability experiments that show that our trained models learn an accurate implicit line segmentation. We achieve state-of-the-art character error rate on both IAM \& ICDAR 2017 HTR benchmarks for handwriting recognition, surpassing all other methods in the literature. On IAM we even surpass single line methods that use accurate localization information during training. Our code is available online at \url{https://github.com/IntuitionMachines/OrigamiNet}.
연구 동기 및 목표
- 전면 수기 텍스트 인식에서 명시적인 텍스트 라인 세그먼테이션의 필요성을 제거하기 위해.
- 라인 수준의 애너테이션 없이도, 단지 세그먼테이션되지 않은 이미지-텍스트 쌍만을 사용하여 다중 라인 텍스트 인식기의 엔드 투 엔드 훈련을 가능하게 하기 위해.
- 어떤 단일 라인 CTC 기반 인식기라도 전면 인식기로 전환할 수 있는 단순하고 즉시 사용 가능한 모듈을 개발하기 위해.
- 모델이 국소화 감독 없이도 암묵적으로 정확한 라인 세그먼테이션을 학습할 수 있음을 입증하기 위해.
- 라인 수준의 애너테이션 없이도, 복잡한 훈련 레시피 없이도 전면 수기 텍스트 인식 벤치마크에서 최고 성능을 달성하기 위해.
제안 방법
- 이 방법은 2차원 입력 특징을 1차원 시퀀스 표현으로 변환하기 위해 공간 브로드럽(스페이셜 브로드럽)과 업샘플링을 적용하는 신경망 서브모듈인 OrigamiNet을 도입한다.
- CTC 손실 함수를 활용하여, 자연스럽게 선형 1차원 정렬을 유도함으로써, 모델이 2차원 공간 배치를 1차원 문자 시퀀스로 압축하도록 유도한다.
- 기존의 완전 컨volution 신경망 기반 단일 라인 텍스트 인식기에 이 모듈을 통합하여, 단일 순방향 프로세스로 전면 이미지를 처리할 수 있도록 한다.
- 모델은 라인 경계나 단어 수준의 애너테이션 없이도, 단지 세그먼테이션되지 않은 이미지와 텍스트 쌍만을 사용하여 훈련된다.
- 이 방법은 순환층을 피하고 단순한 피드포워드 연결에 의존하므로, 효율적인 단일 단계 추론을 가능하게 한다.
- 기울기 기반 기여도 맵을 통해 해석 가능성을 평가하였으며, 이는 각 문자 출력이 입력 이미지의 공간 영역과 어떻게 연결되어 있는지를 시각화한다.
실험 결과
연구 질문
- RQ1신경망은 라인 경계에 대한 어떤 감독 없이도 다중 라인 텍스트 레이아웃을 개별 라인으로 암묵적으로 세그먼트할 수 있는가?
- RQ2단일 통합 네트워크 순방향 프로세스로도, 명시적인 라인 세그먼테이션을 사용하는 방법보다 뛰어난 성능을 달성할 수 있는가?
- RQ3공간 전개 모듈이 추가된 CTC 기반 아키텍처는 약한 감독, 세그먼테이션되지 않은 데이터에서 훈련될 때 정확도를 유지하거나 향상시키는가?
- RQ4정교한 문서 레이아웃, 예를 들어 비틀린, 닿아 있는, 또는 기울인 라인과 같은 경우에도, 미세조정 없이 일반화 성능을 유지할 수 있는가?
- RQ5감독 없이도 암묵적인 라인 세그먼테이션을 학습한 모델의 결과는 설명 가능하고 공간적으로 정확한가?
주요 결과
- OrigamiNet는 750×750 입력 해상도를 사용하여 IAM 데이터셋에서 최고 수준의 문자 오류율(CER) 5.5%를 달성하였으며, 라인 수준 애너테이션을 사용한 이전 방법들을 능가한다.
- ICDAR 2017 HTR 벤치마크에서 GTR-12 OrigamiNet 모델은 CER 4.7%를 기록하여, 라인 브레이크 애너테이션을 모두 사용한 이전 방법들보다 뛰어난 성능을 보였다.
- 500×500 입력 해상도에서 IAM에서 CER 5.6%를 기록하여, 저해상도에서도 뛰어난 성능을 보였다.
- 해석 가능성 실험 결과, 기울기 기여도 맵이 문자를 해당 라인에 정확히 국소화하고 있음을 보여주어, 모델이 정확한 암묵적 라인 세그먼테이션을 학습하고 있음을 시사한다.
- 접촉하는 라인이나 비틀린 텍스트와 같은 합성 왜곡에 대해서도 일반화 성능이 뛰어나며, 미세조정 없이도 안정적인 성능을 유지한다.
- 수평으로 뒤집힌 이미지와 전사본으로 훈련했을 때도 유사한 성능을 기록함으로써, 모델이 데이터에서 독해 순서를 학습하고 있으며, 공간적 편향에 의존하지 않는다는 것을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.