Skip to main content
QUICK REVIEW

[논문 리뷰] Learn to Augment: Joint Data Augmentation and Network Optimization for Text Recognition

Canjie Luo, Yuanzhi Zhu|arXiv (Cornell University)|2020. 03. 14.
Handwritten Text Recognition Techniques참고 문헌 46인용 수 8
한 줄 요약

이 논문은 인식 네트워크와 함께 최적화되는 학습 가능한, 에이전트 주도의 텍스트 인식을 위한 데이터 증강 방법을 제안한다. 히스토리컬 포인트를 조작하여 어려움이 있고 다양한 훈련 샘플을 생성함으로써, 특히 소규모 데이터셋에서 인식 정확도를 크게 향상시킨다. 이 방법은 IAM 손글씨 텍스트에서 단어 오류율 감소 측면에서 최신 기준보다 최대 5.08% 향상시켰다.

ABSTRACT

Handwritten text and scene text suffer from various shapes and distorted patterns. Thus training a robust recognition model requires a large amount of data to cover diversity as much as possible. In contrast to data collection and annotation, data augmentation is a low cost way. In this paper, we propose a new method for text image augmentation. Different from traditional augmentation methods such as rotation, scaling and perspective transformation, our proposed augmentation method is designed to learn proper and efficient data augmentation which is more effective and specific for training a robust recognizer. By using a set of custom fiducial points, the proposed augmentation method is flexible and controllable. Furthermore, we bridge the gap between the isolated processes of data augmentation and network optimization by joint learning. An agent network learns from the output of the recognition network and controls the fiducial points to generate more proper training samples for the recognition network. Extensive experiments on various benchmarks, including regular scene text, irregular scene text and handwritten text, show that the proposed augmentation and the joint learning methods significantly boost the performance of the recognition networks. A general toolkit for geometric augmentation is available.

연구 동기 및 목표

  • 불규칙한 스트리트 텍스트와 높은 스타일 변동성이 있는 손글씨 텍스트에서 훈련 데이터의 제한성과 다양성 부족 문제를 해결하기 위해.
  • 전통적인 기하학적 증강(예: 회전, 스케일링)의 비효율성에 대비하여 전체 텍스트 문자열을 단일 실체로 취급하고 문자 수준의 다양성을 모델링하지 못하는 문제를 해결하기 위해.
  • 고립된 데이터 증강과 네트워크 훈련 사이의 격차를 메우기 위해 인식과 증강을 종단 간 공동 최적화할 수 있도록 하기 위해.
  • 수동 재설정 없이 다양한 텍스트 인식 과제에 자동으로 적응할 수 있는 메타 프레임워크를 개발하기 위해.

제안 방법

  • 각 텍스트 이미지에 학습 가능한 히스토리컬 포인트 세트를 초기화하여 세밀한 문자 수준의 공간 변환을 가능하게 한다.
  • 에이전트 네트워크는 인식 네트워크 성능의 피드백(편집 거리 측정)을 기반으로 히스토리컬 포인트의 이동 상태를 예측한다.
  • 이미지 생성은 이동 최소 제곱법을 통한 유사성 변환을 사용하여 히스토리컬 포인트 이동에 따라 이미지를 왜곡한다.
  • 학습된(에이전트 주도) 및 무작위 변형을 결합하여 다양성과 탐색을 유지한다.
  • 전체 시스템은 종단 간 훈련이 가능하며, 에이전트는 점점 더 어려운 샘플을 생성하여 인식의 강건성을 향상시키는 법을 학습한다.
  • 이 방법은 CTC 기반의 인식 네트워크에 통합되어 인식 손실과 함께 공동 최적화된다.

실험 결과

연구 질문

  • RQ1 recognition 난이도에 적응하는 학습 가능한 증강 전략이 정적 또는 무작위 증강을 넘어서 텍스트 인식 성능을 향상시킬 수 있는가?
  • RQ2에이전트 주도의 히스토리컬 포인트 조작은 순서 기반 문자 인식을 위한 다양하고 어려운 훈련 샘플을 얼마나 효과적으로 생성하는가?
  • RQ3증강과 인식의 공동 최적화가 소규모 또는 불균형 데이터셋에서 더 나은 일반화를 이끌 수 있는가?
  • RQ4제안된 방법은 불규칙한 스트리트 텍스트와 손글씨 텍스트를 포함한 다양한 텍스트 인식 과제에 일반화되는가?
  • RQ5AFDM과 같은 이전의 스마트 증강 기법과 비교해 성능 및 적응 가능성 측면에서 어떻게 성과를 내는가?

주요 결과

  • IAM 손글씨 텍스트 벤치마크에서, 이 방법은 제약 조건이 없는 설정에서 단어 오류율을 5.08% 감소시켰다(19.12%에서 14.04%로), 베이스라인 및 최신 기준 방법을 모두 능가했다.
  • RIMES 데이터셋에서, 이 방법은 제약 조건이 없는 설정에서 단어 오류율을 4.42% 감소시켰다(13.83%에서 9.23%로), 노이즈가 많고 품질이 낮은 이미지에서도 강력한 강건성을 보였다.
  • 공동 학습 프레임워크는 CT80 스트리트 텍스트 벤치마크에서 4.5%의 정확도 향상을 달성하여 정규 및 불규칙한 스트리트 텍스트 모두에서 효과를 입증했다.
  • AFDM 모듈과 결합했을 때, 이 방법은 IAM(제약 조건 없음)에서 13.35%의 단어 오류율을 기록하여 모든 이전 방법을 뛰어넘고 새로운 최고 기록을 수립했다.
  • 이 방법은 메타 프레임워크이다: AFDM과 같은 다른 증강 모듈과 원활하게 통합될 수 있으며, 함께 사용될 경우 성능을 더욱 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.