Skip to main content
QUICK REVIEW

[논문 리뷰] Reading Text in the Wild with Convolutional Neural Networks

Max Jaderberg, Karen Simonyan|arXiv (Cornell University)|2014. 12. 04.
Handwritten Text Recognition Techniques참고 문헌 20인용 수 20
한 줄 요약

이 논문은 컨볼루션 신경망(CNN)과 영역 제안 방법을 사용하여 자연 풍경 이미지 내 텍스트 스트링을 탐지하기 위한 엔드 투 엔드 딥 러닝 시스템을 제시한다. 고신뢰도 영역 제안과 실세계 데이터에 대한 인간 레이블링 없이도 합성 데이터 전용으로 훈련된 CNN 기반 단어 인식 모델을 조합함으로써 최신 기술 수준(SOTA)의 성능을 달성하여 정확하고 확장 가능한 텍스트 탐지 및 인식을 가능하게 한다.

ABSTRACT

In this work we present an end-to-end system for text spotting -- localising and recognising text in natural scene images -- and text based image retrieval. This system is based on a region proposal mechanism for detection and deep convolutional neural networks for recognition. Our pipeline uses a novel combination of complementary proposal generation techniques to ensure high recall, and a fast subsequent filtering stage for improving precision. For the recognition and ranking of proposals, we train very large convolutional neural networks to perform word recognition on the whole proposal region at the same time, departing from the character classifier based systems of the past. These networks are trained solely on data produced by a synthetic text generation engine, requiring no human labelled data. Analysing the stages of our pipeline, we show state-of-the-art performance throughout. We perform rigorous experiments across a number of standard end-to-end text spotting benchmarks and text-based image retrieval datasets, showing a large improvement over all previous methods. Finally, we demonstrate a real-world application of our text spotting system to allow thousands of hours of news footage to be instantly searchable via a text query.

연구 동기 및 목표

  • 단일 파이프라인 내에서 탐지와 인식을 통합하는 엔드 투 엔드 시스템을 개발하여 자연 풍경 이미지 내 텍스트 스트링을 탐지한다.
  • 서체, 조명 및 방향이 다양하게 변하는 제약 없는 환경에서의 텍스트 인식 정확도를 향상시킨다.
  • 인간 레이블링이 필요한 훈련 데이터를 제거하기 위해 인식 모델을 합성 데이터 전용으로 훈련시킨다.
  • 대규모 영상 코퍼스에서 실시간 텍스트 기반 이미지 검색을 위한 확장 가능한 시스템을 가능하게 한다.
  • 다단계 필터링 및 정밀 조정을 통해 높은 탐지 재현율을 유지하면서도 높은 정밀도를 확보한다.

제안 방법

  • 고신뢰도 영역 제안을 위해 에지 기반 영역 제안(Edge Boxes)과 슬라이딩 윈도우 검출기를 조합하여 단어 경계 상자 제안을 생성한다.
  • 거짓 긍정을 감소시키고 참 긍정을 유지하기 위해 랜덤 포레스트 분류기를 사용하여 가짜 제안을 걸러낸다.
  • 남은 제안의 좌표를 정밀하게 보정하기 위해 바운딩 박스 회귀를 위한 CNN을 적용한다.
  • 전체 제안 영역에 대해 엔드 투 엔드 단어 인식을 수행하기 위해 대규모 CNN을 사용하며, 90,000개 단어 사전에 대비하여 분류한다.
  • 실세계 레이블링 없이도 텍스트 렌더링 엔진으로 생성된 합성 텍스트 데이터 전용으로 인식 CNN을 훈련시킨다.
  • 인식 작업에서 다수의 클래스를 처리하기 위해 점진적 학습 전략을 적용한다.

실험 결과

연구 질문

  • RQ1합성 데이터 전용으로 훈련된 딥 컨볼루션 신경망 기반 인식 모델이 실세계 자연 풍경 텍스트 인식에서 기존 시스템을 능가할 수 있는가?
  • RQ2영역 제안과 필터링을 조합한 다단계 탐지 파이프라인은 이전 탐지 방법보다 더 높은 재현율을 달성할 수 있는가?
  • RQ3탐지와 인식을 하나의 엔드 투 엔드 시스템으로 통합하면 텍스트 스트링 탐지 및 이미지 검색 벤치마크 성능에 상당한 향상이 이루어지는가?
  • RQ4실세계 데이터 레이블링 없이도 합성 데이터 훈련이 실세계 텍스트 인식으로 일반화되는 정도는 어느 정도인가?
  • RQ5시스템은 실시간 텍스트 기반 이미지 검색을 위해 대규모 영상 코퍼스에 확장 가능한가?

주요 결과

  • SVT 텍스트 검색 벤치마크에서 86.3%의 평균 정밀도(mAP)를 달성하여 이전 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • ICDAR 2003 및 스트리트 뷰 텍스트 데이터셋에서 탐지 단계는 약 98%의 단어 재현율을 기록하여 이전 방법을 초월했다.
  • 실세계 레이블링 데이터 없이도 합성 데이터 전용으로 훈련된 인식 모델이 실세계 자연 풍경 텍스트 인식에서 최신 기술 수준의 정확도를 달성했다.
  • 단일 CPU 코어 및 GPU에서 이미지당 5~20초 내외로 처리되며, 고성능 하드웨어에서는 최대 1~2장의 이미지/초로 확장 가능하다.
  • 실세계 응용 사례에서 5,000시간 분량의 BBC 뉴스 영상 코퍼스에서 'hollywood' 및 'boris johnson'과 같은 검색어에 대해 100% 정밀도(100% P@100)를 달성했다.
  • SVT 및 스포츠 데이터셋과 같은 테스트 세트에서의 불완전한 레이블링으로 인해 보고된 mAP가 낮아졌으며, 이는 실제 성능이 보고된 것보다 더 높을 가능성이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.