Skip to main content
QUICK REVIEW

[논문 리뷰] TextProposals: a Text-specific Selective Search Algorithm for Word Spotting in the Wild

Lluís Gómez, Dìmosthenis Karatzas|arXiv (Cornell University)|2016. 04. 10.
Handwritten Text Recognition Techniques참고 문헌 57인용 수 18
한 줄 요약

이 논문은 초기 영역이 개별 문자에 대응된다고 가정하지 않고, 여러 유사도 신호를 사용하여 연결된 성분을 계층적으로 군집화함으로써 고품질의 단어 후보를 생성하는 텍스트 전용 객체 후보 알고리즘인 TextProposals를 제안한다. 이는 제약 조건이 없는 환경에서 엔드 투 엔드 단어 검색에서 최고 성능을 기록하며, ICDAR2015 Incidental Text 데이터셋에서 통합된 전체 인식기와 함께 기존 방법보다 10퍼센트 이상 F-스코어를 뛰어넘는다.

ABSTRACT

Motivated by the success of powerful while expensive techniques to recognize words in a holistic way, object proposals techniques emerge as an alternative to the traditional text detectors. In this paper we introduce a novel object proposals method that is specifically designed for text. We rely on a similarity based region grouping algorithm that generates a hierarchy of word hypotheses. Over the nodes of this hierarchy it is possible to apply a holistic word recognition method in an efficient way. Our experiments demonstrate that the presented method is superior in its ability of producing good quality word proposals when compared with class-independent algorithms. We show impressive recall rates with a few thousand proposals in different standard benchmarks, including focused or incidental text datasets, and multi-language scenarios. Moreover, the combination of our object proposals with existing whole-word recognizers shows competitive performance in end-to-end word spotting, and, in some benchmarks, outperforms previously published results. Concretely, in the challenging ICDAR2015 Incidental Text dataset, we overcome in more than 10 percent f-score the best-performing method in the last ICDAR Robust Reading Competition. Source code of the complete end-to-end system is available at https://github.com/lluisgomez/TextProposals

연구 동기 및 목표

  • 개별 문자 분할에 의존하는 전통적인 스트리트 텍스트 인식 방법의 한계를 해결하기 위해, 열악한 조건, 기울어진, 또는 저대비 텍스트에서 실패하는 경우가 많다는 점을 해결한다.
  • 명시적인 문자 분할 없이도 고품질의 단어 후보를 생성하는 방법을 개발하여 효율적인 통합 단어 인식을 가능하게 한다.
  • 특히 저품질 또는 소규모 텍스트를 포함한 도전적인 일시적 텍스트 데이터셋에서 재현율과 성능을 향상시켜 엔드 투 엔드 단어 검색을 개선한다.
  • 텍스트 전용 객체 후보가 일반적인 객체 후보 알고리즘보다 텍스트 검출 및 인식 작업에서 뛰어난 성능을 보임을 입증한다.

제안 방법

  • 공간적 근접성과 시각적 유사도를 기반으로 연결된 성분을 군집화하는 계층적 클러스터링 방법을 사용하며, 모든 성분을 기원에 관계없이 잠재적 텍스트 요소로 간주한다.
  • 다른 신호(예: 공간적, 색상, 질감)를 사용해 다중 유사도 계층을 구축함으로써 각 단어 인스턴스가 적어도 하나의 계층에 포함될 가능성을 높인다.
  • 기존의 비최대 억제 절차와 새로운 순위 매기기 전략을 통해 계층 내 노드 간 포함 관계를 효과적으로 활용하여 상위 후보를 효율적으로 선택한다.
  • 고정된 계층적 구조(예: 문자 → 이음절 → 단어)를 가정하지 않아서, 기울인 글씨나 분할된 텍스트와 같은 다양한 텍스트 양식의 군집화에 민감도를 가진다.
  • 최종적으로 단어 후보는 통합 단어 인식기(예: DictNet)에 입력되어 높은 효율성과 정확도로 엔드 투 엔드 단어 검색을 수행한다.
  • 다국어 환경과 다양한 이미지 조건(저해상도, 흐림, 복잡한 배경 등)에서도 견고한 성능을 발휘하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1텍스트 전용 객체 후보 방법이 단어 검색 작업에서 일반적인 객체 후보 알고리즘을 능가할 수 있는가?
  • RQ2여러 유사도 신호를 기반으로 한 계층적 군집 전략이 제약 조건이 없는 환경에서 단어 후보의 재현율과 품질을 향상시키는가?
  • RQ3명시적인 문자 분할을 피하는 방법이 도전적인 일시적 텍스트 데이터셋에서 뛰어난 성능을 낼 수 있는가?
  • RQ4텍스트 전용 후보와 통합 단어 인식기의 통합 방식이 기존 엔드 투 엔드 단어 검색 파이프라인과 비교해 어떻게 성능을 냈는가?
  • RQ5이 방법이 집중 텍스트, 일시적 텍스트, 다국어 환경 등 다양한 상황에서 얼마나 일반화되는가?

주요 결과

  • TextProposals는 ICDAR2015 Incidental Text 데이터셋에서 56.00%의 F-스코어를 기록하며, 이는 이전 최고 성능 방법보다 10퍼센트 이상 높은 성능이다.
  • ICDAR2013 Focused Text 데이터셋에서 엔드 투 엔드 단어 검색 성능은 70.71%의 F-스코어를 달성하여 이전 경쟁자 전부를 능가한다.
  • 몇천 개의 후보만으로도 다양한 벤치마크에서 높은 재현율을 확보하였으며, 다국어 및 저품질 텍스트 환경에서도 성능이 우수하다.
  • 기존 검출기들이 소형, 저해상도 또는 수평이 아닌 방향으로 인해 실패하는 일시적 텍스트에서 뛰어난 성능을 보였다.
  • TextProposals와 DictNet 통합 인식기의 조합은 ICDAR2015 테스트 세트의 단어 중 70%만을 커버하는 딕셔너리에도 불구하고 최고 성능을 기록하였다.
  • 제안된 순위 매기기 및 억제 전략은 계층적 구조를 효과적으로 활용하여 재현율을 희생시키지 않은 채 효율적이고 정확한 후보 선택을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.