Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time End-to-End Video Text Spotter with Contrastive Representation Learning

Wejia Wu, Zhuang Li|arXiv (Cornell University)|2022. 07. 18.
Handwritten Text Recognition Techniques인용 수 4
한 줄 요약

CoText는 긴 시간적 의존성을 포착하기 위해 대조적 표현 학습을 사용하는 실시간 엔드 투 엔드 비디오 텍스트 스포팅 모델이다. 이는 텍스트 검출, 추적, 인식을 통합한다. ICDAR2015video에서 CoText는 72.0% IDF1을 기록하며 이는 이전 방법 대비 정확도 10.5% 향상과 속도 32.0 FPS 향상이다.

ABSTRACT

Video text spotting(VTS) is the task that requires simultaneously detecting, tracking and recognizing text in the video. Existing video text spotting methods typically develop sophisticated pipelines and multiple models, which is not friend for real-time applications. Here we propose a real-time end-to-end video text spotter with Contrastive Representation learning (CoText). Our contributions are three-fold: 1) CoText simultaneously address the three tasks (e.g., text detection, tracking, recognition) in a real-time end-to-end trainable framework. 2) With contrastive learning, CoText models long-range dependencies and learning temporal information across multiple frames. 3) A simple, lightweight architecture is designed for effective and accurate performance, including GPU-parallel detection post-processing, CTC-based recognition head with Masked RoI. Extensive experiments show the superiority of our method. Especially, CoText achieves an video text spotting IDF1 of 72.0% at 41.0 FPS on ICDAR2015video, with 10.5% and 32.0 FPS improvement the previous best method. The code can be found at github.com/weijiawu/CoText.

연구 동기 및 목표

  • 검출, 추적, 인식을 하나의 프레임워크로 통합하는 실시간 엔드 투 엔드 비디오 텍스트 스포팅 시스템을 개발하는 것.
  • 계산 비용이 높고 실시간 배포에 적합하지 않은 기존의 다단계 파이프라인의 한계를 해결하는 것.
  • 대조적 표현 학습을 통해 비디오 시퀀스에서 장거리 시간적 의존성을 개선하는 것.
  • 높은 정확도를 유지하면서도 고속 추론을 가능하게 하는 경량이고 효율적인 아키텍처를 설계하는 것.

제안 방법

  • CoText는 비디오 프레임 간의 강력한 시간적 표현을 학습하기 위해 대조적 학습 전략을 사용하여 장거리 의존성 모델링을 향상시킨다.
  • 관련 텍스트 영역에 집중하기 위해 마스크된 RoI를 사용하는 CTC 기반의 인식 헤드를 활용하여 정확도를 향상시킨다.
  • GPU 병렬 처리를 통한 검출 후처리 모듈이 추론 속도를 가속화하여 실시간 성능을 달성한다.
  • 모델은 엔드 투 엔드로 훈련되며, 단일 통합 아키텍처에서 검출, 추적, 인식을 동시에 최적화한다.
  • 시간적 대조 학습은 프레임 수준의 특징에 적용되어 같은 텍스트를 공유하는 양성 클립(예: 동일한 텍스트가 여러 프레임에 걸쳐)을 정렬하고, 음성 클립을 분리한다.
  • 경량 설계는 FLOPs와 파라미터 수를 최소화하여 자원 제약이 있는 장치에서도 배포 가능하게 한다.

실험 결과

연구 질문

  • RQ1통합된 엔드 투 엔드 프레임워크는 실시간 추론을 유지하면서도 다단계 파이프라인을 효과적으로 대체할 수 있는가?
  • RQ2대조적 표현 학습은 비디오 텍스트 스포팅에서 시간적 의존성을 어떻게 향상시키는가?
  • RQ3경량 아키텍처는 실시간 추론 속도를 확보하면서도 얼마나 높은 정확도를 유지할 수 있는가?
  • RQ4마스크된 RoI와 CTC 기반의 인식은 통합된 검출-추적-인식 환경에서 인식 성능에 어떤 영향을 미치는가?

주요 결과

  • CoText는 ICDAR2015video 벤치마크에서 72.0% IDF1을 달성하여 이전 최고 성능 방법 대비 10.5% 정확도 향상을 기록했다.
  • CoText는 ICDAR2015video에서 41.0 FPS로 작동하여 이전 최고 성능 방법 대비 32.0 FPS의 속도 향상을 이뤘다.
  • 대조 학습의 적용은 장거리 시간적 일관성을 통해 성능 향상에 기여하여 뚜렷한 효과를 보였다.
  • GPU 병렬 후처리 모듈은 정확도를 훼손하지 않으면서도 검출 속도를 효과적으로 가속화했다.
  • 경량 아키텍처는 고속 추론을 유지하면서도 높은 정확도를 확보하여 실질적인 배포에 적합하다.
  • 마스크된 RoI와 CTC 기반의 인식 조합은 인식의 강인성과 정밀도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.