[논문 리뷰] A Bilingual, OpenWorld Video Text Dataset and End-to-end Video Text Spotter with Transformer
이 논문은 2,000개 이상의 영상과 175만 개 이상의 프레임을 포함하는 대규모 이중어, 개방형 세계 영상 텍스트 데이터셋인 BOVText를 소개한다. 이는 다양한 시나리오와 다국어 주석을 지원한다. 또한, 기울기 인식 추적 기능을 갖춘 트랜스포머 기반 주의 메커니즘을 사용하는 엔드 투 엔드 영상 텍스트 스포팅 프레임워크인 TransVTSpotter를 제안하여 ICDAR2015(video)에서 44.1%의 MOTA를 달성하여 새로운 최고 성능을 기록한다.
Most existing video text spotting benchmarks focus on evaluating a single language and scenario with limited data. In this work, we introduce a large-scale, Bilingual, Open World Video text benchmark dataset(BOVText). There are four features for BOVText. Firstly, we provide 2,000+ videos with more than 1,750,000+ frames, 25 times larger than the existing largest dataset with incidental text in videos. Secondly, our dataset covers 30+ open categories with a wide selection of various scenarios, e.g., Life Vlog, Driving, Movie, etc. Thirdly, abundant text types annotation (i.e., title, caption or scene text) are provided for the different representational meanings in video. Fourthly, the BOVText provides bilingual text annotation to promote multiple cultures live and communication. Besides, we propose an end-to-end video text spotting framework with Transformer, termed TransVTSpotter, which solves the multi-orient text spotting in video with a simple, but efficient attention-based query-key mechanism. It applies object features from the previous frame as a tracking query for the current frame and introduces a rotation angle prediction to fit the multiorient text instance. On ICDAR2015(video), TransVTSpotter achieves the state-of-the-art performance with 44.1% MOTA, 9 fps. The dataset and code of TransVTSpotter can be found at github:com=weijiawu=BOVText and github:com=weijiawu=TransVTSpotter, respectively.
연구 동기 및 목표
- 실제 영상 텍스트 스포팅 평가를 위한 대규모, 다양하고 다국어 기반 영상 텍스트 데이터셋의 부족을 해결하기 위해.
- 기존 벤치마크가 단일 언어, 제한된 시나리오, 소규모 데이터에 국한되어 있는 한계를 극복하기 위해.
- 영상에서 다중 방향 텍스트의 추적 및 인식을 향상시켜 엔드 투 엔드 영상 텍스트 스포팅을 가능하게 하기 위해.
- 풍부한 텍스트 유형 주석을 통해 영상 이해, 자동 번역, 영상 검색 등의 응용 분야를 지원하기 위해.
- 영상 텍스트 스포팅 및 관련 영상-언어 작업의 연구를 촉진하기 위해 데이터셋과 코드를 오픈소스로 제공하기 위해.
제안 방법
- BOVText는 1,494개의 KuaiShou 및 356개의 YouTube 영상에서 구성되었으며, 라이프 블로깅, 게임, 스포츠 중계, 드라이빙 등 30개 이상의 개방형 세계 시나리오를 포함한다.
- 데이터셋은 세 가지 텍스트 유형(타이틀, 캡션, 스크린 텍스트)에 대해 중국어 및 영어의 이중어 주석을 포함하여 상호 문화 간 이해와 다국어 응용을 가능하게 한다.
- TransVTSpotter는 이전 프레임의 객체 특징를 추적 쿼리로 사용하는 주의 기반 쿼리-키 메커니즘을 갖춘 트랜스포머 기반 검출 헤드를 사용한다.
- 다중 방향 텍스트 인스턴스를 처리하기 위해 기울기 각도 예측 헤드를 통합하여 영상 시퀀스에서의 탐지 강건성을 향상시킨다.
- NMS와 같은 후처리 단계 없이도 프레임 간에 동시에 텍스트를 검출, 인식, 추적할 수 있도록 엔드 투 엔드 영상 텍스트 스포팅을 구현한다.
- 모델은 ICDAR2015(video)에서 훈련 및 평가되었으며, 추론 속도가 9 fps로 효율성과 확장성을 입증한다.
![Figure 1: Comparison of dataset distribution and pipeline . (a) Data distribution. BOVText provides various open world scenarios with unique NBA, Game, etc. (b) Pipelines: (I) Multi-stage pipeline in [ 65 ] , [ 16 ] , [ 68 ] etc ; (II) Multi-orient video text spotting pipeline with Faster R-CNN [ 42](https://ar5iv.labs.arxiv.org/html/2112.04888/assets/x1.png)
실험 결과
연구 질문
- RQ1대규모, 개방형 세계, 이중어 영상 텍스트 데이터셋은 다양한 실제 시나리오에서 영상 텍스트 스포팅 모델의 일반화 능력과 강건성을 향상시킬 수 있는가?
- RQ2주의 기반 추적과 기울기 인식 탐지 기능을 갖춘 트랜스포머 기반 엔드 투 엔드 프레임워크는 영상에서 다중 방향 텍스트 스포팅에 얼마나 효과적인가?
- RQ3풍부한 텍스트 유형 주석(타이틀, 캡션, 스크린 텍스트)은 영상 이해 및 검색과 같은 후행 작업에 얼마나 기여하는가?
- RQ4제안된 데이터셋과 모델은 다국어 영상 번역 및 의미 기반 영상 검색과 같은 실용적 응용을 지원할 수 있는가?
- RQ5정확도, 속도, 엔드 투 엔드 단순성 측면에서 기존의 다단계 또는 이단계 파이프라인에 비해 제안된 방법은 어떻게 비교되는가?
주요 결과
- BOVText는 2,000개 이상의 영상에서 175만 개 이상의 프레임을 포함하여 이전까지 가장 큰 영상 텍스트 데이터셋보다 25배 이상 크다.
- 이 데이터셋은 이전에 다루지 않았던 분야인 NBA 중계, 게임 스트림, 라이프 블로깅 등을 포함한 30개 이상의 개방형 세계 시나리오를 지원한다.
- TransVTSpotter는 ICDAR2015(video) 벤치마크에서 44.1%의 새로운 최고 성능 MOTA를 기록하여 뛰어난 성능을 입증했다.
- 모델은 9 fps로 실행되어 실시간 응용에 적합한 높은 추론 효율성을 보였다.
- 이중어 주석과 다중 유형 텍스트 레이블링(타이틀, 캡션, 스크린 텍스트)은 영상-언어 작업, 예를 들어 영상 설명 및 검색의 잠재력을 크게 향상시켰다.
- CC-BY 4.0 라이선스 하에 데이터셋과 코드를 오픈소스로 제공하여 재현 가능한 연구를 가능하게 하고 영상 텍스트 스포팅 분야의 커뮤니티 발전을 촉진한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.