[논문 리뷰] End-to-End Video Text Spotting with Transformer
이 논문은 Transformer 아키텍처를 기반으로 한 새로운 엔드 투 엔드 비디오 텍스트 스트링 프레임워크인 TransDETR를 제안한다. 이는 유연한 '텍스트 쿼리'를 통해 장거리 시간적 의존성을 모델링하여 검출, 추적, 인식을 동시에 수행한다. 이는 NMS 및 매칭 히우리스틱과 같은 수작업 구성 요소를 제거함으로써 상태의 기술(SOTA) 성능을 달성한다. 비디오 텍스트 스트링에서 ID-F1은 최대 11.3% 향상되었고, 추적 성능은 7.6% 향상되었다.
Recent video text spotting methods usually require the three-staged pipeline, i.e., detecting text in individual images, recognizing localized text, tracking text streams with post-processing to generate final results. These methods typically follow the tracking-by-match paradigm and develop sophisticated pipelines. In this paper, rooted in Transformer sequence modeling, we propose a simple, but effective end-to-end video text DEtection, Tracking, and Recognition framework (TransDETR). TransDETR mainly includes two advantages: 1) Different from the explicit match paradigm in the adjacent frame, TransDETR tracks and recognizes each text implicitly by the different query termed text query over long-range temporal sequence (more than 7 frames). 2) TransDETR is the first end-to-end trainable video text spotting framework, which simultaneously addresses the three sub-tasks (e.g., text detection, tracking, recognition). Extensive experiments in four video text datasets (i.e.,ICDAR2013 Video, ICDAR2015 Video, Minetto, and YouTube Video Text) are conducted to demonstrate that TransDETR achieves state-of-the-art performance with up to around 8.0% improvements on video text spotting tasks. The code of TransDETR can be found at https://github.com/weijiawu/TransDETR.
연구 동기 및 목표
- 이전의 세 단계 비디오 텍스트 스트링 파이프라인에서 비가역적이고 비차별 가능한 프레임 간 매칭 히우리스틱에 의존하는 한계를 해결하기 위해.
- 검출, 추적, 인식을 하나의 시퀀스 모델링 작업으로 통합함으로써 비디오 텍스트 스트링의 엔드 투 엔드 훈련을 가능하게 하기 위해.
- 운동 블러와 가림 등에서 특히 중요한 장거리 시간적 모델링을 향상시켜 추적 및 인식 성능을 향상시키기 위해.
- 비가역적 구성 요소인 NMS, IoU 매칭, 기능 기반 Re-ID 등의 의존도를 제거하기 위해.
- 이전 방법보다 더 높은 정확도와 더 빠른 추론 속도를 확보하면서도 단순하고 통합된 아키텍처를 유지하기 위해.
제안 방법
- 프레임 간의 전체 궤적과 각 텍스트 인스턴스의 내용을 암묵적으로 모델링하기 위해 유연한 '텍스트 쿼리'를 사용하는 Transformer 기반 인코더-디코더 아키텍처를 사용한다.
- 각 텍스트 쿼리는 시간에 걸쳐 단일 텍스트 인스턴스에 대한 공간적 바운딩 박스, 추적 ID, 인식된 텍스트 내용을 예측하는 데 담당한다.
- 예측이 프레임 간 일관성을 유지하도록 하는 새로운 시간 추적 손실을 도입하여 추적과 인식을 동시에 최적화할 수 있도록 한다.
- 인식 헤드는 임의의 방향을 가진 텍스트를 처리하기 위해 기울인 RoI를 사용하며, 검출 및 추적과의 엔드 투 엔드 훈련을 가능하게 한다.
- 비디오 클립을 입력으로 받아 후처리 또는 매칭 단계 없이 직접 검출, 추적, 인식 결과의 시퀀스를 출력한다.
- 앵커 생성, NMS, IoU 기반 매칭과 같은 전통적인 구성 요소를 피하고, 시퀀스 모델링에 오직 어텐션 메커니즘에 의존한다.
![Figure 1 : Comparisons of different video text spotting pipeline . (a) Wang et al. [ 43 ] tracks and recognizes text by transcription matching; (b-c) Cheng et al. [ 3 , 4 ] tracks and recognizes text with metric learning; (d) Wu et al. [ 47 ] adopts IoU-based match to address the task; (e) Without c](https://ar5iv.labs.arxiv.org/html/2203.10539/assets/x1.png)
실험 결과
연구 질문
- RQ1Transformer 기반의 통합형 엔드 투 엔드 훈련 가능한 프레임워크가 프레임 간 명시적 매칭 없이도 비디오 텍스트 검출, 추적, 인식을 효과적으로 수행할 수 있는가?
- RQ2텍스트 쿼리를 통한 장거리 시간적 모델링이 인접 프레임 간 매칭에 비해 추적의 강건성과 정확도에서 어떻게 비교되는가?
- RQ3NMS 및 IoU 매칭과 같은 수작업 구성 요소를 제거함으로써 성능 향상과 추론 속도 향상에 어느 정도 기여하는가?
- RQ4제안된 방법이 다양한 비디오 품질과 텍스트 외관을 가진 다양한 비디오 텍스트 데이터셋에 잘 일반화되는가?
- RQ5다중 단계이며 엔드 투 엔드가 아닌 기준 모델에 비해 더 높은 정확도를 유지하면서도 더 빠른 추론을 달성할 수 있는가?
주요 결과
- TransDETR는 ICDAR2015 (비디오) 추적 벤치마크에서 ID-F1에 7.6%의 절대적 향상을 보이며 이전 SOTA 방법을 초월했다.
- 비디오 텍스트 스트링 작업에서 TransDETR는 현재 SOTA 방법보다 ID-F1이 11.3% 높았고, MOTA에 7.7% 향상되었다.
- 비주얼라이제이션을 통해 가짜 음성(신호) 수를 최대 15.0% 감소시키며, ID 스위칭과 객체 손실을 크게 완화했다.
- TransDETR는 16.7 FPS의 추론 속도를 기록하여 더 높은 정확도를 유지하면서도 SOTA 방법(9.0 FPS)보다 빠르다.
- ICDAR2013 (비디오)에서 TransDETR는 YORO 대비 MOTA를 7.4% 향상시키고 ID-F1을 4.7% 향상시켰으며, 더 빠른 추론 속도를 유지했다.
- YVT 및 Minetto 데이터셋에 대해서도 미세조정 없이도 각각 MOTA에 1.7% 및 2.4% 향상되어 잘 일반화됨을 입증했다.
![Figure 2 : The overall architecture of Trans DeTR . It contains three main components: 1). a backbone( e.g., ResNet, PVT [ 40 ] ) is used to extract feature of video sequences; 2) a Transformer encoder models the relations of features, and a weight-shared decoder models each text move trajectory by](https://ar5iv.labs.arxiv.org/html/2203.10539/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.