[논문 리뷰] You Only Recognize Once: Towards Fast Video Text Spotting
이 논문은 프레임별 인식을 새로운 텍스트 추천기로 대체함으로써 단일 텍스트 스트림당 한 번의 인식으로 빠르고 강건한 비디오 텍스트 스포팅 프레임워크인 YORO를 제안한다. 이 방법은 시공간 검출기를 사용해 프레임 간 텍스트를 국소화하고, 최고 품질의 텍스트를 선택하는 엔드 투 엔드로 학습 가능한 추천기 모듈을 활용하여, 인식 오버헤드를 줄이고 간섭을 줄이며, 벤치마크에서 71배의 속도 향상과 최신 기술 수준의 성능을 달성한다.
Video text spotting is still an important research topic due to its various real-applications. Previous approaches usually fall into the four-staged pipeline: text detection in individual images, framewisely recognizing localized text regions, tracking text streams and generating final results with complicated post-processing skills, which might suffer from the huge computational cost as well as the interferences of low-quality text. In this paper, we propose a fast and robust video text spotting framework by only recognizing the localized text one-time instead of frame-wisely recognition. Specifically, we first obtain text regions in videos with a well-designed spatial-temporal detector. Then we concentrate on developing a novel text recommender for selecting the highest-quality text from text streams and only recognizing the selected ones. Here, the recommender assembles text tracking, quality scoring and recognition into an end-to-end trainable module, which not only avoids the interferences from low-quality text but also dramatically speeds up the video text spotting process. In addition, we collect a larger scale video text dataset (LSVTD) for promoting the video text spotting community, which contains 100 text videos from 22 different real-life scenarios. Extensive experiments on two public benchmarks show that our method greatly speeds up the recognition process averagely by 71 times compared with the frame-wise manner, and also achieves the remarkable state-of-the-art.
연구 동기 및 목표
- 낮은 품질의 텍스트 영역로 인해 발생하는 프레임별 비디오 텍스트 인식의 높은 계산 비용과 불안정성 문제를 해결하기 위해.
- 모든 프레임이 아닌 추적된 각 텍스트 스트림에서 최고 품질의 텍스트만 인식함으로써 인식 오버헤드를 줄이기 위해.
- 추적, 품질 점수 평가, 인식을 엔드 투 엔드로 학습 가능한 모듈로 통합하여 강건성과 효율성을 향상시키기 위해.
- 22개의 실제 세계 시나리오에서 100개의 비디오를 포함한 더 큰 규모의 데이터셋(LSVTD)을 공개하여 비디오 텍스트 스포팅 연구를 촉진하기 위해.
제안 방법
- 연속된 프레임 간의 시간적 관계를 활용하여 텍스트 재현율을 향상시키기 위해 시공간 비디오 텍스트 검출기가 설계되었다.
- 엔드 투 엔드로 학습 가능한 방식으로 추적, 품질 점수 평가, 인식을 동시에 학습하는 텍스트 추천기 모듈이 도입되었다.
- 약한 지도 학습 방식으로 품질 점수 평가가 이루어져 뚜렷하고 수평적이며 안정적인 텍스트 영역을 뿌연, 흐릿하거나 왜곡된 영역보다 우선순위를 높인다.
- 프레임 간 인식을 피하기 위해 각 추적된 스트림에서 최고 품질의 텍스트 영역만 인식 대상으로 선택함으로써 인식 연산 횟수를 극적으로 줄였다.
- 프레임별 인식을 피하기 위해 각 텍스트 스트림당 한 번의 인식에 집중함으로써 추론 시간을 크게 절감하였다.
- IC13 및 IC15와 같은 대규모 벤치마크를 지원하기 위해, 22개의 다양한 실제 시나리오에서 100개의 비디오를 포함한 새로운 대규모 비디오 텍스트 데이터셋(LSVTD)이 수집되었다.
실험 결과
연구 질문
- RQ1프레임별 인식과 비교해 유사하거나 더 높은 정확도를 달성하면서도 계산 비용을 극적으로 줄일 수 있는 단일 텍스트 스트림당 한 번의 인식이 가능한가?
- RQ2추적, 품질 점수 평가, 인식을 효과적으로 엔드 투 엔드로 학습 가능한 모듈로 통합할 수 있는가? 이는 강건성과 효율성을 향상시키는가?
- RQ3약한 지도 학습 방식의 품질 점수 평가 메커니즘이 낮은 품질의 텍스트를 걸러내고 인식 성능을 향상시키는 데 어떤 영향을 미치는가?
- RQ4시공간 검출기는 단일 프레임 검출과 비교해 텍스트 국소화 및 재현율을 어떻게 향상시키는가?
- RQ5제안된 프레임워크는 IC13 및 IC15와 같은 대규모 벤치마크에서 기존 방법들을 얼마나 뛰어넘는가?
주요 결과
- 제안된 YORO 프레임워크는 프레임별 인식과 비교해 평균 71배의 인식 처리 속도 향상을 달성했으며, 높은 정확도를 유지한다.
- IC15 벤치마크에서, 이 방법은 인식 MOTA 0.69와 ATA 0.63을 기록하여 이전 최신 기술 수준의 방법들을 능가한다.
- 텍스트 추천기 모듈은 낮은 품질의 텍스트를 걸러내어 뿌연, 왜곡, 낮은 조명 조건으로 인한 간섭을 줄여 인식의 강건성을 향상시킨다.
- 시공간 검출기는 정밀도가 4.3% 감소했음에도 불구하고, 프레임 기반 검출 대비 재현율을 4% 향상시키고 F-측정치를 1.3% 향상시켰다.
- 100개의 비디오를 포함한 LSVTD 데이터셋은 도시 도로, 감시 카메라 등 외부 및 동적인 시나리오에서 운동 블러와 복잡한 배경으로 인해 여전히 도전적인 과제임을 드러냈다.
- 이 프레임워크는 서점, 지하철역 등 실내 시나리오에서 가장 우수한 성능을 보였지만, 기차를 관찰하거나 도시 도로와 같은 외부 및 고속도로 시나리오에서는 여전히 어려움을 겪는다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.