[논문 리뷰] Scalable Mask Annotation for Video Text Spotting
이 논문은 비디오 텍스트 스포팅을 위한 확장 가능한 마스크 주석 파이프라인인 SAMText를 제안한다. 이는 세그먼트 어芮브 모델(SAM)을 활용하여 대규모로 정교한 세그멘테이션 마스크를 생성한다. 이 방법을 통해 저자들은 2,400개의 비디오 클립에 걸쳐 900만 개 이상의 마스크 주석을 포함한 대규모 데이터셋인 SAMText-9M를 구축하였으며, 이는 굽은선이나 조밀한 텍스트와 같은 복잡한 텍스트 시나리오에서 성능 향상을 가능하게 한다.
Video text spotting refers to localizing, recognizing, and tracking textual elements such as captions, logos, license plates, signs, and other forms of text within consecutive video frames. However, current datasets available for this task rely on quadrilateral ground truth annotations, which may result in including excessive background content and inaccurate text boundaries. Furthermore, methods trained on these datasets often produce prediction results in the form of quadrilateral boxes, which limits their ability to handle complex scenarios such as dense or curved text. To address these issues, we propose a scalable mask annotation pipeline called SAMText for video text spotting. SAMText leverages the SAM model to generate mask annotations for scene text images or video frames at scale. Using SAMText, we have created a large-scale dataset, SAMText-9M, that contains over 2,400 video clips sourced from existing datasets and over 9 million mask annotations. We have also conducted a thorough statistical analysis of the generated masks and their quality, identifying several research topics that could be further explored based on this dataset. The code and dataset will be released at \url{https://github.com/ViTAE-Transformer/SAMText}.
연구 동기 및 목표
- 기존의 비디오 텍스트 스포팅 데이터셋이 굵은 사각형 경계 상자에 의존함으로써 텍스트 경계가 정확하지 않게 되고, 굽은선이나 조밀한 텍스트에서 성능이 떨어지는 문제를 해결하기 위해.
- 대규모 비디오 데이터셋에 대한 수동 마스크 주석의 높은 노동 비용을 기초 모델을 활용한 자동화를 통해 감소시키기 위해.
- 비디오 텍스트 스포팅을 위한 고품질의 정교한 마스크 주석을 제공하여 모델의 일반화 능력을 향상시키고, 굽은선 텍스트 인식 및 비디오 텍스트 세그멘테이션과 같은 고급 작업을 지원하기 위해.
- 비디오 텍스트 스포팅 분야의 연구를 촉진하고 관련 후속 작업을 지원하기 위해 대규모, 다양한, 고품질의 데이터셋(SAMText-9M)을 구축하기 위해.
제안 방법
- 기존 데이터셋 또는 시나리오 텍스트 탐지 모델의 예측에서 유래한 입력 경계 상자를 기반으로 사전 학습된 세그먼트 어芮브 모델(SAM)을 활용해 세그멘테이션 마스크를 생성한다.
- 개별 비디오 프레임 또는 이미지 조각을 처리할 수 있는 확장 가능한 파이프라인을 설계하여, 프롬프트 기반 세그멘테이션을 통해 각 텍스트 인스턴스에 대해 정밀한 마스크 주석을 생성한다.
- 마스크 생성을 위한 입력 소스로 다섯 가지 기존 비디오 텍스트 데이터셋—ICDAR15, RoadText-1K, LSVTD, BOVText, DSText—을 수집한다.
- 점 또는 상자 프롬프트를 사용해 SAM을 적용하여 인스턴스 수준의 마스크를 생성함으로써, 비정상적인 모양이나 굽은선을 띤 텍스트일지라도 높은 정밀도를 확보한다.
- 다양한 비디오 시나리오에서 신뢰성 있고 일관성을 확보하기 위해 생성된 마스크에 대한 품질 관리 및 통계적 검증을 수행한다.
- 모든 입력 데이터셋의 마스크 주석을 집계하여, 정교한 감시를 제공하는 대규모, 다중 시나리오, 다국어 비디오 텍스트 데이터셋인 SAMText-9M를 구축한다.
실험 결과
연구 질문
- RQ1기존의 사각형 또는 경계 상자 주석과 비교할 때, 마스크 주석은 비디오 텍스트 스포팅 성능에 얼마나 기여하는가?
- RQ2정교한 마스크 주석의 포함 여부가 굽은선이나 조밀하게 배치된 텍스트와 같은 경우 모델의 일반화 능력에 어떻게 영향을 미치는가?
- RQ3특히 고품질의 마스크 주석을 포함한 훈련 데이터의 규모 증가가 모델 성능과 확장성에 어떤 영향을 미치는가?
- RQ4SAM 기반 파이프라인은 정교한 텍스트 편집 및 인식 작업을 위한 문자 수준의 마스크 주석 생성에 효과적으로 확장될 수 있는가?
주요 결과
- SAMText 파이프라인이 다섯 가지 기존 데이터셋에서 2,400개의 비디오 클립에 걸쳐 900만 개 이상의 고품질 마스크 주석을 성공적으로 생성하여, 정교한 비디오 텍스트 주석의 규모를 크게 확장하였다.
- 생성된 SAMText-9M 데이터셋은 다양한 공간 분포를 보이며, 예를 들어 DSText의 경우 균일한 패턴과 ICDAR15 및 RoadText-1K의 경우 상부 영역에 집중된 클러스터링 패턴을 포함하여 모델의 강건성을 향상시킨다.
- 마스크 수준의 감시 정밀도 덕분에 비디오 텍스트 세그멘테이션, 추적, 인식과 같은 고급 연구가 가능해졌으며, 특히 굽은선이나 조밀한 텍스트와 같은 과제에 유리하다.
- 마스크 품질에 대한 통계 분석을 통해 주석의 신뢰성이 확인되어, 향후 비디오 텍스트 스포팅 분야의 데이터 및 모델 확장성 연구에 기여할 수 있다.
- 파이프라인이 정교한 주석의 확장 가능하고 저비용으로 생성 가능하게 하여, 높은 비용이 드는 수동 레이블링에 대한 의존도를 줄이면서도 높은 주석 정밀도를 유지한다.
- SAMText-9M의 가용성은 특히 대규모 고품질 감시 데이터를 필요로 하는 비전 트랜스포머 기반 아키텍처에 유리한 새로운 연구 방향을 열어준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.