[论文解读] Scalable Mask Annotation for Video Text Spotting
本文提出 SAMText,一种用于视频文本检测的可扩展掩码标注流程,利用分割一切模型(SAM)大规模生成细粒度分割掩码。通过该方法,作者构建了 SAMText-9M 数据集,该数据集包含超过 900 万个掩码标注,覆盖 2,400 段视频片段,显著提升了在曲线文本或密集文本等复杂文本场景下的性能。
Video text spotting refers to localizing, recognizing, and tracking textual elements such as captions, logos, license plates, signs, and other forms of text within consecutive video frames. However, current datasets available for this task rely on quadrilateral ground truth annotations, which may result in including excessive background content and inaccurate text boundaries. Furthermore, methods trained on these datasets often produce prediction results in the form of quadrilateral boxes, which limits their ability to handle complex scenarios such as dense or curved text. To address these issues, we propose a scalable mask annotation pipeline called SAMText for video text spotting. SAMText leverages the SAM model to generate mask annotations for scene text images or video frames at scale. Using SAMText, we have created a large-scale dataset, SAMText-9M, that contains over 2,400 video clips sourced from existing datasets and over 9 million mask annotations. We have also conducted a thorough statistical analysis of the generated masks and their quality, identifying several research topics that could be further explored based on this dataset. The code and dataset will be released at \url{https://github.com/ViTAE-Transformer/SAMText}.
研究动机与目标
- 解决现有视频文本检测数据集依赖粗粒度四边形边界框所带来的局限性,后者导致文本边界不准确,且在曲线或密集文本场景下表现不佳。
- 通过利用基础模型自动化处理,降低大规模视频数据集手动掩码标注的高昂人力成本。
- 为视频文本检测提供高质量、细粒度的掩码标注,以提升模型泛化能力,并支持曲线文本识别和视频文本分割等高级任务。
- 构建一个大规模、多样化且高质量的数据集(SAMText-9M),以推动视频文本检测及相关下游任务的研究进展。
提出的方法
- 利用预训练的分割一切模型(SAM)从输入边界框(来自现有数据集或场景文本检测模型的预测结果)生成分割掩码。
- 设计一种可扩展的流程,处理单个视频帧或图像裁剪区域,采用基于提示的分割方法,为每个文本实例生成精确的掩码标注。
- 收集五个现有视频文本数据集——ICDAR15、RoadText-1K、LSVTD、BOVText 和 DSText——作为掩码生成的输入源。
- 使用 SAM 的点提示或框提示生成实例级掩码,确保即使在不规则形状或曲线文本上也能保持高精度。
- 对生成的掩码执行质量控制与统计验证,以确保在多样化视频场景下具备可靠性和一致性。
- 通过聚合所有输入数据集的掩码标注,构建 SAMText-9M,形成一个大规模、多场景、多语言的细粒度监督视频文本数据集。
实验结果
研究问题
- RQ1与传统的四边形或边界框标注相比,掩码标注在多大程度上提升了视频文本检测的性能?
- RQ2细粒度掩码标注的引入如何影响模型泛化能力,特别是在曲线或密集排列的文本场景下?
- RQ3增加训练数据规模——尤其是高质量掩码标注——对模型性能与可扩展性有何影响?
- RQ4基于 SAM 的流程能否有效扩展至生成字符级别的掩码标注,以支持细粒度文本编辑与识别任务?
主要发现
- SAMText 流程成功从五个现有数据集的 2,400 段视频片段中生成了超过 900 万个高质量掩码标注,显著扩展了细粒度视频文本标注的规模。
- 生成的 SAMText-9M 数据集展现出多样的文本掩码空间分布,包括均匀分布模式(如 DSText)和区域特定聚集模式(如 ICDAR15 和 RoadText-1K 中的上半区域),增强了模型的鲁棒性。
- 由于掩码级监督的高精度,该数据集支持视频文本分割、跟踪与识别等高级研究,尤其适用于曲线或密集文本等挑战性场景。
- 对掩码质量的统计分析证实了标注的可靠性,为未来在视频文本检测中开展数据与模型可扩展性研究提供了基础。
- 该流程实现了可扩展、低成本的细粒度标注生成,降低了对昂贵人工标注的依赖,同时保持了高标注保真度。
- SAMText-9M 的可用性为模型可扩展性研究开辟了新方向,尤其对受益于大规模高质量监督的视觉变换器架构具有重要意义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。