[论文解读] Contrastive Learning of Semantic and Visual Representations for Text Tracking
本文提出SVRep,一种端到端视频文本追踪方法,通过对比学习联合学习语义与视觉表征,以提升文本追踪的鲁棒性。通过结合视频帧间的视觉外观与语义上下文,SVRep在ICDAR2015(视频)数据集上实现了65.9%的mID-F1,推理速度达16.7 FPS,性能达到当前最先进水平,较之前方法提升8.6%。
Semantic representation is of great benefit to the video text tracking(VTT) task that requires simultaneously classifying, detecting, and tracking texts in the video. Most existing approaches tackle this task by appearance similarity in continuous frames, while ignoring the abundant semantic features. In this paper, we explore to robustly track video text with contrastive learning of semantic and visual representations. Correspondingly, we present an end-to-end video text tracker with Semantic and Visual Representations(SVRep), which detects and tracks texts by exploiting the visual and semantic relationships between different texts in a video sequence. Besides, with a light-weight architecture, SVRep achieves state-of-the-art performance while maintaining competitive inference speed. Specifically, with a backbone of ResNet-18, SVRep achieves an ${ m ID_{F1}}$ of $ extbf{65.9\%}$, running at $ extbf{16.7}$ FPS, on the ICDAR2015(video) dataset with $ extbf{8.6\%}$ improvement than the previous state-of-the-art methods.
研究动机与目标
- 解决现有视频文本追踪方法过度依赖外观相似性而忽略丰富语义特征的局限性。
- 通过整合语义与视觉表征,提升视频文本追踪的鲁棒性。
- 开发一种端到端、轻量级架构,在不牺牲准确率的前提下保持高推理速度。
- 通过跨模态表征的对比学习,实现对多样化视频文本追踪场景的更好泛化能力。
提出的方法
- 采用对比学习对视频帧中文本实例的语义与视觉表征进行对齐。
- 使用ResNet-18主干网络提取视觉特征,使用文本编码器生成语义嵌入。
- 基于检测到的文本之间的时序关系与语义关系构建正样本对与负样本对。
- 使用对比损失端到端训练模型,以最大化正样本对的一致性,最小化负样本对的一致性。
- 在统一框架中联合利用视觉与语义特征,实现检测与追踪的联合优化。
- 通过轻量化设计优化准确率与推理速度,实现实时性能。
实验结果
研究问题
- RQ1与仅依赖外观的方法相比,语义与视觉表征的联合学习是否能提升视频文本追踪性能?
- RQ2对比学习在对齐视频文本追踪中的语义与视觉特征方面有多有效?
- RQ3所提方法在实现SOTA准确率的同时,能在多大程度上保持高推理速度?
- RQ4语义上下文的整合在提升复杂视频序列中追踪鲁棒性方面有何作用?
主要发现
- SVRep在ICDAR2015(视频)数据集上实现了65.9%的SOTA mID-F1得分。
- 与之前SOTA方法相比,mID-F1提升了8.6%,展现出显著的性能提升。
- 采用ResNet-18主干网络,SVRep推理速度达16.7 FPS,表明其具备强大的实时推理能力。
- 与仅依赖外观的基线模型相比,语义与视觉表征的对比学习显著增强了追踪鲁棒性。
- 轻量化架构在不牺牲准确率的前提下实现了优异的推理速度,适用于实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。