[論文レビュー] Contrastive Learning of Semantic and Visual Representations for Text Tracking
本稿では、対照的学習を用いて、映像フレーム間の意味的特徴と視覚的特徴を同時に学習することで、テキスト追跡のロバスト性を向上させるエンド・ツー・エンドの動画テキストトラッカー、SVRepを提案する。視覚的外観と意味的文脈の両方を活用することで、ICDAR2015(動画)で16.7 FPSで65.9%のmID-F1を達成し、最先端の性能を発揮し、先行手法を8.6%上回った。
Semantic representation is of great benefit to the video text tracking(VTT) task that requires simultaneously classifying, detecting, and tracking texts in the video. Most existing approaches tackle this task by appearance similarity in continuous frames, while ignoring the abundant semantic features. In this paper, we explore to robustly track video text with contrastive learning of semantic and visual representations. Correspondingly, we present an end-to-end video text tracker with Semantic and Visual Representations(SVRep), which detects and tracks texts by exploiting the visual and semantic relationships between different texts in a video sequence. Besides, with a light-weight architecture, SVRep achieves state-of-the-art performance while maintaining competitive inference speed. Specifically, with a backbone of ResNet-18, SVRep achieves an ${ m ID_{F1}}$ of $ extbf{65.9\%}$, running at $ extbf{16.7}$ FPS, on the ICDAR2015(video) dataset with $ extbf{8.6\%}$ improvement than the previous state-of-the-art methods.
研究の動機と目的
- 外観類似度に過度に依存する既存の動画テキスト追跡手法の限界を解決する。
- 意味的特徴と視覚的特徴を統合することで、動画テキスト追跡のロバスト性を向上させる。
- 精度を損なわずに高い推論速度を維持するエンド・ツー・エンドで軽量なアーキテクチャを開発する。
- クロスモodal表現の対照的学習により、多様な動画テキスト追跡シナリオにわたる一般化性能を向上させる。
提案手法
- テキストインスタンスの映像フレーム間での意味的特徴と視覚的特徴を対照的学習で一致させる。
- 視覚的特徴を抽出するためResNet-18バックボーンと、意味的埋め込みを生成するテキストエンコーダーを用いる。
- 検出されたテキスト間の時間的および意味的関係に基づいて、ポジティブおよびネガティブペアを構築する。
- ポジティブペア間の一致を最大化し、ネガティブペア間の一致を最小化するように、対照的損失を用いてモデルをエンド・ツー・エンドで訓練する。
- 統一されたフレームワーク内で視覚的および意味的特徴を統合し、共同検出と追跡を実現する。
- 軽量な設計により、精度と推論速度の両方を最適化し、リアルタイム性能を実現する。
実験結果
リサーチクエスチョン
- RQ1外観のみに依存する手法と比較して、意味的および視覚的特徴の共同学習が動画テキスト追跡性能を向上させるか?
- RQ2対照的学習は、動画内のテキスト追跡における意味的特徴と視覚的特徴の一致にどの程度効果的か?
- RQ3提案手法は、最先端の精度を達成しつつ、どの程度高い推論速度を維持できるか?
- RQ4意味的文脈の統合は、挑戦的な動画シーケンスにおいて追跡のロバスト性をどの程度向上させるか?
主な発見
- SVRepはICDAR2015(動画)データセットでSOTAのmID-F1 65.9%を達成した。
- 前回のSOTAをmID-F1で8.6%上回り、顕著な性能向上を示した。
- ResNet-18バックボーンを用いることで、SVRepは16.7 FPSで実行され、優れたリアルタイム推論能力を示した。
- 意味的特徴と視覚的特徴の対照的学習により、外観のみのベースラインと比較して、追跡のロバスト性が顕著に向上した。
- 軽量なアーキテクチャにより、精度を損なわず競争力ある速度を実現し、実世界への展開に適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。