Skip to main content
QUICK REVIEW

[論文レビュー] Real-time End-to-End Video Text Spotter with Contrastive Representation Learning

Wejia Wu, Zhuang Li|arXiv (Cornell University)|Jul 18, 2022
Handwritten Text Recognition Techniques被引用数 4
ひとこと要約

CoText は、長時間にわたる時間的依存関係を捉えるために対照的表現学習を用いる、リアルタイムでエンド・ツー・エンドの動画テキストスポッティングモデルである。ICDAR2015video において 72.0% の IDF1 を達成し、前例の最高手法よりも 10.5% の精度向上と 32.0 FPS の速度向上を達成した。

ABSTRACT

Video text spotting(VTS) is the task that requires simultaneously detecting, tracking and recognizing text in the video. Existing video text spotting methods typically develop sophisticated pipelines and multiple models, which is not friend for real-time applications. Here we propose a real-time end-to-end video text spotter with Contrastive Representation learning (CoText). Our contributions are three-fold: 1) CoText simultaneously address the three tasks (e.g., text detection, tracking, recognition) in a real-time end-to-end trainable framework. 2) With contrastive learning, CoText models long-range dependencies and learning temporal information across multiple frames. 3) A simple, lightweight architecture is designed for effective and accurate performance, including GPU-parallel detection post-processing, CTC-based recognition head with Masked RoI. Extensive experiments show the superiority of our method. Especially, CoText achieves an video text spotting IDF1 of 72.0% at 41.0 FPS on ICDAR2015video, with 10.5% and 32.0 FPS improvement the previous best method. The code can be found at github.com/weijiawu/CoText.

研究の動機と目的

  • 検出、トラッキング、認識を1つのフレームワークに統合したリアルタイムでエンド・ツー・エンドの動画テキストスポッティングシステムの開発。
  • 計算コストが高く、リアルタイムデプロイメントに不適切な従来のマルチステージパイプラインの制限を克服すること。
  • 時間的依存関係のモデリングを向上させるために、対照的表現学習を用いて長期間の時間的依存関係を捉えること。
  • 高精度を維持しながら高速な推論を実現する軽量で効率的なアーキテクチャの設計。

提案手法

  • CoText は、フレーム間の堅牢な時間的表現を学習するための対照的学習戦略を採用し、長期間の依存関係のモデリングを強化している。
  • 関連するテキスト領域に注目することで認識精度を向上させるために、マスク付き RoI を用いた CTC ベースの認識ヘッドを採用している。
  • GPU 並列処理による検出後処理モジュールが推論を高速化し、リアルタイム性能を実現している。
  • モデルはエンド・ツー・エンドで訓練され、1つの統合アーキテクチャ内で検出、トラッキング、認識を同時に最適化している。
  • フレームレベルの特徴量に対して時間的対照的学習を適用し、同じテキストが複数フレームにわたって現れるポジティブなクリップ(例:同一テキスト)を一致させ、ネガティブなものを分離している。
  • 軽量な設計により、FLOPs とパラメータ数を最小限に抑え、リソース制限のあるデバイスへのデプロイを可能としている。

実験結果

リサーチクエスチョン

  • RQ1統合的でエンド・ツー・エンドのフレームワークは、マルチステージパイプラインに代わって動画テキストスポッティングに効果的に機能するだろうか? また、リアルタイム推論を維持できるか?
  • RQ2対照的表現学習は、動画テキストスポッティングにおける時間的依存関係のモデリングをどのように向上させるのか?
  • RQ3軽量アーキテクチャは、リアルタイム推論速度を達成しながら、どの程度高い精度を維持できるのか?
  • RQ4マスク付き RoI と CTC ベースの認識は、統合検出・トラッキング・認識の設定において、認識性能にどのような影響を与えるか?

主な発見

  • CoText は ICDAR2015video ベンチマークで 72.0% の IDF1 を達成し、前回の最高手法よりも 10.5% の精度向上を達成した。
  • CoText は ICDAR2015video で 41.0 FPS で動作し、前回の最先端手法よりも 32.0 FPS の速度向上を達成した。
  • 対照的学習の導入により、フレーム間の長期間の時間的整合性を正確にモデル化でき、性能が顕著に向上した。
  • GPU 並列後処理モジュールにより、精度を損なわず検出処理が効率的に高速化された。
  • 軽量なアーキテクチャにより、高精度を維持しながらリアルタイム推論が可能となり、実用的デプロイメントに適している。
  • マスク付き RoI と CTC ベースの認識の組み合わせにより、認識のロバスト性と精度が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。