Skip to main content
QUICK REVIEW

[論文レビュー] Open Images V5 Text Annotation and Yet Another Mask Text Spotter

Ilya Krylov, S. K. Nosov|arXiv (Cornell University)|Jun 23, 2021
Handwritten Text Recognition Techniques参考文献 18被引用数 8
ひとこと要約

本論文は、Open Images V5用の最大規模の公開可能で人手によるアノテーションが施されたテキストデータセットを紹介し、シーンテキストインスタンスの正確な局所化と転写を特徴としています。このデータセットを用いて、著者たちはシンプルなマスクRCNNベースのモデル、Yet Another Mask Text Spotter (YAMTS) を訓練しました。このモデルは、ICDAR 2013、ICDAR 2015、Total-Textベンチマークで最先端または競争力のある性能を達成しており、微調整後、Total-Textで74.5%のエンドツーエンド認識率を達成しています。

ABSTRACT

A large scale human-labeled dataset plays an important role in creating high quality deep learning models. In this paper we present text annotation for Open Images V5 dataset. To our knowledge it is the largest among publicly available manually created text annotations. Having this annotation we trained a simple Mask-RCNN-based network, referred as Yet Another Mask Text Spotter (YAMTS), which achieves competitive performance or even outperforms current state-of-the-art approaches in some cases on ICDAR2013, ICDAR2015 and Total-Text datasets. Code for text spotting model available online at: https://github.com/openvinotoolkit/training_extensions. The model can be exported to OpenVINO-format and run on Intel CPUs.

研究の動機と目的

  • Open Images V5用に、シーンテキストスポッティングモデルの訓練を向上させることを目的とした、最大規模の公開可能で手作業によるアノテーションが施されたテキストデータセットの作成とリリース。
  • 複雑なアーキテクチャの変更なしに、競争力のある性能を発揮するシンプルで効果的なマスクRCNNベースのモデル(YAMTS)の開発。
  • 新しくリリースされたOpen Images V5テキストアノテーションを用いた学習が、標準ベンチマークにおけるモデルの汎化性能と性能向上に与える影響の実証。
  • OpenVINO™フォーマットへのエクスポートにより、Intel CPU上で効率的な推論が可能なモデルのデプロイメントを可能にする。

提案手法

  • 著者たちは、正確な境界ポリゴンと転写情報を含む、Open Images V5からのテキストインスタンスのスケールアップされた人手によるアノテーションデータセットを収集・リリースした。
  • 標準的なトレーニング手順を用い、特別なモジュールやデータオーグメンテーションのテクニックを用いないマスクRCNNアーキテクチャにテキスト認識ヘッドを追加して学習した。
  • 他のすべてのレイヤーを凍結し、テキスト認識ヘッドのみを微調整することで、130,000イテレーションにわたり最適化を行い、認識精度を向上させた。
  • 推論をOpenVINO™フォーマットにエクスポートすることで可能にし、Intel CPU上での効率的なデプロイメントを実現した。
  • 標準的な指標(語彙の種類に応じたワードスポッティングとエンドツーエンド認識)を用いて、ICDAR 2013、ICDAR 2015、Total-Text、Open Images V5の検証セットで性能を評価した。
  • アブレーションスタディとして、Open Images V5テキストアノテーションを除いて再トレーニングすることで、その貢献度を分離して評価した。

実験結果

リサーチクエスチョン

  • RQ1Open Images V5のような大規模かつ高品質な手作業によるシーンテキストデータセットを用いた学習が、標準的なマスクRCNNベースのテキストスポッティングモデルの性能に与える影響は何か?
  • RQ2特別なモジュールやアーキテクチャの複雑化なしに、標準的なテキスト認識ヘッドを備えたシンプルなマスクRCNNベースのアーキテクチャが、標準ベンチマークで最先端の性能を達成できるか?
  • RQ3他のレイヤーを凍結した状態で、テキスト認識ヘッドのみを微調整することで、特に曲がった文字列や多方向テキストに対して認識精度がどの程度向上するか?
  • RQ4Open Images V5テキストアノテーションの含むことで、Total-Text や ICDAR 2015 といった未学習のデータセットでの性能によって、モデルの汎化性能がどの程度向上するか?

主な発見

  • YAMTSは、汎用語彙と1280x768の入力解像度を用いて、ICDAR 2015で74.1%のエンドツーエンド認識率を達成し、いくつかの先行手法を上回った。
  • 他のレイヤーを凍結した状態でテキスト認識ヘッドを微調整した後、YAMTSはTotal-Textで74.5%のエンドツーエンド認識率を達成し、より大きなTextOCRデータセットで微調整されたMask TextSpotter v3と同等の性能を示した。
  • 微調整なしで、YAMTSはTotal-Textで73.7%のエンドツーエンド認識率を達成しており、曲がった文字列や多方向テキストに対して優れたベースライン性能を示した。
  • アブレーション実験の結果、Open Images V5テキストアノテーションを除外した場合、性能が顕著に低下したことが確認され、このデータセットがモデルの汎化性能向上に果たす重要性が裏付けられた。
  • Open Images V5の検証セットでは、1600x960の入力解像度でYAMTSが56.3%のエンドツーエンド認識率を達成し、元のデータセットへのゼロショット汎化性能が強いことが示された。
  • 高品質で大規模な手作業によるアノテーションデータが、シンプルで標準的なアーキテクチャでさえも、モデル性能を顕著に向上させられることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。