Skip to main content
QUICK REVIEW

[論文レビュー] ShopSign: a Diverse Scene Text Dataset of Chinese Shop Signs in Street Views

Chongsheng Zhang, Guowen Peng|arXiv (Cornell University)|Mar 25, 2019
Handwritten Text Recognition Techniques参考文献 17被引用数 4
ひとこと要約

本稿では、20以上の都市から収集されたストリートビュー画像から得た25,362枚の中国語店舗看板画像から構成され、196,010行のテキストがアノテートされた大規模で多様性に富み、かつ挑戦的なデータセット「ShopSign」を紹介する。ShopSignおよび関連データセット上で最先端のシーンテキスト検出モデル(EAST、TextBoxes++、CTPN)を評価した結果、特に鏡文字、隠蔽済み、変形したテキストなどの困難なケースにおいて、ShopSignで訓練した場合に顕著な性能向上が見られた。

ABSTRACT

In this paper, we introduce the ShopSign dataset, which is a newly developed natural scene text dataset of Chinese shop signs in street views. Although a few scene text datasets are already publicly available (e.g. ICDAR2015, COCO-Text), there are few images in these datasets that contain Chinese texts/characters. Hence, we collect and annotate the ShopSign dataset to advance research in Chinese scene text detection and recognition. The new dataset has three distinctive characteristics: (1) large-scale: it contains 25,362 Chinese shop sign images, with a total number of 196,010 text-lines. (2) diversity: the images in ShopSign were captured in different scenes, from downtown to developing regions, using more than 50 different mobile phones. (3) difficulty: the dataset is very sparse and imbalanced. It also includes five categories of hard images (mirror, wooden, deformed, exposed and obscure). To illustrate the challenges in ShopSign, we run baseline experiments using state-of-the-art scene text detection methods (including CTPN, TextBoxes++ and EAST), and cross-dataset validation to compare their corresponding performance on the related datasets such as CTW, RCTW and ICPR 2018 MTWI challenge dataset. The sample images and detailed descriptions of our ShopSign dataset are publicly available at: https://github.com/chongshengzhang/shopsign.

研究の動機と目的

  • 中国語のシーンテキスト検出および認識の分野において、大規模で多様性に富み、かつ挑戦的なデータセットが不足しているという問題に対処すること。
  • 多様な都市部および地方環境から、実際の中国語店舗看板の大規模データセットを収集・アノテートすること。
  • 鏡文字、木製、変形、露出、隠蔽の5つの困難な画像カテゴリに基づき、中国語のシーンテキスト検出の難易度を特徴づけ、定量的に評価すること。
  • ShopSignおよび関連データセット上で最先端のシーンテキスト検出モデルの性能を評価し、現在の限界を浮き彫りにすること。
  • 実際の困難な例を含むベンチマークデータセットを提供することで、中国語フォトOCR分野におけるさらなる研究を促進すること。

提案手法

  • 20以上の都市からストリートビュー画像を収集し、50台以上の異なるスマートフォンを用いて、撮影条件の多様性を確保した。
  • テキストラインベースのアノテーション方式を用い、各テキストラインに対して正確なバウンディングボックスを手動でアノテートした。
  • 視覚的および認識上の課題に基づき、画像を5つの困難なカテゴリ(鏡文字、木製、変形、露出、隠蔽)に分類した。
  • ShopSignおよびCTW、RCTW、MTWIのクロスデータセット検証を実施し、EAST、TextBoxes++、CTPNという3つの最先端のシーンテキスト検出モデルを訓練および評価した。
  • 画像レベルおよびテキストラインレベルのリCALL分析を実施し、困難な例における検出性能を測定。ShopSignで微調整したモデルとそうでないモデルを比較した。
  • クロスデータセット学習および評価を実施し、特にレアまたは複雑なテキストレイアウトのケースにおける汎化性能と向上度を評価した。

実験結果

リサーチクエスチョン

  • RQ1既存のシーンテキスト検出モデルは、多様な視覚的条件を有する実際の中国語店舗看板に対して、どの程度一般化性能を示すか?
  • RQ2ShopSignデータセットを含めることで、鏡文字、隠蔽済み、変形テキストなどの困難な例における検出性能はどの程度向上するか?
  • RQ3中国語の漢字がシーンテキスト検出において引き起こす具体的な課題は何か。また、それらはモデルのリCALLおよび精度にどのように影響するか?
  • RQ4ShopSignを訓練データに含めることで、CTW や RCTW のようなベンチマークデータセット上で、EAST や TextBoxes++、CTPN などのモデル性能はどの程度向上するか?
  • RQ5現在のディーブラーニングモデルは、複雑な実世界環境における中国語シーンテキスト検出において、どのような主な失敗モードを示すか?

主な発見

  • ShopSignは、多様な地理的およびデバイス条件から得られた25,362枚の画像と、196,010行のテキストラインを含み、実世界の中国語シーンテキストデータセットとしては最大級のものである。
  • EAST や TextBoxes++、CTPN といったベースラインモデルは、ShopSignで訓練した場合、特に隠蔽済みおよび鏡文字のケースで顕著なリCALL向上を示した。
  • 困難な画像カテゴリにおいて、EAST や CTPN のリCALLは、鏡文字および隠蔽済みテキストで41.2%未満に低下しており、検出の困難さが顕著に示された。
  • TextBoxes++ は、EAST や CTPN よりも困難な例に対してより高いロバスト性を示した。特に鏡文字および隠蔽済みテキストの検出において顕著であった。
  • ShopSignを用いたクロスデータセット学習により、CTW、RCTW、MTWIの各データセットで平均適合率(mAP)およびリCALLが向上し、データ拡張リソースとしての価値が示された。
  • 本データセットは、特にレアな中国語漢字に対して深刻なデータスパarsityとクラス不均衡を示しており、今後の研究においてGANを用いた合成データ生成の必要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。