Skip to main content
QUICK REVIEW

[論文レビュー] A Binary Convolutional Encoder-decoder Network for Real-time Natural Scene Text Processing

Zichuan Liu, Yixing Li|arXiv (Cornell University)|Dec 12, 2016
Advanced Image and Video Retrieval Techniques参考文献 11被引用数 12
ひとこと要約

本稿では、1回の順方向伝搬で複数の文字を同時に検出・認識できる二値畳み込みエンコーダ・デコーダネットワーク、B-CEDNetを提案する。学習時に二値制約を課すことにより、重みと活性化を二値化することで、ICDAR-13で91%のピクセル単位の正解率を達成し、推論時間が4.59 ms、モデルサイズが2.14 MBにまで削減された。これは、元の符号精度モデルと比較して8倍高速で、96%もメモリを削減した。

ABSTRACT

In this paper, we develop a binary convolutional encoder-decoder network (B-CEDNet) for natural scene text processing (NSTP). It converts a text image to a class-distinguished salience map that reveals the categorical, spatial and morphological information of characters. The existing solutions are either memory consuming or run-time consuming that cannot be applied to real-time applications on resource-constrained devices such as advanced driver assistance systems. The developed network can process multiple regions containing characters by one-off forward operation, and is trained to have binary weights and binary feature maps, which lead to both remarkable inference run-time speedup and memory usage reduction. By training with over 200, 000 synthesis scene text images (size of $32 imes128$), it can achieve $90\%$ and $91\%$ pixel-wise accuracy on ICDAR-03 and ICDAR-13 datasets. It only consumes $4.59\ ms$ inference run-time realized on GPU with a small network size of 2.14 MB, which is up to $8 imes$ faster and $96\%$ smaller than it full-precision version.

研究の動機と目的

  • リソース制約のあるデバイスにおけるリアルタイム自然シーンテキスト処理(NSTP)のための、メモリ効率が高く低遅延なソリューションの不足に対処すること。
  • 従来の単語レベルおよび文字レベル認識手法における逐次的特徴検出と高いメモリ使用量の制限を克服すること。
  • 局所化マップを通じて空間的、カテゴリ的、形状的情報を学習し、ワンショットで並列に文字を予測可能にする。
  • 符号精度を損なわずに、二値重みと活性化の制約を用いることで、高い推論速度と低メモリ消費を達成すること。

提案手法

  • 入力画像を処理前に二値形式に変換するアダプタモジュールを備えた二値エンコーダ・デコーダアーキテクチャを設計する。
  • 標準的な畳み込みを置き換えるために、XNOR演算を用いた効率的な計算を行う二値畳み込み層を実装する。
  • 各エンコーダブロックでバッチ正規化とマックスプーリングを適用し、学習の安定化と特徴マップのダウンサンプリングを実現する。
  • デコーダで逆畳み込み層を用い、入力画像サイズと一致する高解像度の局所化マップを再構築する。
  • 各ブロック後に二値化層を導入し、二値活性化を強制することで、ビット単位の並列処理を可能にする。
  • 出力が27クラス(26文字 + 背景)の確率分布をとるピクセル単位のカテゴリカルな監視を伴うクロスエントロピー損失関数を用いて学習する。

実験結果

リサーチクエスチョン

  • RQ1二値畳み込みエンコーダ・デコーダネットワークは、リアルタイム推論速度を維持しながら、自然シーンテキスト処理で高い精度を達成できるか?
  • RQ2二値重みと活性化の使用は、認識性能を劣化させることなく、メモリ使用量を削減し、推論を高速化するのにどの程度有効か?
  • RQ3提案されたネットワークは、1回の順方向伝搬で複数の文字を同時に検出・認識でき、逐次的検出手法を上回る性能を示せるか?
  • RQ4合成データで学習したモデルは、実世界の照明やコントラストの変動に対してどの程度一般化できるか?
  • RQ5XNORカーネル最適化は、標準的な畳み込みカーネルと比較して、推論速度とメモリ消費にどの程度の影響を及けるか?

主な発見

  • B-CEDNetは、合成データ20万枚のみを用いて、ICDAR-03とICDAR-13ベンチマークデータセットでそれぞれ90%および91%のピクセル単位の正解率を達成した。
  • TITAN X GPU上での推論時間は1画像あたり4.59 msであり、符号精度バージョンと比較して8倍の高速化を達成した。
  • 二値重みと活性化のおかげで、メモリ使用量は2.14 MBにまで削減され、符号精度モデルの66.12 MBと比較して96%も小さくなった。
  • XNORカーネル最適化は、最も計算負荷の高いブロック(ブロック-8)で最大17.7倍の高速化を達成し、計算強度に応じたスケーラビリティを示した。
  • 局所化マップでは、通常の照明とコントラスト条件下では高い信頼度を示したが、不均一な照明や低コントラスト領域では信頼度が低下しており、拡張されたトレーニングデータによる改善の余地があることが示唆された。
  • モデルの性能は標準的な条件下で頑健であり、より困難な実世界のケースを含むトレーニングデータの拡張により、さらなる精度向上が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。