Skip to main content
QUICK REVIEW

[論文レビュー] Fully-Convolutional Intensive Feature Flow Neural Network for Text Recognition

Zhao Zhang, Zemin Tang|arXiv (Cornell University)|Dec 13, 2019
Handwritten Text Recognition Techniques参考文献 50被引用数 7
ひとこと要約

本稿では、従来のプーリングをストライド2の畳み込みに置き換え、特徴の流れを向上させるとともに空間情報を保持するための密な統合と深度可分畳み込みを組み込んだ、テキスト認識向けの完全畳み込みニューラルネットワークであるIntensiveNetを提案する。モデルは、特徴の活用と学習効率を向上させることで、大規模な中国語テキストおよびMNISTデータセットで最先端の性能を達成する。

ABSTRACT

The Deep Convolutional Neural Networks (CNNs) have obtained a great success for pattern recognition, such as recognizing the texts in images. But existing CNNs based frameworks still have several drawbacks: 1) the traditaional pooling operation may lose important feature information and is unlearnable; 2) the tradi-tional convolution operation optimizes slowly and the hierar-chical features from different layers are not fully utilized. In this work, we address these problems by developing a novel deep network model called Fully-Convolutional Intensive Feature Flow Neural Network (IntensiveNet). Specifically, we design a further dense block called intensive block to extract the feature information, where the original inputs and two dense blocks are connected tightly. To encode data appropriately, we present the concepts of dense fusion block and further dense fusion opera-tions for our new intensive block. By adding short connections to different layers, the feature flow and coupling between layers are enhanced. We also replace the traditional convolution by depthwise separable convolution to make the operation efficient. To prevent important feature information being lost to a certain extent, we use a convolution operation with stride 2 to replace the original pooling operation in the customary transition layers. The recognition results on large-scale Chinese string and MNIST datasets show that our IntensiveNet can deliver enhanced recog-nition results, compared with other related deep models.

研究の動機と目的

  • 畳み込みニューラルネットワークにおける従来のプーリング操作が引き起こす空間的および意味的特徴情報の損失を解消すること。
  • 深さ可分畳み込みを用いて標準畳み込みを置き換えることで、学習の高速化と特徴の活用効率の向上を図ること。
  • 密な統合とスキップ接続を備えた新規な強化ブロックを用いて、層間の特徴の流れを強化すること。
  • ダウンサンプリングに起因する情報損失を回避する完全畳み込みアーキテクチャの開発。
  • 大規模かつ多様なテキストデータセットにおける優れたテキスト認識精度の達成。

提案手法

  • 元の入力と2つの密なブロックをタイトに多スケールのスキップ接続で接続する、特徴の再利用を促進する強化ブロックを導入する。
  • 複数の層からの特徴を統合するための密な統合ブロックと操作を用い、階層的特徴表現を強化する。
  • 空間解像度の保持と情報損失の低減を図るため、遷移層で従来のマックスプーリングをストライド2の畳み込み操作に置き換える。
  • 計算コストの低減を図りながらモデルの容量と効率を維持するため、深度可分畳み込みを用いる。
  • 完全畳み込み型のエンコーダ・デコーダ構造を設計し、全結合層を排除することでエンドツーエンドのテキスト認識を実現する。
  • 勾配の流れと学習安定性を向上させるために、層間に残留型スキップ接続を適用する。

実験結果

リサーチクエスチョン

  • RQ1従来のプーリングをストライド2の畳み込みに置き換えることで、テキスト認識ネットワークにおける特徴情報損失を軽減できるか?
  • RQ2複数の層にわたる特徴の密な統合は、認識精度をどのように向上させるか?
  • RQ3深度可分畳み込みを用いることで、性能を損なわず学習効率をどの程度向上できるか?
  • RQ4強化された特徴の流れを備えた完全畳み込みアーキテクチャは、既存のCNNベースのテキスト認識モデルを上回ることができるか?
  • RQ5提案された強化ブロックは、さまざまなテキストデータセットにおける特徴表現の向上にどの程度効果的か?

主な発見

  • IntensiveNetは、大規模な中国語テキスト認識データセットで最先端の性能を達成し、既存のモデルを上回る。
  • MNISTデータセットにおいても高い認識精度を示し、標準ベンチマークでの有効性を確認した。
  • プーリングをストライド2の畳み込みに置き換えることで、マックスプーリングに比べて特徴情報損失が顕著に低減された。
  • 深度可分畳み込みの使用により、モデルパラメータ数とFLOPsが削減されたが、高い認識精度を維持した。
  • 密な統合とスキップ接続を備えた強化ブロックは、特徴の流れを強化し、学習中の勾配伝搬を改善した。
  • 完全畳み込みアーキテクチャにより、空間的特徴の保持が優れており、エンドツーエンド学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。