Skip to main content
QUICK REVIEW

[論文レビュー] Dense Residual Network: Enhancing Global Dense Feature Flow for Character Recognition

Zhao Zhang, Zemin Tang|arXiv (Cornell University)|Jan 23, 2020
Handwritten Text Recognition Techniques参考文献 51被引用数 4
ひとこと要約

本稿では、局所的特徴統合と計算コストの削減を実現する高速残差密接続ブロック(f-RDB)と、グローバルな残差特徴の適応的で包括的な学習を可能にするグローバル密接続ブロック(GDB)を導入することで、シーンテキスト認識におけるグローバルな密な特徴フローを向上させる、新たなCNNアーキテクチャ「Fast Dense Residual Network(FDRN)」を提案する。FDRNは、すべての層にわたる階層的特徴を効果的に統合することで、計算コストを低減しつつ複数のテキスト認識ベンチマークで最先端の性能を達成する。

ABSTRACT

Deep Convolutional Neural Networks (CNNs), such as Dense Convolutional Networks (DenseNet), have achieved great success for image representation by discovering deep hierarchical information. However, most existing networks simply stacks the convolutional layers and hence failing to fully discover local and global feature information among layers. In this paper, we mainly explore how to enhance the local and global dense feature flow by exploiting hierarchical features fully from all the convolution layers. Technically, we propose an efficient and effective CNN framework, i.e., Fast Dense Residual Network (FDRN), for text recognition. To construct FDRN, we propose a new fast residual dense block (f-RDB) to retain the ability of local feature fusion and local residual learning of original RDB, which can reduce the computing efforts at the same time. After fully learning local residual dense features, we utilize the sum operation and several f-RDBs to define a new block termed global dense block (GDB) by imitating the construction of dense blocks to learn global dense residual features adaptively in a holistic way. Finally, we use two convolution layers to construct a down-sampling block to reduce the global feature size and extract deeper features. Extensive simulations show that FDRN obtains the enhanced recognition results, compared with other related models.

研究の動機と目的

  • 既存のCNNがすべての層にわたる階層的局所的およびグローバル特徴を十分に活用できないという制限に対処すること。
  • 局所的残差学習とグローバルな密な特徴集約の両方を強化することで、深層ネットワーク内の特徴フローを改善すること。
  • 高い性能を維持しつつ、シーンテキスト認識タスクにおいて計算効率の良いアーキテクチャを設計すること。
  • 密接続ブロックにインspiredされた新しいブロック構造を用いて、グローバルな残差特徴の適応的で包括的な学習を可能にすること。
  • 最適化された残差接続および密接続を用いることで、計算オーバーヘッドを低減しながら認識精度を維持または向上させること。

提案手法

  • 局所的特徴統合と残差学習を維持しつつ、計算コストを削減する高速残差密接続ブロック(f-RDB)を提案する。
  • グローバルな残差特徴を包括的かつ適応的に学習するため、密接続ブロックの設計を模倣したグローバル密接続ブロック(GDB)を導入する。
  • GDB内で和集合演算と複数のf-RDBを用いて、層間の特徴を統合し、より強化されたグローバル表現を実現する。
  • 特徴マップのサイズを小さくし、より深い表現を抽出するために、2つの畳み込み層をダウンサンプリングブロックとして使用する。
  • f-RDBとGDBをスタック式で階層的に組み合わせることで、段階的に深く階層的な特徴を構築する。
  • f-RDB、GDB、およびダウンサンプリングブロックをスタックしてFDRNネットワーク全体を構築し、特徴フローと表現の最適化を図る。

実験結果

リサーチクエスチョン

  • RQ1深層CNNにおいて、テキスト認識の向上を図るために、局所的およびグローバル特徴フローをどのように強化できるか。
  • RQ2統合されたアーキテクチャ内で、局所的残差学習とグローバルな密な特徴集約を統合した場合の影響は何か。
  • RQ3軽量なブロック設計(f-RDB)は、計算コストを削減しつつも、テキスト認識ネットワークにおける性能を維持できるか。
  • RQ4提案されたグローバル密接続ブロック(GDB)は、標準の残差ブロックや密接続ブロックと比較して、どのように特徴表現を改善するか。
  • RQ5すべての層にわたる階層的特徴統合が、シーンテキスト認識における認識精度をどの程度向上させるか。

主な発見

  • FDRNは、複数のベンチマークデータセットにおいて、シーンテキスト認識で最先端の性能を達成し、既存のモデルを上回る。
  • 提案されたf-RDBは、計算コストを削減しつつも、標準の残差密接続ブロックが有する局所的特徴統合および残差学習の能力を維持している。
  • グローバル密接続ブロック(GDB)は、適応的で包括的なグローバルな残差特徴の学習を可能にし、特徴表現を顕著に向上させている。
  • FDRNは、すべての層にわたる優れた一般化性能と特徴フローを示しており、認識精度の向上に寄与している。
  • 広範なアブレーションスタディにより、f-RDBおよびGDBの両構成要素が、推論複雑度を増加させることなく性能を向上させることの有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。