Skip to main content
QUICK REVIEW

[論文レビュー] Implementation of Deep Convolutional Neural Network in Multi-class Categorical Image Classification

P. P. Murugan|arXiv (Cornell University)|Jan 3, 2018
Brain Tumor Detection and Classification被引用数 13
ひとこと要約

本論文は、ベイジアンハイパーパramータ最適化を用いて最適化された、マルチクラスのカテゴリカル画像分類に特化した深層畳み込みニューラルネットワーク(CNN)アーキテクチャを提案する。モデルはReLU活性化関数、マックスプーリング、ドロップアウト正則化、バッチ正則化、およびAdam最適化手法を採用し、データオーグメンテーションと早期停止を用いたトレーニングにより、4クラスの画像データセットで92%の検証精度を達成した。

ABSTRACT

Convolutional Neural Networks has been implemented in many complex machine learning takes such as image classification, object identification, autonomous vehicle and robotic vision tasks. However, ConvNet architecture efficiency and accuracy depend on a large number of fac- tors. Also, the complex architecture requires a significant amount of data to train and involves with a large number of hyperparameters that increases the computational expenses and difficul- ties. Hence, it is necessary to address the limitations and techniques to overcome the barriers to ensure that the architecture performs well in complex visual tasks. This article is intended to develop an efficient ConvNet architecture for multi-class image categorical classification applica- tion. In the development of the architecture, large pool of grey scale images are taken as input information images and split into training and test datasets. The numerously available technique is implemented to reduce the overfitting and poor generalization of the network. The hyperpa- rameters of determined by Bayesian Optimization with Gaussian Process prior algorithm. ReLu non-linear activation function is implemented after the convolutional layers. Max pooling op- eration is carried out to downsampling the data points in pooling layers. Cross-entropy loss function is used to measure the performance of the architecture where the softmax is used in the classification layer. Mini-batch gradient descent with Adam optimizer algorithm is used for backpropagation. Developed architecture is validated with confusion matrix and classification report.

研究の動機と目的

  • マルチクラス画像分類タスクに適した効率的な深層畳み込みニューラルネットワークアーキテクチャの開発を目的とする。
  • ドロップアウト、L1/L2正則化、データオーグメンテーションなどの正則化技術を用いて、過学習や一般化性能の低下を是正することを目的とする。
  • ガウス過程事前分布を用いたベイジアン最適化によりハイパーパramータを最適化し、モデル性能と収束性を向上させることを目的とする。
  • 混同行列と分類レポートを用いてモデルの検証を行い、クラスごとの性能と頑健性を評価することを目的とする。

提案手法

  • アーキテクチャは11層から構成され、32、64、64、64のトレーニング可能なカーネルを有する4つの畳み込み層に続き、マックスプーリングとReLU活性化が適用される。
  • 各畳み込み層の後にはバッチ正則化とドロップアウト(0.2%)が適用され、過学習の低減と一般化性能の向上が図られる。
  • 各128ユニットを有する4つの全結合の密度層が使用され、一般化性能の向上を目的にL1およびL2正則化とドロップアウトが組み込まれる。
  • 最終的な分類層にはソフトマックス活性化関数とカテゴリカル交差エントロピー損失関数が用いられ、予測誤差が計算される。
  • バックプロパゲーションはミニバッチ勾配降下法とAdam最適化手法を用いて実行され、収束の加速が図られる。
  • 検証損失が改善しなくなった時点で学習を停止する早期停止が適用され、過学習の防止が図られる。

実験結果

リサーチクエスチョン

  • RQ1限られた過学習を伴うマルチクラス画像分類に最適化された深層CNNアーキテクチャは、どのように構築できるか?
  • RQ2マルチクラス画像分類タスクにおいて、最高の一般化性能を達成するハイパーパramータ設定は何か?
  • RQ3ドロップアウト、バッチ正則化、早期停止などの正則化技術は、モデルの頑健性向上にどの程度効果的か?
  • RQ4ガウス過程事前分布を用いたベイジアン最適化は、ランダム探索やグリッドサーチに比べてハイパーパramータ選定をどの程度改善するか?

主な発見

  • 提案されたCNNアーキテクチャは、テストセットで92%の検証精度を達成し、マルチクラス画像分類において優れた性能を示した。
  • トレーニング精度は93%に達し、顕著なアンダーフィッティングが見られなかったことを示唆している。
  • クラス1(馬)とクラス0(人間)が最も高い認識率を示したが、ネコとイヌは視覚的類似性のため、最も低い性能を示した。
  • 混同行列から、ネコとイヌの間での誤分類が最も頻発しており、それぞれ11件の誤分類が確認された。
  • 分類レポートから、すべてのクラスにおいて平均F1スコア0.92、適合率0.92、再現率0.92が得られ、性能のバランスが取れていることが示された。
  • 学習曲線から、エポック30以降にわずかに訓練損失と検証損失の乖離が見られたが、全体として安定した収束が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。