[論文レビュー] Bengali Handwritten Character Classification using Transfer Learning on Deep Convolutional Neural Network
本稿では、Bengali handwritten character recognition (HCR) のための転移学習ベースのアプローチを提案する。BanglaLekha-Isolated データセット上で微調整された ResNet50 を用い、わずか 47 エポックで 96.12% の精度を達成した。修正されたワンサイクルポリシーと最適化された入力画像サイズを活用することで、非アンサンブル手法においても、84 クラス分類の高速収束を実現し、既存手法を上回る性能を発揮した。
In this paper, we propose a solution which uses state-of-the-art techniques in Deep Learning to tackle the problem of Bengali Handwritten Character Recognition ( HCR ). Our method uses lesser iterations to train than most other comparable methods. We employ Transfer Learning on ResNet 50, a state-of-the-art deep Convolutional Neural Network Model, pretrained on ImageNet dataset. We also use other techniques like a modified version of One Cycle Policy, varying the input image sizes etc. to ensure that our training occurs fast. We use the BanglaLekha-Isolated Dataset for evaluation of our technique which consists of 84 classes (50 Basic, 10 Numerals and 24 Compound Characters). We are able to achieve 96.12% accuracy in just 47 epochs on BanglaLekha-Isolated dataset. When comparing our method with that of other researchers, considering number of classes and without using Ensemble Learning, the proposed solution achieves state of the art result for Handwritten Bengali Character Recognition. Code and weight files are available at https://github.com/swagato-c/bangla-hwcr-present.
研究の動機と目的
- 深層学習を用いた Bengali 手書き文字認識 (HCR) における低精度と高コストなトレーニングの課題を解決すること。
- 基本文字、数字、合成文字を含む複雑な 84 クラスのデータセットにおける認識性能を向上させること。
- 効率的なトレーニング戦略を用いて、トレーニングイテレーションを短縮しながら高い精度を維持すること。
- アンサンブル学習手法を用いない新しい Bengali HCR の最先端の結果を確立すること。
提案手法
- ImageNet データセットで事前に学習された ResNet50 モデルを Bengali HCR のために微調整することで、転移学習を適用する。
- 収束速度を向上させるとともにモデルの汎化性能を向上させるために、修正されたワンサイクルポリシーを用いて学習率スケジューリングを最適化する。
- モデルのロバスト性と性能を向上させるために、トレーニング中に入力画像サイズを変化させる。
- モデルは、50 個の基本文字、10 個の数字、24 個の合成文字を含む BanglaLekha-Isolated データセット上でトレーニングされる。
- アーキテクチャとトレーニングパイプラインは、トレーニングエポック数を最小限に抑えつつ、精度を最大化することを目的として設計されている。
実験結果
リサーチクエスチョン
- RQ1ResNet50 を用いた転移学習は、少ないトレーニングエポックで Bengali 手書き文字認識において高い精度を達成できるか?
- RQ2修正されたワンサイクルポリシーは、HCR タスクにおける収束速度とモデル精度にどのような影響を与えるか?
- RQ3入力画像サイズを変化させることで、微調整された ResNet50 モデルの Bengali HCR における性能にどのような効果があるか?
- RQ4提案手法は、アンサンブル学習を用いない状態で BanglaLekha-Isolated データセットにおいて最先端の性能を達成できるか?
主な発見
- 提案手法は、Bengali 手書き文字の 84 クラスを含む BanglaLekha-Isolated データセットで、トップ-1 精度 96.12% を達成した。
- この精度はたった 47 個のトレーニングエポックで達成され、他の最先端手法と比較して顕著にトレーニング時間を短縮した。
- ResNet50 を用いた転移学習と修正されたワンサイクルポリシーの組み合わせにより、精度を損なわずに収束が高速化された。
- 同じベンチマークにおいて、既存の非アンサンブル手法を上回り、Bengali HCR の新しい最先端の結果を確立した。
- トレーニング中に最適化された入力サイズの変更により、基本文字、数字、合成文字を含む多様な文字種に対して、モデルは高いロバスト性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。