[論文レビュー] BanglaWriting: A multi-purpose offline Bangla handwriting dataset
本論文では、260人の個々の人物の1ページ分の筆跡を含み、単語レベルのバウンディングボックスとUnicodeラベルを備えた、高品質で手動アノテーションが施されたオフライン・バングラ文字の手書きデータセットBanglaWritingを紹介する。このデータセットには21,234語、32,787文字、5,470の固有語彙が含まれており、重ね書きやストライクスルーなどの現実的な変異を含むため、OCR、筆跡識別、および筆跡生成の高度な応用が可能になる。
This article presents a Bangla handwriting dataset named BanglaWriting that contains single-page handwritings of 260 individuals of different personalities and ages. Each page includes bounding-boxes that bounds each word, along with the unicode representation of the writing. This dataset contains 21,234 words and 32,787 characters in total. Moreover, this dataset includes 5,470 unique words of Bangla vocabulary. Apart from the usual words, the dataset comprises 261 comprehensible overwriting and 450 handwritten strikes and mistakes. All of the bounding-boxes and word labels are manually-generated. The dataset can be used for complex optical character/word recognition, writer identification, handwritten word segmentation, and word generation. Furthermore, this dataset is suitable for extracting age-based and gender-based variation of handwriting.
研究の動機と目的
- 多様な機械学習応用を支援する包括的で手動アノテーションが施されたオフライン・バングラ手書きデータセットの構築。
- モデルの耐性強化のため、重ね書き、ストライクスルー、誤字などの現実的な筆跡の変異を含めること。
- 実世界の筆跡サンプルを用いた筆跡識別、文字認識、および筆跡セグメンテーションに関する研究を可能にする。
- 人種的・文化的に多様なデータセットを通じて、年齢および性別に基づく筆跡の変異を調査すること。
- 深層学習フレームワークとの互換性を確保するため、生データおよび事前処理済み画像データに加え、標準化されたJSON形式のアノテーションを提供すること。
提案手法
- A4用紙と一般的なボールペンを用いて、バングラデシュの8つの県にまたがる260人の被験者から手書きのページを収集した。
- スキャナー(HP Scanjet 2400)およびスマートフォンカメラ(Xiaomi Redmi 6/7)を用いて画像を撮影し、現実の撮影環境を反映させた。
- Labelmeソフトウェアを用いて、各画像を手動でクロップおよびアノテーションし、単語レベルのバウンディングボックスとUnicodeテキストラベルを生成した。
- 機械学習統合のため、'label'、'points'、'imagePath'、'imageHeight'、'imageWidth'のフィールドを含むJSON形式でアノテーションを保存した。
- 生画像の照度のばらつきや背景ノイズを低減するために、補足的なPythonおよびOpenCVスクリプトを開発した。
- 多様な実験的ニーズに対応するため、データセットを'raw.zip'(処理未実施画像)と'converted.zip'(事前処理済み画像)に分割した。
実験結果
リサーチクエスチョン
- RQ1手動アノテーションが施されたマルチ目的のバングラ手書きデータセットは、オフラインOCRおよび筆跡識別システムの性能をどのように向上させ得るか?
- RQ2重ね書きやストライクスルーなどの現実的な筆跡のアーティファクトは、筆跡認識モデルの耐性にどの程度影響を及えるか?
- RQ3年齢や性別といった人口統計的要因は、バングラ文脈において筆跡特徴から信頼性を持って推定可能か?
- RQ4スキャンされた画像とスマートフォンで撮影された画像の間で、撮影条件の違いが筆跡データセットの品質と利用可能性にどのように影響するか?
- RQ5このデータセットを用いて、バングラ文字のための生成的筆跡モデルを訓練することは可能か?
主な発見
- データセットには260件の固有の筆跡サンプルが含まれており、21,234語、32,787文字、5,470の固有語彙が含まれている。
- 重ね書きのインスタンスが261件、手書きのストライクスルーまたは誤字が450件含まれており、モデルの耐性テストに現実的で高品質な環境を提供している。
- すべてのバウンディングボックスとラベルが手動で生成されたため、同種のデータセットにおける自動ラベリングと比較して、高いアノテーション品質を確保している。
- 被験者は年齢(8〜80歳)および性別にわたり多様であるため、人口統計的要因に基づく筆跡分析が可能である。
- スキャン画像が52枚、スマートフォンで撮影された画像が208枚含まれており、現実世界の撮影変動を反映している。
- スマートフォンで撮影された画像の照度およびノイズ効果を低減する補足的な事前処理スクリプトが成功裏に開発され、深層学習におけるデータの利用可能性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。