[論文レビュー] Offline Text-Independent Writer Identification based on word level data
本論文は、SIFTキーポoinツと事前学習済みCNNを用いて階層的特徴を抽出する、単語レベルの画像を用いたオフラインでテキストに依存しない筆跡識別システムを提案する。エントロピーに基づくフィルタ重み付けとCNN特徴マップへのヒストグラム・オブ・グレディエント(HOG)を適用することで、頑健で固定長の表現が得られ、IAMでは98.17%、CVLでは99.0%のトップ1精度を達成し、先行する単語レベル手法を上回る性能を示した。
This paper proposes a novel scheme to identify the authorship of a document based on handwritten input word images of an individual. Our approach is text-independent and does not place any restrictions on the size of the input word images under consideration. To begin with, we employ the SIFT algorithm to extract multiple key points at various levels of abstraction (comprising allograph, character, or combination of characters). These key points are then passed through a trained CNN network to generate feature maps corresponding to a convolution layer. However, owing to the scale corresponding to the SIFT key points, the size of a generated feature map may differ. As an alleviation to this issue, the histogram of gradients is applied on the feature map to produce a fixed representation. Typically, in a CNN, the number of filters of each convolution block increase depending on the depth of the network. Thus, extracting histogram features for each of the convolution feature map increase the dimension as well as the computational load. To address this aspect, we use an entropy-based method to learn the weights of the feature maps of a particular CNN layer during the training phase of our algorithm. The efficacy of our proposed system has been demonstrated on two publicly available databases namely CVL and IAM. We empirically show that the results obtained are promising when compared with previous works.
研究の動機と目的
- 入力サンプルに特定のテキストコンテンツを必要としない、テキストに依存しない筆跡識別システムの開発を目的とする。
- SIFTキーポイント領域からの可変サイズの特徴マップを、HOGを用いて固定長表現に正規化する手法を提案することで、CNNにおける可変サイズの特徴マップの問題に対処する。
- CNN層における特徴抽出の計算負荷と次元削減を図るため、エントロピーに基づくフィルタの重要度測定を導入する。
- マルチスケールのSIFT特徴とディープ畳み込み表現を組み合わせることで、単語レベルデータにおける筆跡識別精度を向上させる。
提案手法
- SIFTは、単語画像全体にわたって、アログラフ、文字、またはそれらの組み合わせといった、複数の抽象レベルのキーポイント領域を検出するために適応応用される。
- これらのキーポイント領域は、スケールの違いにより可変サイズの畳み込み特徴マップを生成する事前学習済みCNNに供給される。
- 特徴マップのサイズを正規化するために、各特徴マップに対してヒストグラム・オブ・グレディエント(HOG)が計算され、固定長の記述子が得られる。
- スパースPCAをHOG特徴に適用し、エントロピーに基づく重要度測定が導出され、トレーニング中に情報量の多い特徴を優先するフィルタの重み付けが可能になる。
- 最終的な特徴表現は、複数のCNN層からのHOG記述子を、学習済みの重要度スコアで重み付けして統合することで、識別性能を向上させる。
- 最終的な特徴ベクトルは、サポートベクターマシン(SVM)分類器で学習され、ページレベルのデータにおける分類性能は平均分類スコアを用いて評価される。
実験結果
リサーチクエスチョン
- RQ1テキストコンテンツに依存しない筆跡識別システムは、特定のテキストを必要としない単語レベルの画像のみを用いても高い精度を達成できるか?
- RQ2SIFTキーポイント領域から得られる可変サイズのCNN特徴マップを、頑健な分類に適した固定長表現に正規化する方法は何か?
- RQ3エントロピーに基づくフィルタ重み付け戦略は、ディープ特徴抽出における次元削減と計算負荷の低減を図りつつ、識別性能を維持できるか?
- RQ4SIFTによるマルチスケール特徴とCNNおよびHOG表現を組み合わせることで、既存の単語レベル手法と比較して筆跡識別精度が向上するか?
- RQ5複数の単語サンプルを集約するページレベルのデータにおいて、本システムの性能はいかがなっているか?
主な発見
- 提案手法は、IAMデータセットで98.17%のトップ1精度を達成し、先行する最先端の単語レベル手法(WordImagenet: 95.8%、FragNet-64: 96.3%、GR-RNN: 96.4%)を上回った。
- CVLデータセットでは99.0%のトップ1精度を達成し、TangとWu(99.7%)やChristleinら(99.2%)といった最先端手法と同等の性能を示したが、筆者間で同じテキストが使用されているという課題にもかかわらず、その高精度を維持した。
- ページレベルのデータにおける性能は、個々の単語画像よりも高い。これは複数の単語レベル分類スコアを集約することで、分類の堅牢性が向上したためである。
- 筆者同士の筆跡スタイルが似ている場合、誤って同一人物と認識される誤認証が発生する(図6参照)。これは、スタイルの類似性を区別できないという限界を示している。
- エントロピーに基づくフィルタ重み付け戦略は、計算負荷の低減に成功するとともに、各CNN層における情報量の多いフィルタを強調することで、特徴表現の質を向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。