Skip to main content
QUICK REVIEW

[論文レビュー] Supervised mid-level features for word image representation

Albert Gordo|arXiv (Cornell University)|Oct 20, 2014
Handwritten Text Recognition Techniques参考文献 28被引用数 11
ひとこと要約

本論文では、トレーニング時に文字バウンディングボックスアノテーションを活用することで、文字に関連する局所的特徴を学習し、コン act でロバストな単語画像表現を実現する教師ありの中位レベル特徴を提案する。従来の手法とは異なり、テスト時に明示的な文字領域の局所化を必要とせず、わずか約5,000語のアノテート済みトレーニングデータと96次元のシグネチャを用いて、単語検索および認識タスクで最先端の性能を達成している。

ABSTRACT

This paper addresses the problem of learning word image representations: given the cropped image of a word, we are interested in finding a descriptive, robust, and compact fixed-length representation. Machine learning techniques can then be supplied with these representations to produce models useful for word retrieval or recognition tasks. Although many works have focused on the machine learning aspect once a global representation has been produced, little work has been devoted to the construction of those base image representations: most works use standard coding and aggregation techniques directly on top of standard computer vision features such as SIFT or HOG. We propose to learn local mid-level features suitable for building word image representations. These features are learnt by leveraging character bounding box annotations on a small set of training images. However, contrary to other approaches that use character bounding box information, our approach does not rely on detecting the individual characters explicitly at testing time. Our local mid-level features can then be aggregated to produce a global word image signature. When pairing these features with the recent word attributes framework of Almazán et al., we obtain results comparable with or better than the state-of-the-art on matching and recognition tasks using global descriptors of only 96 dimensions.

研究の動機と目的

  • コンパクトで固定長のグローバル表現を単語画像に対して開発し、それがロバストで記述的であること。
  • トレーニング時に限られた文字レベルのアノテーションを用いて中位レベル特徴を学習することで、単語画像表現を向上させること。
  • アノテート済みの文字データの恩恵を維持しつつ、テスト時に明示的な文字領域の局所化を不要にする。
  • 最小限のトレーニングデータと低次元のシグネチャを用いて、単語検索および認識タスクで最先端の結果を達成すること。

提案手法

  • 少量の文字アノテート済みトレーニング画像を用いて、局所的SIFT特徴を文字領域に関連する空間に射影することで中位レベル特徴を学習する。
  • Fisher Vector (FV) で符号化された局所的特徴を中位レベル記述子にマップするための線形射影行列 U をCCAを用いて導出する。
  • 重複のない固定サイズのブロック(p×pピクセル)を用いたグリッド表現を構築し、空間ピラミッドやℓ₂正規化を用いずに各ブロックのFVを計算する。
  • 積分画像表現を適用することで、画像内の任意のブロックに対して効率的な中位レベル記述子の計算を可能にする。
  • 積分表現上で複数の空間的領域からの中位レベル記述子を和集合で集約し、その後にℓ₂正規化を適用する。
  • 2×2の領域を有する空間ピラミッドを用い、FVを再形状化した射影行列 U^ を通して空間レベル間での加法的集約を可能にする。

実験結果

リサーチクエスチョン

  • RQ1文字レベルのアノテーションから学習した中位レベル特徴は、テスト時に文字領域の局所化を必要とせずに、グローバルな単語画像表現を向上させることができるか?
  • RQ2トレーニング時に限られた文字バウンディングボックスアノテーションを活用することで、コンパクトな単語画像シグネチャの性能にどのような影響を与えるか?
  • RQ3中位レベル特徴は、直接的なSIFTベースの表現よりも単語画像検索および認識タスクで優れた性能を示せるか?
  • RQ4たとえば5,000未満のアノテート済みトレーニング単語を用いた場合、数百万のアノテート済み単語でトレーニングされた最先端の手法と同等の性能を達成できるか、その程度はどの程度か?

主な発見

  • 提案手法は、96次元のグローバルシグネチャのみを用いても、類似次元の手法と比較して単語画像検索タスクで最先端の性能を達成している。
  • [4]の単語属性フレームワークと組み合わせた場合、直接的なSIFTベースの表現よりも顕著に性能が向上しており、中位レベル特徴学習の利点が明確に示された。
  • わずか約5,000語の文字アノテート済みトレーニングデータを用いても、数百万のアノテート済み単語に依存するGoogleのPhotoOCRと同等の認識性能を達成している。
  • 積分表現と加法的集約のおかげで、1コアで1秒未塔に画像内のすべてのブロックの特徴抽出と記述が可能となり、効率的な記述子計算が実現された。
  • 線形射影と射影後のℓ₂正規化を組み合わせたFisher Vector符号化は、加法性の性質を保持しており、ブロック単位の記述子計算を効率的に行える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。