Skip to main content
QUICK REVIEW

[論文レビュー] Open Set Chinese Character Recognition using Multi-typed Attributes

Sheng He, Lambert Schomaker|arXiv (Cornell University)|Aug 27, 2018
Handwritten Text Recognition Techniques参考文献 31被引用数 7
ひとこと要約

本稿では、ピンイン、画数、部首、入力法コード(倉頡、正倉、五筆など)といった複数種類の属性を用いて、ゼロショットおよびフェイワショット学習を可能にする、新しいオープンセット中国漢字認識手法を提案する。畳み込みニューラルネットワーク(CNN)を用いてこれらの属性を予測し、属性空間における距離マッピングにより認識を実行することで、歴史的および印刷済み漢字データセットにおいて未学習の文字に対しても優れた一般化性能を達成した。

ABSTRACT

Recognition of Off-line Chinese characters is still a challenging problem, especially in historical documents, not only in the number of classes extremely large in comparison to contemporary image retrieval methods, but also new unseen classes can be expected under open learning conditions (even for CNN). Chinese character recognition with zero or a few training samples is a difficult problem and has not been studied yet. In this paper, we propose a new Chinese character recognition method by multi-type attributes, which are based on pronunciation, structure and radicals of Chinese characters, applied to character recognition in historical books. This intermediate attribute code has a strong advantage over the common `one-hot' class representation because it allows for understanding complex and unseen patterns symbolically using attributes. First, each character is represented by four groups of attribute types to cover a wide range of character possibilities: Pinyin label, layout structure, number of strokes, three different input methods such as Cangjie, Zhengma and Wubi, as well as a four-corner encoding method. A convolutional neural network (CNN) is trained to learn these attributes. Subsequently, characters can be easily recognized by these attributes using a distance metric and a complete lexicon that is encoded in attribute space. We evaluate the proposed method on two open data sets: printed Chinese character recognition for zero-shot learning, historical characters for few-shot learning and a closed set: handwritten Chinese characters. Experimental results show a good general classification of seen classes but also a very promising generalization ability to unseen characters.

研究の動機と目的

  • 50,000を超える可能性のある文字数を有する歴史的中国漢字認識におけるオープンセット認識の課題に対処すること。
  • 大規模かつバランスの取れた訓練データセットを必要とし、レアまたは未学習の文字に一般化できない従来のクローズドセット認識モデルの限界を克服すること。
  • 共通の記号的属性(例:部首、発音、構造)を活用して、文字間で知識を転送し、学習データを超えた一般化を向上させること。
  • 文字をコン act で解釈可能な属性空間に符号化することで、リソースが限られた状況(フェイワショットやゼロショット学習)においても効果的な認識を可能とすること。

提案手法

  • 中国漢字を4つの属性グループで表現する:ピンイン(発音)、画数、配置構造、入力法コード(倉頡、正倉、五筆、四隅コード)。
  • 文字画像からこれらの多様な属性を予測する畳み込みニューラルネットワーク(CNN)を訓練し、属性表現のエンドツーエンド学習を可能にする。
  • 学習済み属性空間における距離マッピング(例:コサイン距離またはユークリッド距離)を用いて、テスト文字を属性空間にエンコードされた完全な語彙内から最も近い既知の文字にマッチングする。
  • 歪み補正を実行するため、5つの回転角度で背景線幅を評価し、歴史的文書画像における微小な歪み角度を推定・補正する。
  • マルチステップの文字分離パイプラインを実装する:(1) 連結成分を用いた候補ボックスの検出、(2) 幅高比(0.8以上)に基づくフィルタリング、(3) 平均文字高さを事前知識として使用、(4) 大きなボックスの分割、(5) 隣接するボックスの統合、(6) 行単位でボックスを整列させ、高さと幅を一貫性を持たせる。
  • 白画素の走査長分布を用いてテキスト行を検出することで、標準的な投影法に比べ、ノイズや表線に対してより頑健な検出を実現する。

実験結果

リサーチクエスチョン

  • RQ1部首、発音、構造などの複数種類の属性が、未学習の文字に対しても一般化を可能にする形で中国漢字を効果的に表現できるか?
  • RQ2CNNベースの属性予測モデルが、オープンセット認識の文脈において、希少または未学習の文字に対してもどの程度一般化できるか?
  • RQ3属性ベースの認識が、歴史的中国漢字のゼロショットおよびフェイワショット設定において、従来のワンホット符号化分類法をどの程度上回るか?
  • RQ4提案された分離および前処理パイプラインが、ノイズが多く歪みのある歴史的文書画像から、信頼性高く個々の文字を抽出できるか?

主な発見

  • 提案手法は、ゼロショットおよびフェイワショット学習の文脈において、未学習の文字に対しても優れた一般化性能を示し、学習分布を超えた頑健性を確認した。
  • 印刷済み中国漢字(ゼロショット)および歴史的漢字(フェイワショット)における認識性能は、従来のクローズドセットモデルに比べ顕著に向上した。
  • 多様な属性の使用により、ワンホット符号化に比べて有効な分類空間が縮小され、50,000種類を超える可能性のある文字数に対してもスケーラブルな認識が可能になった。
  • CNNベースの属性予測モデルは、文字間の構造的および音声的類似性を捉える、転送可能な表現を効果的に学習した。
  • 文字分離パイプラインは、接触している文字や文字内ノイズに対しても効果的に対処し、正確で一貫性のある文字バウンディングボックスを生成した。
  • 背景線幅の最大化による歪み補正は、Hough変換に依存せず、微小な歪み角度を信頼性高く補正でき、下流の認識精度を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。