Skip to main content
QUICK REVIEW

[論文レビュー] Trajectory-based Radical Analysis Network for Online Handwritten Chinese Character Recognition

Jianshu Zhang, Yixing Zhu|arXiv (Cornell University)|Jan 22, 2018
Handwritten Text Recognition Techniques参考文献 26被引用数 6
ひとこと要約

本稿では、オンライン手書き中華文字認識のための軌跡ベースのレアラル分析ネットワーク(TRAN)を提案する。このネットワークは、注意メカニズムを備えた再帰的ニューラルネットワークを活用し、レアラルおよびその空間的構造を特定することで、未学習の文字の認識を可能にする。TRANは、学習済みのレアラルから学習することで、未学習の500文字クラスにおいて60.37%の文字認識精度を達成し、CASIA-OLHWDBで最先端の全体文字モデリング手法と比較して10%の相対的CER低減を達成した。

ABSTRACT

Recently, great progress has been made for online handwritten Chinese character recognition due to the emergence of deep learning techniques. However, previous research mostly treated each Chinese character as one class without explicitly considering its inherent structure, namely the radical components with complicated geometry. In this study, we propose a novel trajectory-based radical analysis network (TRAN) to firstly identify radicals and analyze two-dimensional structures among radicals simultaneously, then recognize Chinese characters by generating captions of them based on the analysis of their internal radicals. The proposed TRAN employs recurrent neural networks (RNNs) as both an encoder and a decoder. The RNN encoder makes full use of online information by directly transforming handwriting trajectory into high-level features. The RNN decoder aims at generating the caption by detecting radicals and spatial structures through an attention model. The manner of treating a Chinese character as a two-dimensional composition of radicals can reduce the size of vocabulary and enable TRAN to possess the capability of recognizing unseen Chinese character classes, only if the corresponding radicals have been seen. Evaluated on CASIA-OLHWDB database, the proposed approach significantly outperforms the state-of-the-art whole-character modeling approach with a relative character error rate (CER) reduction of 10%. Meanwhile, for the case of recognition of 500 unseen Chinese characters, TRAN can achieve a character accuracy of about 60% while the traditional whole-character method has no capability to handle them.

研究の動機と目的

  • 未学習の中華文字のオンライン手書き認識の課題を、構造的コンポーネントを活用することで解決すること。
  • レアラルおよびその空間的関係を組み合わせた構造として中華文字をモデル化することで、認識性能を向上させること。
  • レアラルレベルでの学習を通じて、未学習の文字のゼロショット認識を可能にし、語彙サイズと冗長性を低減すること。
  • 注意に基づくRNNを用いて、レアラル検出と構造的分析を同時に学習可能なエンドツーエンドで訓練可能なモデルを開発すること。
  • 画像ベースの手法で失われる動的筆跡情報を損なわずに、直接的に順序付き軌跡データを処理すること。

提案手法

  • モデルは、生のオンライン手書き軌跡(x, y座標)を高レベル特徴に変換するための双方向RNNエンコーダを使用する。
  • 一方向RNNデコーダは、カバレージベースの注意メカニズムを用いて関連する軌跡セグメントに注目しながら、1文字ずつ文字キャプションを生成する。
  • 注意メカニズムは、特定の軌跡領域に注目することで、レアラルコンポーネントおよび空間的構造(例:上部下部、左側右側)を動的にアライメントする。
  • レアラルおよび空間的関係は、波括弧{}を用いて2次元的配置を表す構造的キャプションとして表現される。
  • ネットワークは、正しい文字キャプションを予測するように同時に最適化され、エンドツーエンドの学習が可能になる。
  • モデルは、文字分解から得られるレアラルレベルの監視情報を用いてCASIA-OLHWDBデータセットで訓練される。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドのディープラーニングモデルは、レアラル構成および空間的構造を分析することで、オンライン手書き中華文字を効果的に認識できるか?
  • RQ2その構成レアラルが学習中に見られた場合、モデルは未学習の中華文字クラスに一般化できるか?
  • RQ3注意に基づく系列モデリングは、オンライン手書きデータにおいて全体文字モデリングと比較して認識性能を向上させるか?
  • RQ4注意メカニズムは人間の直感的レアラルセグメンテーションおよび構造的分析とどれほど整合性があるか?
  • RQ5軌跡シーケンスの直接処理は、認識精度およびゼロショット一般化の観点で、画像ベースの表現を上回るか?

主な発見

  • TRANは、CASIA-OLHWDBデータセットにおいて、最先端の全体文字モデリング手法と比較して10%の相対的CER低減を達成した。
  • 3,255文字クラスで学習した場合、TRANは未学習の中華文字500クラスで60.37%の文字認識精度を達成し、効果的なゼロショット一般化を示した。
  • 訓練データセットが大きくなるほど未学習文字の認識性能が向上し、2,755個の訓練クラスで50.45%の精度に達した。
  • 注意の可視化により、モデルが人間の直感と整合しており、正しくレアラル境界や上部下部、左側右側などの空間的構造を特定していることが確認された。
  • 従来の全体文字手法は未学習文字に対して0%の認識精度を示すが、本モデルはそれらを上回る性能を示した。
  • RNNによる軌跡シーケンスの直接符号化は、動的筆跡情報を保持しており、静的画像ベースの手法よりも優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。