[論文レビュー] Hamming OCR: A Locality Sensitive Hashing Neural Network for Scene Text Recognition
Hamming OCR は、従来のソフトマックスおよび埋め込み層の代わりに局所性に敏感なハッシュ化(LSH)に基づくハミング分類器とハミング埋め込みを採用する軽量なシーンテキスト認識モデルを提案する。これにより、語彙サイズに依存せずにモデルサイズを削減できる。LSHコードを分類および表現に使用することで、標準ベンチマークおよび大規模な中国語データセット(GBK21K)において競争力のある精度を達成し、分類器のサイズはわずか1.22 MBにまで削減され、標準的なソフトマックスの32倍小さくなる。
Recently, inspired by Transformer, self-attention-based scene text recognition approaches have achieved outstanding performance. However, we find that the size of model expands rapidly with the lexicon increasing. Specifically, the number of parameters for softmax classification layer and output embedding layer are proportional to the vocabulary size. It hinders the development of a lightweight text recognition model especially applied for Chinese and multiple languages. Thus, we propose a lightweight scene text recognition model named Hamming OCR. In this model, a novel Hamming classifier, which adopts locality sensitive hashing (LSH) algorithm to encode each character, is proposed to replace the softmax regression and the generated LSH code is directly employed to replace the output embedding. We also present a simplified transformer decoder to reduce the number of parameters by removing the feed-forward network and using cross-layer parameter sharing technique. Compared with traditional methods, the number of parameters in both classification and embedding layers is independent on the size of vocabulary, which significantly reduces the storage requirement without loss of accuracy. Experimental results on several datasets, including four public benchmaks and a Chinese text dataset synthesized by SynthText with more than 20,000 characters, shows that Hamming OCR achieves competitive results.
研究の動機と目的
- 大規模な語彙(中国語やマルチリンガルテキストなど)を対象としたシーンテキスト認識モデルにおけるソフトマックスおよび埋め込み層の高コストなストレージ問題に対処すること。
- 大規模な語彙辞書環境下でも認識精度を損なわずに、モデルパラメータおよびストレージ要件を削減すること。
- フィードフォワードネットワークを削除し、クロスレイヤーのパrameter共有を適用することで、軽量なトランスフォーマー・デコーダーを設計すること。
- LSHコードを分類器の出力および文字埋め込みとして使用することの可能性を検討し、効率的でスケーラブルなテキスト認識を実現すること。
提案手法
- 局所性に敏感なハッシュ化(LSH)を用いて、各文字をハミング空間内のバイナリコードにマッピングするハミング分類器を提案し、従来のソフトマックス層の代わりに使用する。
- 線形射影としきい値処理により LSH コードを生成し、コード表現の安定化のためのメジャリティ投票機構を採用する。
- LSH コードを直接出力埋め込みとして使用することで、別個の埋め込み行列の必要性を排除し、パラメータを削減する。
- フィードフォワードネットワークを削除し、クロスレイヤーのパrameter共有を適用することで、パラメータ削減を図った簡素化されたトランスフォーマー・デコーダーを導入する。
- モバイルデバイスへの効率的なデプロイを目的として、MobileNetV2 を特徴エンコーダーとして採用する。
- LSH 射影行列の最適化を図るため、ヒンジ損失を用いてモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1LSHに基づくハミングコードは、従来のソフトマックスおよび埋め込み層を効果的に置き換えられ、精度を維持できるか?
- RQ2中国語テキスト認識のような大語彙設定において、LSHコードの性能はランダムなバイナリコードと比べてどうか?
- RQ3シーンテキスト認識において、モデルのパフォーマンスとサイズのバランスを最適化するためのLSHコードの最適長さは何か?
- RQ4密行列に代えてLSHコードを用いることで、分類器および埋め込み層におけるパラメータ削減はどの程度達成できるか?
- RQ5パrameter共有を適用し、フィードフォワードネットワークを削除した簡素化されたトランスフォーマー・デコーダーは、認識精度を維持するためにどの程度有効か?
主な発見
- Hamming OCR モデルは、20,000文字を超える GBK21K データセットで 82.41% の精度を達成し、ランダムバイナリコードよりも顕著に優れている。ランダムバイナリコードは収束に失敗した。
- LSHに基づく分類器は、わずか 1.22 MB のストレージで済み、512次元の特徴空間と20,000クラスの語彙を備えた標準的なソフトマックス層(39.1 MB)と比べて、32倍の削減が達成された。
- 512ビットのLSHコードを用いたモデルが、GBK21Kで最高のパフォーマンス(82.39%の精度)を達成し、512ビットを超えると性能が飽和することが分かった。
- ランダムバイナリコードは SVT では 84.54% の精度を達成したが、GBK21Kでは完全に失敗した。これは、大語彙環境下では構造的なLSHコードの必要性を示している。
- クロスレイヤーのパラメータ共有とフィードフォワードネットワークの削除を施した簡素化されたトランスフォーマー・デコーダーは、パラメータ削減を実現しながらも、競争力あるパフォーマンスを維持した。
- Hamming OCR モデルは、4つの公開ベンチマークおよび大規模な中国語データセットで最先端の結果を達成し、大語彙テキスト認識における有効性と効率性を実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。