Skip to main content
QUICK REVIEW

[論文レビュー] Chinese Text Recognition with A Pre-Trained CLIP-Like Model Through Image-IDS Aligning

Haiyang Yu, Xiaocong Wang|arXiv (Cornell University)|Sep 3, 2023
Handwritten Text Recognition Techniques被引用数 4
ひとこと要約

本稿では、印刷済みの漢字画像とその表意的記述系列(IDS)を対応付けることで、標準的な文字表現を学習するCLIPに類似したモデル(CCR-CLIP)を事前学習する二段階フレームワークを提案する。これにより、微調整なしにゼロショット認識が可能となり、中国語文字認識およびテキスト認識ベンチマークの両方で最先端の性能を達成する。特にゼロショットおよびフェイントショット設定で優れた性能を発揮する。

ABSTRACT

Scene text recognition has been studied for decades due to its broad applications. However, despite Chinese characters possessing different characteristics from Latin characters, such as complex inner structures and large categories, few methods have been proposed for Chinese Text Recognition (CTR). Particularly, the characteristic of large categories poses challenges in dealing with zero-shot and few-shot Chinese characters. In this paper, inspired by the way humans recognize Chinese texts, we propose a two-stage framework for CTR. Firstly, we pre-train a CLIP-like model through aligning printed character images and Ideographic Description Sequences (IDS). This pre-training stage simulates humans recognizing Chinese characters and obtains the canonical representation of each character. Subsequently, the learned representations are employed to supervise the CTR model, such that traditional single-character recognition can be improved to text-line recognition through image-IDS matching. To evaluate the effectiveness of the proposed method, we conduct extensive experiments on both Chinese character recognition (CCR) and CTR. The experimental results demonstrate that the proposed method performs best in CCR and outperforms previous methods in most scenarios of the CTR benchmark. It is worth noting that the proposed method can recognize zero-shot Chinese characters in text images without fine-tuning, whereas previous methods require fine-tuning when new classes appear. The code is available at https://github.com/FudanVI/FudanOCR/tree/main/image-ids-CTR.

研究の動機と目的

  • ラテン文字認識の進展にもかかわらず、依然として未開拓とされるゼロショットおよびフェイントショット中国語文字認識の課題に対処すること。
  • 部品に分解した構造的特徴(画素)を用いて、人間の認識に類似した標準的な中国語文字表現を学習すること。
  • 事前学習済みの標準的表現を活用して、エンドツーエンドのテキスト認識性能を向上させる二段階フレームワークを開発すること。
  • モデルの微調整を必要とせず、未学習の中国語文字をテキスト画像で認識可能にする。これは従来手法の限界である。

提案手法

  • 対照的損失を用いて、印刷済み中国語文字の画像埋め込みと、それに対応する表意的記述系列(IDS)のテキスト埋め込みを対応付けることで、CLIPに類似したモデル(CCR-CLIP)を事前学習する。
  • 同じ文字の異なるフォントスタイルの画像間で追加の対照的損失を導入し、ドメイン一般化を向上させ、フォントバイアスを低減する。
  • 事前学習済みのテキストエンコーダーを用いて、部品の系列の標準的表現を生成し、CTR段階での監視として使用する。
  • CTR段階で、抽出された文字埋め込みと学習済みの標準的表現との類似度を計算する画像-IDSマッチングヘッドを採用する。
  • 特徴の識別性と一般化性能を向上させるために、対照的損失($\mathcal{L}_{ctr}$)にマッチングヘッドと正則化項を適用する。
  • 垂直方向のテキスト画像を反時計回りに90°回転させる前処理ステップを導入し、特徴空間における方向関連の混乱を軽減する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのCLIPに類似したモデルが、画像-IDS対応付けを通じて中国語文字の標準的表現を効果的に学習できるか?
  • RQ2学習済みの標準的表現が、微調整なしに未学習の中国語文字をテキスト画像でゼロショット認識可能か?
  • RQ3提案された二段階フレームワークは、中国語文字認識およびテキスト認識ベンチマークにおいて、従来手法と比較してどの程度の性能を発揮するか?
  • RQ4分解レベル(部品、筆画)の違いが、CCR-CLIPモデルの性能に与える影響は何か?
  • RQ5少データ環境(フェイントショットや限られた学習データ)下での手法のロバスト性はいかがなっているか?

主な発見

  • CCR-CLIPモデルは中国語文字認識ベンチマークで最先端の性能を達成し、以前の手法と明確な差を示している。
  • CTRベンチマークにおいて、提案手法はほとんどの状況で従来の最先端手法を上回っており、特にゼロショットおよびフェイントショット設定で優れた性能を発揮する。
  • 提案されたマッチングヘッドを用いることで、ウェブデータセットで3.14%、手書きデータセットで5.54%の性能向上を達成した。
  • 四つのデータセット全体で、$\mathcal{L}_{ctr}$の正則化項が平均性能を1.12%向上させた。
  • 少データ環境下でも強いロバスト性を維持し、シーンおよびドキュメントデータセットで学習データを減らした場合、TransOCRを明確に上回った。
  • t-SNEを用いた可視化により、損失$\mathcal{L}_{I}$が特徴クラスタリングを改善し、特に手書きおよびノイズの多いサンプルで誤分類を低減していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。