Skip to main content
QUICK REVIEW

[论文解读] Revisiting Classification Perspective on Scene Text Recognition

Hongxiang Cai, Jun Sun|arXiv (Cornell University)|Feb 22, 2021
Handwritten Text Recognition Techniques参考文献 46被引用 5
一句话总结

本文通過提出CSTR,重新審視了場景文字識別的分類視角。CSTR是一種簡單而有效的模型,將文字識別視為一項基於詞級註釋的圖像分類任務。CSTR採用一種新型主幹網絡(CPNet)和預測頭(SPPN),在六個基準測試中實現了接近最前沿的性能,超越了序列到序列(seq2seq)和基於分割的方法,同時保持了與ResNet相當的簡潔性。

ABSTRACT

The prevalent perspectives of scene text recognition are from sequence to sequence (seq2seq) and segmentation. Nevertheless, the former is composed of many components which makes implementation and deployment complicated, while the latter requires character level annotations that is expensive. In this paper, we revisit classification perspective that models scene text recognition as an image classification problem. Classification perspective has a simple pipeline and only needs word level annotations. We revive classification perspective by devising a scene text recognition model named as CSTR, which performs as well as methods from other perspectives. The CSTR model consists of CPNet (classification perspective network) and SPPN (separated conv with global average pooling prediction network). CSTR is as simple as image classification model like ResNet \cite{he2016deep} which makes it easy to implement and deploy. We demonstrate the effectiveness of the classification perspective on scene text recognition with extensive experiments. Futhermore, CSTR achieves nearly state-of-the-art performance on six public benchmarks including regular text, irregular text. The code will be available at https://github.com/Media-Smart/vedastr.

研究动机与目标

  • 重新喚起場景文字識別中被忽視的分類方法視角,因為以往研究的表現不佳。
  • 設計一種模型,其性能可與複雜的seq2seq和基於分割的方法比肩,但僅使用詞級註釋。
  • 通過消除字元級註釋和複雜解碼器架構的需求,簡化場景文字識別的流程。
  • 證明通過合理設計預測網絡和主幹網絡,分類方法可與最前沿方法競爭。
  • 強調數據增強與空間變換在提升分類方法場景文字識別模型性能中的重要性。

提出的方法

  • 提出CSTR,一種完全卷積的模型,將場景文字識別視為具有固定長度輸出頭的多頭圖像分類問題,每個字元位置對應一個輸出頭。
  • 引入CPNet,一種重新設計的主幹網絡,具有增強的感受野和語義感知下採樣模塊(SADM),以改善特徵表示。
  • 設計SPPN(分離卷積與全局平均池化預測網絡),利用全局平均池化和每個字元位置的獨立卷積來編碼位置上下文。
  • 使用交叉熵損失而非CTC損失,表明合理的預測網絡設計可使交叉熵損失優於CTC損失。
  • 應用數據增強與空間變換網絡(STN),進一步提升模型的魯棒性與準確率。
  • 使用固定的最大序列長度並加入結束標記,以處理可變長度詞語,從而實現使用標準分類目標的端到端訓練。

实验结果

研究问题

  • RQ1分類方法能否在場景文字識別中實現與最前沿的seq2seq和基於分割方法相當的性能?
  • RQ2是否良好的預測頭與主幹網絡設計可使交叉熵損失在分類視角下優於CTC損失?
  • RQ3數據增強對分類方法場景文字識別模型的性能有何影響?
  • RQ4空間變換網絡是否能進一步提升簡單分類方法模型的準確率?
  • RQ5主幹網絡中如SADM模塊與增強感受野等架構組件對整體性能的貢獻為何?

主要发现

  • CSTR在六個公開基準測試中實現了接近最前沿的性能,包括ICDAR03、ICDAR13、ICDAR15、IIIT5k、SVT和SVTP。
  • 在數據增強下,CSTR在基準測試套件上的平均準確率達到89.0%,當與空間變換網絡結合時進一步提升至89.4%。
  • SPPN使交叉熵損失優於CTC損失,在相同主幹網絡下分別達到84.1%與83.8%的準確率。
  • 消融實驗確認,增強模塊(EM)使準確率提升3.1個百分點(從84.1%提升至87.2%),而SADM額外貢獻0.1個百分點的提升。
  • 數據增強使性能下降減少1.7個百分點,表明其在訓練分類方法場景文字識別模型中具有至關重要的作用。
  • 該模型的簡潔性(與ResNet相當)使其易於實現、訓練與部署,遠勝於複雜的seq2seq流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。