[論文レビュー] ABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve Network
ABCNetは、適応的ベジェ曲線を用いて任意の形状のテキストを表現するリアルタイムのエンドツーエンドフレームワークを導入し、BezierAlignによる正確な特徴サンプリングを用いて、Total-TextとCTW1500でリアルタイム速度とともに最先端の精度を達成します。
Scene text detection and recognition has received increasing research attention. Existing methods can be roughly categorized into two groups: character-based and segmentation-based. These methods either are costly for character annotation or need to maintain a complex pipeline, which is often not suitable for real-time applications. Here we address the problem by proposing the Adaptive Bezier-Curve Network (ABCNet). Our contributions are three-fold: 1) For the first time, we adaptively fit arbitrarily-shaped text by a parameterized Bezier curve. 2) We design a novel BezierAlign layer for extracting accurate convolution features of a text instance with arbitrary shapes, significantly improving the precision compared with previous methods. 3) Compared with standard bounding box detection, our Bezier curve detection introduces negligible computation overhead, resulting in superiority of our method in both efficiency and accuracy. Experiments on arbitrarily-shaped benchmark datasets, namely Total-Text and CTW1500, demonstrate that ABCNet achieves state-of-the-art accuracy, meanwhile significantly improving the speed. In particular, on Total-Text, our realtime version is over 10 times faster than recent state-of-the-art methods with a competitive recognition accuracy. Code is available at https://tinyurl.com/AdelaiDet
研究の動機と目的
- 任意の形状をしたシーンテキストのエンドツーエンド検出を効率的に促進する。
- 最小限のオーバーヘッドで曲線テキストに適合するコンパクトなBezier曲線表現を提案する。
- 正確な特徴サンプリングのためのBezierAlignを導入し、軽量な認識ブランチを可能にする。
- Total-TextとCTW1500で競争力のあるまたは優れた精度を実現するリアルタイム性能を示す。
- 不規則な文字形状の訓練を補強するためのBezier曲線合成データセットを提供する。
提案手法
- 8つの制御点回帰を用いて三次ベジェ曲線で曲がりくねるシーンテキストを表現する。
- 多角形アノテーションから最小二乗法フィッティングを用いてBezier曲線のグラウンドトゥルースを生成する。
- Bezier曲線境界に沿って特徴を整列させる非長方形サンプリングレイヤーBezierAlignを導入し、堅牢な認識を実現する。
- BezierAlign特徴を介して接続されたCNN + BiLSTMからなる軽量な認識ブランチを用い、CTC損失を適用する。
- 合成データと実データのエンドツーエンド訓練を実施し、Bezier曲線のグラウンドトゥルースがエンドツーエンドのRoI特徴抽出を導く。
実験結果
リサーチクエスチョン
- RQ1三次ベジェ曲線は、単段検出器で向きを持つ/曲がったシーンテキストを正確に表現できるのか?
- RQ2BezierAlignは、重大な計算オーバーヘッドを追加せずに任意の形状のテキストのエンドツーエンド認識精度を向上させるか?
- RQ3BezierAlignのサンプリング点密度とエンドツーエンドの性能・速度のトレードオフはどうなるか?
- RQ4Total-TextおよびCTW1500におけるエンドツーエンド検出で、従来手法と比較してABCNetはどのように性能を示すか?
主な発見
- ABCNetはTotal-TextとCTW1500で最先端のエンドツーエンドテキスト検出を実現しつつリアルタイム推論をサポートする。
- BezierAlignは、水平方向または四辺形サンプリングに比べ認識性能を大幅に向上させ、オーバーヘッドはほとんど追加オーバーヘッドを生じさせない。
- ベジェ曲線検出は標準の境界ボックス検出と比較してほとんど追加の計算を要さない。
- Total-Textでは、リアルタイムのシングルスケール版が最近のSOTA手法より10倍以上高速で、競争力のある精度を達成。
- ABCNetのバリアント(F, MS)は、BezierAlignを用いて顕著なエンドツーエンドの利得をもたらす、速度と精度のトレードオフが有利になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。