[論文レビュー] Few Could Be Better Than All: Feature Sampling and Grouping for Scene Text Detection
本論文は、マルチスケール特徴マップから代表的な特徴をわずかに選択する、トランスフォーマーに基づくシーンテキスト検出フレームワークを提案する。これにより、背景ノイズと計算コストが顕著に低減される。サンプリングされた特徴をトランスフォーマーでグループ化することで、NMSなどの後処理を必要とせず、複数のベンチマークで最先端の性能を達成し、極端なスケールおよびアスペクト比の変動が激しいデータセットにおいて、優れた精度と効率性を示している。
Recently, transformer-based methods have achieved promising progresses in object detection, as they can eliminate the post-processes like NMS and enrich the deep representations. However, these methods cannot well cope with scene text due to its extreme variance of scales and aspect ratios. In this paper, we present a simple yet effective transformer-based architecture for scene text detection. Different from previous approaches that learn robust deep representations of scene text in a holistic manner, our method performs scene text detection based on a few representative features, which avoids the disturbance by background and reduces the computational cost. Specifically, we first select a few representative features at all scales that are highly relevant to foreground text. Then, we adopt a transformer for modeling the relationship of the sampled features, which effectively divides them into reasonable groups. As each feature group corresponds to a text instance, its bounding box can be easily obtained without any post-processing operation. Using the basic feature pyramid network for feature extraction, our method consistently achieves state-of-the-art results on several popular datasets for scene text detection.
研究の動機と目的
- シーンテキスト検出における極端なスケールおよびアスペクト比の変動に起因する課題に対処すること。
- 代表的な特徴に注目することで、トランスフォーマーに基づく検出における計算オーバーヘッドと背景干渉を低減すること。
- NMS やアンカ生成などの後処理を不要とするために、その必要性を排除すること。
- エンド・トゥ・エンドの特徴サンプリングとグループ化を通じて、検出精度と効率性を向上させること。
- 本手法の有効性を、航空画像におけるオrientedオブジェクト検出タスクへと拡張すること。
提案手法
- バックボーンネットワークからの特徴抽出に、マルチスケール特徴ピラミッドネットワークを用いる。
- ピクセル単位で信頼度スコアマップを予測し、テキスト関連領域を特定し、スコアに基づいて上位-N個の特徴をサンプリングする。
- 空間的コンテキストを保持するために、サンプリングされた特徴に学習可能な位置埋め込みを連結する。
- トランスフォーマーのエンコーダーが、自己アテンションを用いてサンプリングされた特徴間の関係をモデル化し、インスタンスレベルの表現に暗黙的にグループ化する。
- 各グループは1つのテキストインスタンスに対応し、後処理を経ずに直接バウンディングボックスを予測可能である。
- 全パイプラインをエンド・トゥ・エンドで訓練することで、特徴サンプリングとグループ化の共同最適化を可能にする。
実験結果
リサーチクエスチョン
- RQ1すべての特徴ではなく、代表的な特徴にのみ注目することで、トランスフォーマーに基づく検出器がシーンテキスト検出でより優れた性能を達成できるか?
- RQ2特徴サンプリングは、高解像度の特徴マップにおける背景干渉を低減し、効率性を向上させるか?
- RQ3トランスフォーマーのアテンションメカニズムは、意味的なテキストインスタンス表現に、サンプリングされた特徴を効果的にグループ化できるか?
- RQ4精度と推論コストの観点から、提案手法は最先端の検出器と比較してどのように差をつけるか?
- RQ5本手法は、航空画像のシーン理解のような、他のオrientedオブジェクト検出タスクにも一般化可能か?
主な発見
- 提案手法は、ICDAR2015、ICDAR2017-MLT、EAST データセットにおいて、マルチスケールテスト下で最先端の性能を達成した。ICDAR2015 では 87.42 の AP、ICDAR2017-MLT では 87.55 の AP を記録した。
- オrientedオブジェクト検出のための DOTA-v1.0 データセットにおいて、マルチスケールテストで 79.59 の AP50 を達成し、KLD よりも 1.32 AP50 高い性能を示した。
- ResNet-50 とマルチスケールテストを用いた ICDAR2015 では、89.81 の AP50 を達成し、以前の SOTA メソッドを上回った。
- アブレーションスタディにより、特徴サンプリングが計算コストを低減し、背景ノイズに対してよりロバストであることが確認された。
- 任意形状のテキストおよび回転したテキスト検出においても良好な性能を示し、標準的なシーンテキスト検出をはるかに超えた汎用性を示した。
- 強力な性能を発揮する一方で、重なったテキストインスタンスに対しては、重複する特徴表現のため、性能が劣化する傾向にあった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。