Skip to main content
QUICK REVIEW

[論文レビュー] MixNet: Toward Accurate Detection of Challenging Scene Text in the Wild

Yuxiang Zeng, Jun-Wei Hsieh|arXiv (Cornell University)|Aug 23, 2023
Handwritten Text Recognition Techniques被引用数 5
ひとこと要約

MixNetは、厳しい現実世界の条件下でも、小さな、曲がった、多方向のシーンテキストを正確に検出するためのハイブリッドCNN-Transformerアーキテクチャを提案する。特徴シャッフルネットワーク(FSNet)による高解像度特徴抽出と、テキスト中央線をモデル化するセントラルトランスフォーマーブロック(CTBlock)を組み合わせることで、Total-Textで90.5%のF1スコア、ArTで79.7%のF1スコアを達成し、複数のシーンテキスト検出ベンチマークで最先端の性能を実現した。

ABSTRACT

Detecting small scene text instances in the wild is particularly challenging, where the influence of irregular positions and nonideal lighting often leads to detection errors. We present MixNet, a hybrid architecture that combines the strengths of CNNs and Transformers, capable of accurately detecting small text from challenging natural scenes, regardless of the orientations, styles, and lighting conditions. MixNet incorporates two key modules: (1) the Feature Shuffle Network (FSNet) to serve as the backbone and (2) the Central Transformer Block (CTBlock) to exploit the 1D manifold constraint of the scene text. We first introduce a novel feature shuffling strategy in FSNet to facilitate the exchange of features across multiple scales, generating high-resolution features superior to popular ResNet and HRNet. The FSNet backbone has achieved significant improvements over many existing text detection methods, including PAN, DB, and FAST. Then we design a complementary CTBlock to leverage center line based features similar to the medial axis of text regions and show that it can outperform contour-based approaches in challenging cases when small scene texts appear closely. Extensive experimental results show that MixNet, which mixes FSNet with CTBlock, achieves state-of-the-art results on multiple scene text detection datasets.

研究の動機と目的

  • 不規則な照明やノイズがある現実世界環境における、小さな、曲がった、多方向のシーンテキストの検出の課題に対処すること。
  • ResNet や HRNet などの標準的なCNNバックボーンが、高解像度特徴を保持するのを妨げたり、ノイズの影響を減らすのを困難にしているという制限を克服すること。
  • 輪郭ベースの手法を超えて、グローバルな幾何的構造をモデル化することで、任意形状のテキストの検出精度を向上させること。
  • CNNの局所的特徴抽出の強みと、トランスフォーマーのグローバルな空間推論の強みを活かしたハイブリッドアーキテクチャの開発

提案手法

  • 畳み込み特徴抽出中に低解像度と高解像度の特徴マップ間での特徴交換を可能にする、特徴シャッフルネットワーク(FSNet)を提案する。
  • FSNetにおける特徴シャッリング戦略を新たに導入し、高解像度特徴の学習を深め、特徴表現の質を向上させる。
  • テキスト中央線と輪郭に沿って特徴をサンプリングし、グローバルな幾何的レイアウトをモデル化するセントラルトランスフォーマーブロック(CTBlock)を設計する。
  • 事後処理を施したヒートマップから粗いテキスト輪郭を抽出し、その輪郭に沿って中央線特徴をサンプリングしてトランスフォーマーに供給し、境界の微調整を行う。
  • 学習された頂点オフセットを初期輪郭に適用して、正確な微調整済みテキストマスクを生成する。
  • FSNetをバックボーンとして採用し、CTBlockと組み合わせてエンドツーエンドのシーンテキスト検出を実現し、スケールインvariantでノイズに強い特徴学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークアーキテクチャは、ノイズへの感受性を低減しつつ、小さなシーンテキスト検出のための高解像度特徴表現をどのように向上させられるか?
  • RQ2輪郭ではなく中央線をモデル化することで、密集した領域や曲がったテキスト領域における検出精度にどのような影響を与えるか?
  • RQ3ハイブリッドCNN-Transformerアーキテクチャは、任意形状のシーンテキスト検出ベンチマークにおいて、既存の最先端手法を上回ることができるか?
  • RQ4FSNetにおける提案された特徴シャッリング機構は、ResNet や HRNet といった標準バックボーンと比較して、特徴の質と検出性能においてどのように差をつけるか?

主な発見

  • MixNetはTotal-Textデータセットで90.5%のF1スコアを達成し、以前の手法より1.5ポイント高い最先端の性能を実現した。
  • ArTデータセットではF1スコアが79.7%に達し、TextFuseNetと比較して再現率が3.9ポイント、F1スコアが1.1ポイント向上した。
  • MSRA-TD500ではF-measureが89.4%に達し、多方向テキスト検出において既存手法より2.1ポイント向上した。
  • FSNetバックボーンは、ベースラインモデルに組み込むことで、ResNet50と比較して検出F1スコアを2.1ポイント向上させた。
  • FSNetバックボーンにCTBlockを追加すると、さらに0.5ポイントのF1スコア向上が見られた。
  • MixNetは、小さな、曲がった、密に配置されたテキストの検出において、多様なデータセットにわたる定性的な例から、一貫した優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。