[論文レビュー] 1st Place Solution for ICDAR 2021 Competition on Mathematical Formula Detection
本論文は、ICDAR 2021 数式検出(MFD)コンペティションで1位を獲得したソリューションを提示する。ResNeStバックボーンを用いた一般化フォーカルロス(GFL)に基づくアンカーフリー物体検出フレームワークを採用しており、サンプリングの不均衡を解消するための適応的トレーニングサンプル選択(ATSS)を活用するとともに、特徴マップピラミッド(FPN)のレベル(2–6)を最適化することで、小さな埋め込み数式の検出性能を向上させた。その結果、埋め込み数式で94.89のF1スコア、孤立数式で98.76のF1スコアを達成し、最先端性能(SOTA)を実現した。
In this technical report, we present our 1st place solution for the ICDAR 2021 competition on mathematical formula detection (MFD). The MFD task has three key challenges including a large scale span, large variation of the ratio between height and width, and rich character set and mathematical expressions. Considering these challenges, we used Generalized Focal Loss (GFL), an anchor-free method, instead of the anchor-based method, and prove the Adaptive Training Sampling Strategy (ATSS) and proper Feature Pyramid Network (FPN) can well solve the important issue of scale variation. Meanwhile, we also found some tricks, e.g., Deformable Convolution Network (DCN), SyncBN, and Weighted Box Fusion (WBF), were effective in MFD task. Our proposed method ranked 1st in the final 15 teams.
研究の動機と目的
- ドキュメント画像における極端なスケール変動とアスペクト比の多様性を有する数式検出の課題に対処すること。
- 埋め込み数式と孤立数式の間でスケールの大きな乖離が生じる場合に、アンカーベースの物体検出器が示す限界を克服すること。
- 標準的なトレーニング戦略におけるサンプリングの不均衡によりしばしば見逃されがちな小さな埋め込み数式の検出性能を向上させること。
- 短辺が16ピクセルにまで短い数式の検出を向上させるために、特徴マップピラミッド(FPN)の構成を最適化すること。
- アーキテクチャ選択とトレーニングテクニックの組み合わせにより、ICDAR 2021 MFDベンチマークで最先端性能(SOTA)を達成すること。
提案手法
- 可変なアスペクト比とスケール差をより効果的に扱えるよう、アンカーフリーで1段階のFCOSベースアーキテクチャを採用した一般化フォーカルロス(GFL)をベース検出器として採用した。
- ランダムサンプリングで見られる大きな数式へのバイアスを解消するため、適応的トレーニングサンプル選択(ATSS)を採用し、インスタンス間での正例分布をバランスさせた。
- デフォルトの(3–7)から(2–6)に変更することでFPNを再構成し、短辺が16ピクセルにまで短い数式の検出を可能にした。
- 不規則な形状や複雑な数式の特徴表現を向上させるために、可変畳み込みネットワーク(DCN)を統合した。
- 大規模データセットでのトレーニングの安定化と収束性の向上を図るため、同期バッチ正規化(SyncBN)とRanger最適化手法を適用した。
- 予測の微調整を図るため、予測後処理として重み付きボックス統合(WBF)を導入し、精度の低下を最小限に抑えながら再現率を向上させた。

実験結果
リサーチクエスチョン
- RQ1物体検出フレームワークをどのように変更すれば、数式検出における極端なスケール変動とアスペクト比の多様性に対応できるか?
- RQ2特に小さな埋め込み数式において、ランダムサンプリングと比較してATSSがどの程度検出性能を向上させるか?
- RQ3MFDタスクにおいて、大きな孤立数式と小さな埋め込み数式の両方を効果的に検出するための最適なFPN構成は何か?
- RQ4DCN、SyncBN、WBFといったアーキテクチャ的要素が、数式検出における性能向上にどのように寄与しているか?
- RQ5大入力解像度やモデルアンサンブルといったトレーニング・推論最適化の組み合わせによって、MFDベンチマークでSOTA結果を達成できるか?
主な発見
- 提案手法は、埋め込み数式で94.89のF1スコアを達成し、2番目に良い手法(94.29)を顕著に上回った。これは、最も挑戦的なサブタスクにおいても有効であることを示している。
- 孤立数式では98.76のF1スコアを達成し、あらゆる数式タイプにわたる優れた一般化性能を示した。
- ATSSの導入によりサンプリングの不均衡が軽減され、トレーニング中に小さな埋め込み数式に対しても十分な正例が確保された。
- FPNのレベルを(3–7)から(2–6)に変更することで、短辺が16ピクセルにまで短い数式の検出が可能になった。これは、従来、検出不可能であった領域をカバーした。
- 重み付きボックス統合(WBF)の適用により、再現率が向上し、精度の低下を最小限に抑えながら全体の性能が0.3%向上した。
- 大入力解像度、最適化されたFPN、ATSSの組み合わせにより、ベースライン手法と比較して埋め込み数式の性能差が10.6%縮小された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。