[論文レビュー] 1st Place Solution to ICDAR 2021 RRC-ICTEXT End-to-end Text Spotting and Aesthetic Assessment on Integrated Circuit
この論文は、YOLOv5ベースのモデルを用いて、統合回路画像におけるエンドツーエンドのテキストスポットリングとアート的な評価を統合した、ICDAR 2021 RRC-ICTEXTチャレンジでの1位のソリューションを提示している。アプローチは、データ拡張、合成データ生成、半教師付き学習、マスク付き損失を用いた知識蒸留、およびTensorRTデプロイメントを採用し、タスク3.1で59.1 mAP(1位)を達成し、タスク3.2で78.7%のF2スコア(1位)を記録した。推論速度は31 FPS、メモリ使用量は306MBであった。
This paper presents our proposed methods to ICDAR 2021 Robust Reading Challenge - Integrated Circuit Text Spotting and Aesthetic Assessment (ICDAR RRC-ICTEXT 2021). For the text spotting task, we detect the characters on integrated circuit and classify them based on yolov5 detection model. We balance the lowercase and non-lowercase by using SynthText, generated data and data sampler. We adopt semi-supervised algorithm and distillation to furtherly improve the model's accuracy. For the aesthetic assessment task, we add a classification branch of 3 classes to differentiate the aesthetic classes of each character. Finally, we make model deployment to accelerate inference speed and reduce memory consumption based on NVIDIA Tensorrt. Our methods achieve 59.1 mAP on task 3.1 with 31 FPS and 306M memory (rank 1), 78.7\% F2 score on task 3.2 with 30 FPS and 306M memory (rank 1).
研究の動機と目的
- 統合回路のテキストスポットリングデータセットにおける小文字とそれ以外の文字の間の不均衡を是正する。
- 3,000件のアノテーションなしサンプルを用いて半教師付き学習を適用し、モデルの汎化性能と精度を向上させる。
- ぼやけた画像、低コントラスト、破損したテキストの3クラス分類ヘッドを追加することで、検出パイプラインにアート的評価を統合する。
- タスク3.1および3.2における3Sスコア基準を満たすために、推論速度とメモリ使用量を最適化し、上位ランクを達成する。
- NVIDIA TensorRTを用いて最終モデルをデプロイし、推論速度を向上させ、メモリ使用量を削減しながら高い精度を維持する。
提案手法
- 学生モデルとしてYOLOv5s、教師モデルとしてYOLOv5xを用い、クラスの希少性に配慮したマスクを用いた知識蒸留を適用する。
- マスク付き知識蒸留損失を定義:$\text{loss}_{\text{distillation}} = \text{MSE}(f_t*\text{mask}, f_s*\text{mask}) + \text{KL}(f_{t-\text{cls}}, f_{s-\text{cls}})$ ここでマスクは希少クラスの高IOU予測に焦点を当てる。
- 白色フォントを用いたWindowsフォントとスタイル変換技術を用いて、合成された小文字を生成し、クラス分布のバランスを取る。
- 繰り返し要因サンプリング(RFS)およびデータ拡張(Mosaic、ヒストグラム等化、90°回転)を適用し、モデルの耐性を高める。
- 検証データ上で疑似ラベル付けを実施し、予測の重み付きアンサンブル(WBF)を用いて半教師付き学習を実装する。
- 入力サイズ672×672、バッチサイズ1、NMS閾値0.1として、NVIDIA TensorRTを用いて最終的なYOLOv5sモデルをデプロイし、速度とメモリを最適化する。
実験結果
リサーチクエスチョン
- RQ1統合回路のテキストスポットリングにおいて、小文字とそれ以外の文字のクラス不均衡を効果的に是正する方法は何か?
- RQ23,000件のアノテーションなしサンプルしか利用できない状況で、半教師付き学習がモデル性能をどの程度向上させ得るか?
- RQ3統合された検出および分類ヘッドは、文字認識とアート的品質の両方を効果的に予測できるか?
- RQ4クラスに特化したマスクを用いた知識蒸留は、標準的な蒸留と比較して、より小さな学生モデルの性能をどのように向上させるか?
- RQ5実世界のデプロイにおいて、モデルサイズ、推論速度、精度の間にはどのようなトレードオフがあり、それらを最適化するにはどうすればよいか?
主な発見
- 最終モデルは、タスク3.1で31 FPS、306MBのGPUメモリを用い、59.1 mAPを達成し、ベンチマークで1位を獲得した。
- タスク3.2では、29.68 FPS、305.88MBのメモリを用い、78.7%のF2スコアを記録し、同様に1位となった。
- マスク付き知識蒸留により、YOLOv5sの検証データ上のmAPは58.5%から59.4%に向上し、標準的な蒸留を上回った。
- 合成データ生成により、小文字の数が4,400個増加し、希少クラスのAPが顕著に向上した。
- TensorRTデプロイメントにより、メモリ使用量は745.75MB(PyTorch)から305.88MBに削減され、推論速度は25.45 FPSから31.04 FPSに向上した(タスク3.1)。
- 3Sスコアはタスク3.1で0.74、タスク3.2で0.85を記録し、速度・サイズ・精度の最適化が優れていたことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。