[論文レビュー] General Instance Distillation for Object Detection
本稿では、物体検出のための知識蒸留フレームワークとして、アノテーションの有無にかかわらず、識別的なインスタンスを蒸留対象に選択する、一般化インスタンス蒸留(GID)を提案する。これらの一般化インスタンスから得られる特徴ベース、関係ベース、応答ベースの知識を活用することで、GIDは多様な検出フレームワークにおいて学生モデルの性能を向上させ、RetinaNet-Res50を用いたCOCO上でのmAPを39.1%に達成し、ベースラインおよびResNet-101を教師モデルとする設定を上回った。
In recent years, knowledge distillation has been proved to be an effective solution for model compression. This approach can make lightweight student models acquire the knowledge extracted from cumbersome teacher models. However, previous distillation methods of detection have weak generalization for different detection frameworks and rely heavily on ground truth (GT), ignoring the valuable relation information between instances. Thus, we propose a novel distillation method for detection tasks based on discriminative instances without considering the positive or negative distinguished by GT, which is called general instance distillation (GID). Our approach contains a general instance selection module (GISM) to make full use of feature-based, relation-based and response-based knowledge for distillation. Extensive results demonstrate that the student model achieves significant AP improvement and even outperforms the teacher in various detection frameworks. Specifically, RetinaNet with ResNet-50 achieves 39.1% in mAP with GID on COCO dataset, which surpasses the baseline 36.2% by 2.9%, and even better than the ResNet-101 based teacher model with 38.1% AP.
研究の動機と目的
- 異なる物体検出フレームワークにわたる既存の知識蒸留手法の一般化能力の制限を解消すること。
- アノテーションの真値ラベルに依存するのを回避し、検出蒸留における陽性・陰性インスタンスの不均衡を是正すること。
- 陽性インスタンスだけでなく、情報量の多いバックグラウンドパッチ(陰性インスタンス)を活用することで、学生モデルの性能を向上させること。
- 1段階、2段階、アンカーフリーの検出アーキテクチャのすべてに耐性を持つ統一された蒸留手法を開発すること。
提案手法
- 教師および学生ネットワークの出力に基づいて真値ラベルに依存せず、蒸留対象として一般化インスタンス(GIs)を定義する。
- 教師と学生の予測間の応答、特徴、関係ベースの類似性を用いて、最も識別的なインスタンスを適応的に特定する一般化インスタンス選択モジュール(GISM)を設計する。
- 応答ベース(ログティス)、特徴ベース(中間活性化)、関係ベース(ペアワイズインスタンス相互作用)の3種類の知識を蒸留に統合する。
- 教師から学生への知識伝達のために、応答、特徴、関係損失の重み付き組み合わせを用いた知識蒸留損失を適用する。
- GISMにおけるトップ-K選択戦略を用いて、選択されたGIsの数を制御し、情報量の多いインスタンスと訓練効率の両立を図る。
- アンカー や RPN などの特定のコンponents に依存しない設計を採用することで、フレームワークに依存しない設計を実現し、広範な適用性を確保する。
実験結果
リサーチクエスチョン
- RQ1物体検出における知識蒸留を、真値ラベルや陽性/陰性インスタンスの区別に依存せずに効果的に行うことは可能か?
- RQ2インスタンス間の関係ベース知識の組み込みが、物体検出における蒸留性能にどのように寄与するか?
- RQ3情報量の多いバックグラウンドパッチ(陰性インスタンス)は、学生モデルの一般化性能にどの程度寄与するか?
- RQ4蒸留の性能は異なる検出フレームワークで変動するか?また、統一された手法がそれらすべてに一般化可能か?
- RQ5蒸留効率とモデル精度を最大化するための最適な選択インスタンス数(トップ-K)はどの程度か?
主な発見
- GIDを適用した学生モデルは、RetinaNet-Res50を用いてCOCOで39.1%のmAPを達成し、ベースライン(36.2%)を上回り、さらにResNet-101を教師とするモデル(38.1% mAP)をも上回った。
- 陰性インスタンス(バックグラウンドパッチ)からのみの蒸留でも性能向上が見られ、情報量の多いバックグラウンド知識が価値があり、かつしばしば無視されがちなことが示された。
- 特徴ベース、関係ベース、応答ベースの知識の組み合わせが最良の性能をもたらし、特徴と応答知識がそれぞれ約1.7 mAPの向上をもたらした。
- GISMの最適なトップ-Kは10から100の間であり、Kが100を超えると、無関係または情報量の少ないインスタンスが含まれるようになり、性能が低下した。
- GISMによって選択された真値インスタンスのサブセットが、すべての真値インスタンスを用いた蒸留を上回る性能を示した。これは、極めて困難または単純なサンプルが蒸留に悪影響を及える可能性があることを示している。
- 訓練の進行に伴い、陽性蒸留インスタンスの割合は減少するが、後期段階での性能向上は主に識別的なバックグラウンドおよびキーパッチ特徴に起因している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。