Skip to main content
QUICK REVIEW

[論文レビュー] Mixed Pseudo Labels for Semi-Supervised Object Detection

Zeming Chen, Wenwei Zhang|arXiv (Cornell University)|Dec 12, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

本論文は、偽ラベルの誤検出を軽減し、スケール一般化を向上させるために、Pseudo Mixup と Pseudo Mosaic を組み合わせた検出器に依存しないフレームワーク、Mixed Pseudo Labels (MixPL) を提案する。また、ラベル付きリサンプリングを用いて末尾カテゴリの性能を向上させる。MixPL は、追加のアノテーションなしで COCO ベンチマークで新しい SOTA を達成し、Faster R-CNN、FCOS、DINO Swin-L に対して最大 2.5% の mAP 向上を実現した。

ABSTRACT

While the pseudo-label method has demonstrated considerable success in semi-supervised object detection tasks, this paper uncovers notable limitations within this approach. Specifically, the pseudo-label method tends to amplify the inherent strengths of the detector while accentuating its weaknesses, which is manifested in the missed detection of pseudo-labels, particularly for small and tail category objects. To overcome these challenges, this paper proposes Mixed Pseudo Labels (MixPL), consisting of Mixup and Mosaic for pseudo-labeled data, to mitigate the negative impact of missed detections and balance the model's learning across different object scales. Additionally, the model's detection performance on tail categories is improved by resampling labeled data with relevant instances. Notably, MixPL consistently improves the performance of various detectors and obtains new state-of-the-art results with Faster R-CNN, FCOS, and DINO on COCO-Standard and COCO-Full benchmarks. Furthermore, MixPL also exhibits good scalability on large models, improving DINO Swin-L by 2.5% mAP and achieving nontrivial new records (60.2% mAP) on the COCO val2017 benchmark without extra annotations.

研究の動機と目的

  • 半教師付きオブジェクト検出における偽ラベルの根本的な限界、特に小規模および末尾カテゴリのオブジェクトに対する誤検出(偽陰性)を是正すること。
  • 特にスケールおよびカテゴリ分布の不一致に起因する検出器バイアスが偽ラベルによって悪化する影響を軽減すること。
  • モデル固有の変更を必要とせず、多様なオブジェクト検出器に広く適用可能な普遍的で検出器に依存しない手法を開発すること。
  • クラスバランスの取れたサンプリングによるラベル付きデータのリサンプリングを通じて、未代表的カテゴリの学習効率と一般化性能を向上させること。
  • 追加のアノテーションを一切必要とせず、標準的な COCO ベンチマークで最先端の性能を達成すること。

提案手法

  • Pseudo Mixup を提案。2つの偽ラベル付き画像をピixe単位でブレンドすることで、見逃された検出の勾配応答を軽減し、一般化性能を向上させるデータ拡張技術。
  • Pseudo Mosaic を導入。4つのダウンサンプルされた偽ラベル付き画像を合成して新たな訓練サンプルを生成し、小規模および中規模オブジェクトのアノテーション数を増加させる。
  • Pseudo Mosaic に動的解像度戦略を適用。最適な mAP と低い訓練コストを実現するため、画像サイズを 400 から 800 の範囲で調整する。
  • クラスバランスの取れたサンプリングを用いたラベル付きリサンプリングを実装。パワー・パラメータを用いてレアカテゴリをオーバーサンプリングし、末尾カテゴリの検出性能を向上させる。
  • 検出器と半教師付き学習プロセスを分離できる統一された訓練フレームワークである DetMeanTeacher を採用。これにより、異なるモデル間での一貫性ある評価が可能になる。
  • Faster R-CNN、FCOS、DINO といった標準的な検出器と MixPL を統合。アーキテクチャを問わず広範な互換性と一貫した性能向上を示した。

実験結果

リサーチクエスチョン

  • RQ1異なる検出器において、偽ラベルと正解アノテーションとの間で、オブジェクト数、スケール分布、カテゴリ頻度の観点から、どのような系統的差が生じるか?
  • RQ2Mixup や Mosaic といったデータ拡張技術を、偽ラベル付きデータに適応することで、誤検出バイアスを軽減し、小規模およびレアオブジェクトの検出性能を向上させられるか?
  • RQ3ラベル付きデータのリサンプリングにより、ヘッドカテゴリの検出性能を劣化させることなく、末尾カテゴリの性能をどの程度向上できるか?
  • RQ4提案された MixPL フレームワークは、2段階および1段階検出器を含む、さまざまな検出器アーキテクチャに一般化可能か?
  • RQ5MixPL は追加のアノテーションを必要とせず、COCO ベンチマークで最先端の性能を達成できるか?

主な発見

  • MixPL は COCO-Val2017 において Faster R-CNN を 2.5% mAP 向上させ、60.2% mAP を達成し、半教師付きオブジェクト検出分野で新たな SOTA を樹立した。
  • Pseudo Mixup のみで mAP は 34.7 から 35.7 に上昇し、Pseudo Mosaic を追加することでさらに 37.2 まで上昇した。これは、スケール拡張された偽ラベルによる有効性を示している。
  • Pseudo Mixup と Pseudo Mosaic の組み合わせが、mAP と訓練コストの最良のトレードオフを達成しており、解像度範囲 400–800 が最適な性能をもたらした。
  • パワー=1.0 でラベル付きリサンプリングを実施した結果、Faster R-CNN ではトースター検出の mAP が 0.4% から 41.3% に、FCOS では 0.0% から 57.7% に上昇し、末尾カテゴリへの強力な向上効果が確認された。
  • Faster R-CNN、FCOS、DINO Swin-L のすべてのテスト検出器において、一貫した性能向上が得られた。これは、本手法の普遍性と検出器に依存しない性質を裏付けている。
  • 10% のラベル付きデータのみでさえ、先行手法を上回る性能を達成した。これは、低監視環境下でもスケーラビリティと効率性を有していることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。