Skip to main content
QUICK REVIEW

[論文レビュー] Continual Detection Transformer for Incremental Object Detection

Yaoyao Liu, Bernt Schiele|arXiv (Cornell University)|Apr 6, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

本稿では、変換器ベースのモデルにおける段階的物体検出のための新規手法CL-DETRを提案する。この手法は、検出器知識蒸留(DKD)と補正されたエクジンプレリプレイ戦略を導入することで、深刻な忘却を克服する。DKDは、古いモデルからの最も信頼性の高い前景予測のみを選択的に蒸留し、ノイズの多い背景検出を回避する。一方、補正されたERは、訓練データの真のクラス分布を保持する。CL-DETRは、COCO 2017で最先端の性能を達成し、直接KDとERを適用した場合と比較して平均精度(AP)を4.2ポイント向上する。

ABSTRACT

Incremental object detection (IOD) aims to train an object detector in phases, each with annotations for new object categories. As other incremental settings, IOD is subject to catastrophic forgetting, which is often addressed by techniques such as knowledge distillation (KD) and exemplar replay (ER). However, KD and ER do not work well if applied directly to state-of-the-art transformer-based object detectors such as Deformable DETR and UP-DETR. In this paper, we solve these issues by proposing a ContinuaL DEtection TRansformer (CL-DETR), a new method for transformer-based IOD which enables effective usage of KD and ER in this context. First, we introduce a Detector Knowledge Distillation (DKD) loss, focusing on the most informative and reliable predictions from old versions of the model, ignoring redundant background predictions, and ensuring compatibility with the available ground-truth labels. We also improve ER by proposing a calibration strategy to preserve the label distribution of the training set, therefore better matching training and testing statistics. We conduct extensive experiments on COCO 2017 and demonstrate that CL-DETR achieves state-of-the-art results in the IOD setting.

研究の動機と目的

  • Deformable DETR や UP-DETR といった最新の変換器ベース検出器を用いた段階的物体検出(IOD)における深刻な忘却を解消すること。
  • 予測の不均衡とクラス分布の歪みのため、標準的な知識蒸留(KD)とエクジンプレリプレイ(ER)が変換器検出器では失敗することを克服すること。
  • 複数の段階で同じ画像が繰り返し使用されないよう、標準的な段階的学習定義と整合性を持つ新しいIODベンチマークプロトコルを提案すること。
  • 古いモデルからの情報的で信頼性の高い前景予測に限定してKDを改善することで、新しい正例ラベルとの衝突を低減すること。
  • 保存された画像の分布が元の訓練セットの分布と一致するようにエクジンプレリプレイを補正し、一般化性能を向上させるとともに、忘却を軽減すること。

提案手法

  • 検出器知識蒸留(DKD)を導入し、古いモデルの上位-K個の非背景予測(信頼度が最も高いもの)を抽出し、訓練中に新しい正例ラベルと併せて二部マッチングに統合する。
  • 古いモデルの予測と新しい正例アノテーションを組み合わせたラベル集合を用いて、標準的な物体検出訓練を実施し、一貫性を確保するとともに、衝突を低減する。
  • 訓練画像の選択を、元のクラス分布に一致するように補正するエクジンプレリプレイ戦略を実装し、カテゴリごとの均等サンプリングが引き起こす不均衡を回避する。
  • 各段階で二段階の訓練プロトコルを採用:本格的な訓練ステップに続いて、モデルの予測を精緻化し、忘却を低減するための小規模な補正ステップを実施する。
  • 同じ画像が複数の訓練段階にわたって使用されないよう、IODベンチマークプロトコルを改訂し、データ漏洩を防ぎ、段階的学習の原則とより良く整合させる。
  • 古いモデルからの高信頼度で重複のない検出結果を優先して選択する疑似ラベル選択メカニズムを採用し、信頼性の高い蒸留ターゲットを生成する。

実験結果

リサーチクエスチョン

  • RQ1なぜ標準的な知識蒸留とエクジンプレリプレイは、Deformable DETR などの変換器ベース物体検出器に直接適用した場合に失敗するのか?
  • RQ2段階的物体検出における古いモデルの予測と新しい正例ラベルの間の衝突を回避するために、知識蒸留をどのように再設計できるか?
  • RQ3エクジンプレリプレイにおけるクラス分布の不一致が、IODにおけるモデル性能と忘却に与える影響は何か?
  • RQ4画像の繰り返しを回避するように改訂されたIODベンチマークプロトコルは、段階的学習実験の妥当性と再現可能性を向上させられるか?
  • RQ5DKDで使用する上位-K個の予測数といったハイパーパrameterの選択に、提案手法はどれほどロバストか?

主な発見

  • CL-DETRは、COCO 2017 70+10 IOD設定において、Deformable DETRに直接KDとERを適用した場合と比較して、平均精度(AP)を4.2ポイント向上する。
  • 補正されたエクジンプレリプレイ戦略は、従来のERと比較して忘却を2.1ポイント低減し、旧カテゴリの性能を2.1ポイント向上させる。
  • DKDで上位10個の信頼度の高い非背景予測を使用すると最良の性能が得られ、異なるK値間で僅か0.4ポイントの差にとどまるため、ハイパーパrameterに非常にロバストであることが示された。
  • DKD損失は、ノイズの多い背景予測を効果的に抑制し、蒸留知識と新しい学習信号との間の衝突を低減する。
  • 可視化結果から、CL-DETRは正確な疑似ラベルを生成しており、特にオブジェクトが少ない画像では正例ボックスとよく一致していることが確認された。
  • 改訂されたIODプロトコルにより、複数段階にわたる画像の繰り返し使用が防止され、ベンチマークがより現実的で、標準的な段階的学習の仮定と整合性が高くなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。