Skip to main content
QUICK REVIEW

[論文レビュー] Technical Report for ICCV 2021 Challenge SSLAD-Track3B: Transformers Are Better Continual Learners

Duo Li, Guimei Cao|arXiv (Cornell University)|Jan 13, 2022
Domain Adaptation and Few-Shot Learning被引用数 10
ひとこと要約

本論文は、継続的オブジェクト検出フレームワークCOLTを提案する。このフレームワークは、スイッチングトランスフォーマーを特徴抽出器として用い、継続的学習における深刻な忘却を軽減する。250件のリプレイされた旧データサンプルに対する知識蒸留と、ドメインシフトに適応するヘッド拡張を組み合わせた。この手法は、ICCV 2021 SSLAD-Track3Bテストセットで70.78 mAPを達成し、トランスフォーマーの優れた汎化性能と継続的学習環境における安定性を示した。結果として、チャレンジで1位を獲得した。

ABSTRACT

In the SSLAD-Track 3B challenge on continual learning, we propose the method of COntinual Learning with Transformer (COLT). We find that transformers suffer less from catastrophic forgetting compared to convolutional neural network. The major principle of our method is to equip the transformer based feature extractor with old knowledge distillation and head expanding strategies to compete catastrophic forgetting. In this report, we first introduce the overall framework of continual learning for object detection. Then, we analyse the key elements' effect on withstanding catastrophic forgetting in our solution. Our method achieves 70.78 mAP on the SSLAD-Track 3B challenge test set.

研究の動機と目的

  • 自律走行シナリオにおける継続的オブジェクト検出における深刻な忘却を解決すること。
  • トランスフォーマーがオブジェクト検出の継続的学習において、CNNよりも優れた汎化性能を示すかどうかを調査すること。
  • タスクIDの漏洩なしにドメインシフト(昼/夜、都市/地方)に耐性を持つモデルの安定性を向上させること。
  • 制限されたメモリ環境(250サンプル)における知識蒸留と適応的ヘッド拡張の有効性を評価すること。
  • トランスフォーマー基盤アーキテクチャを用いた継続的オブジェクト検出の新しいSOTAベースラインを確立すること。

提案手法

  • 特徴抽出器としてスイッチングトランスフォーマーを採用し、バッチ正規化層が存在しないことと、優れた汎化性能を活かして忘却を軽減する。
  • 固定された教師モデルを用いて、バックボーンとネックの特徴量に対して知識蒸留を適用し、リプレイされた旧サンプルにおける学生モデルと教師モデルの特徴マップの分布差を最小化する。
  • 知識蒸留用に250件の旧サンプルを保持するメモリバッファを採用し、KD損失は教師モデルと学生モデルの特徴マップ間のL2距離として定義される。
  • 新しいシナリオにおける検証損失がしきい値(1.2)を超えた場合に、検出器ヘッドを適応的に拡張し、大きなドメインギャップに対応するためのヘッドの特化を可能にする。
  • 検出器ヘッドとしてCascadeRCNNを採用し、学習は8GPUで実行し、教師あり学習と知識蒸留の損失比を1:20に設定する。
  • タスクID依存の推論メカニズムを導入し、テスト時にシナリオIDに応じて適切なヘッドを選択する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーバックボーンを用いることで、CNNと比較して継続的オブジェクト検出における深刻な忘却が軽減されるか?
  • RQ2限られたメモリバッファ(250サンプル)における知識蒸留は、旧タスクの性能維持にどの程度効果的か?
  • RQ3適応的ヘッド拡張は、夜間走行などの分布外シナリオにおける性能劣化を緩和できるか?
  • RQ4モデルサイズそのものが継続的学習性能を決定づけるのか、それとも特徴抽出器の汎化能力がより重要か?
  • RQ5生成的リプレイ技術(VAEやGAN)は、継続的学習におけるオブジェクト検出に効果的に適用可能か?

主な発見

  • 提案されたCOLT手法は、SSLAD-Track3Bテストセットで70.78 mAPを達成し、チャレンジベースラインを19.58 mAPも上回った。
  • スイッチングトランスフォーマーバックボーンを用いることで、CNNと比較して忘却が軽減された。これは、忘却率(FR)が低く、平均mAPが高いことで裏付けられた。
  • 知識蒸留により、検証セットにおける忘却率は1.71から0.46に低下し、平均mAPは73.59から75.11に上昇した。
  • 適応的ヘッド拡張は、大きなドメインギャップを示すタスク3(夜間走行)において顕著な性能向上を示し、ドメインシフトへの対処の有効性を実証した。
  • ResNet101を用いた大きなモデルは、過学習のため、小さなモデルよりも性能が悪かったが、トランスフォーマー基盤モデルはすべてのCNNベースラインを上回り、バックボーンの汎化能力がサイズよりも重要であることを示した。
  • VAEおよびGANを用いた生成的リプレイは、アスペクト比の変動、長尾生成、オブジェクト検出における特徴品質の課題により、効果がなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。