Skip to main content
QUICK REVIEW

[論文レビュー] Augmentation-Free Dense Contrastive Knowledge Distillation for Efficient Semantic Segmentation

Jiawei Fan, Chao Li|arXiv (Cornell University)|Dec 7, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、チャネルおよび空間次元にわたる細分化されたマスク付き特徴パーティションを活用することで、データオーグメンテーションおよびメモリバッファを排除する、効率的なセマンティックセグメンテーションのための新しい対照的 distillation 法、Augmentation-Free Dense Contrastive Knowledge Distillation (Af-DCD) を提案する。Af-DCD は最先端の性能を達成し、教師モデルが DeepLabV3-Res101、生徒モデルが DeepLabV3-Res18 および DeepLabV3-MobilenetV2 の場合、Cityscapes でそれぞれ 77.03% および 76.38% の mIOU の新記録を樹立した。

ABSTRACT

In recent years, knowledge distillation methods based on contrastive learning have achieved promising results on image classification and object detection tasks. However, in this line of research, we note that less attention is paid to semantic segmentation. Existing methods heavily rely on data augmentation and memory buffer, which entail high computational resource demands when applying them to handle semantic segmentation that requires to preserve high-resolution feature maps for making dense pixel-wise predictions. In order to address this problem, we present Augmentation-free Dense Contrastive Knowledge Distillation (Af-DCD), a new contrastive distillation learning paradigm to train compact and accurate deep neural networks for semantic segmentation applications. Af-DCD leverages a masked feature mimicking strategy, and formulates a novel contrastive learning loss via taking advantage of tactful feature partitions across both channel and spatial dimensions, allowing to effectively transfer dense and structured local knowledge learnt by the teacher model to a target student model while maintaining training efficiency. Extensive experiments on five mainstream benchmarks with various teacher-student network pairs demonstrate the effectiveness of our approach. For instance, the DeepLabV3-Res18|DeepLabV3-MBV2 model trained by Af-DCD reaches 77.03%|76.38% mIOU on Cityscapes dataset when choosing DeepLabV3-Res101 as the teacher, setting new performance records. Besides that, Af-DCD achieves an absolute mIOU improvement of 3.26%|3.04%|2.75%|2.30%|1.42% compared with individually trained counterpart on Cityscapes|Pascal VOC|Camvid|ADE20K|COCO-Stuff-164K. Code is available at https://github.com/OSVAI/Af-DCD

研究の動機と目的

  • 既存の対照的知識 distillation 法がデータオーグメンテーションおよびメモリバッファに依存するため、セマンティックセグメンテーションにおける計算コストおよびメモリコストが高いため、これを解決すること。
  • 教師から生徒ネットワークへの、境界領域や隠蔽領域を含む、密で構造的な局所的知識を保持・転送すること。
  • 追加のトレーニング時間および GPU メモリのオーバーヘッドを回避する、本質的に効率的な対照的 distillation フレームワークを設計すること。
  • ピクセルレベルで生徒および教師特徴間の局所的パッチ間関係を明示的にモデル化し、細分化された特徴の整合性を向上させること。
  • さまざまなデータセットおよびネットワークアーキテクチャにわたって、トレーニング効率とスケーラビリティを維持したまま、セマンティックセグメンテーションで最先端の性能を達成すること。

提案手法

  • Af-DCD は、メモリバッファに保存せずに高分解能特徴マップを保持するためのマスク付き特徴再構成戦略を導入する。
  • チャネルおよび空間次元の両方で特徴マップを分割された不重複な表現に分割することで、新しい対照的損失を定式化する。
  • 正例ペアは、同じ画像内の教師および生徒特徴マップにおいて、同一の絶対位置にある対応する細分化特徴パーティションとして定義される。
  • 負例ペアは、同じ特徴マップ内での異なる空間的位置にあるパーティション同士を対比させることで形成され、判別的表現学習を促進する。
  • この方法は、生徒および教師特徴パーティション間の正規化 L2 距離に基づく対照的損失を用い、マイクロレベルでの整合性を保証する。
  • この対照的損失は、標準的なタスク損失および特徴 distillation 損失と統合され、データオーグメンテーションを用いないエンドツーエンドのトレーニングが可能になる。

実験結果

リサーチクエスチョン

  • RQ1セマンティックセグメンテーションのための対照的 distillation 法が、データオーグメンテーションやメモリバッファに依存せずに高い性能を達成できるか。
  • RQ2細分化された局所的パッチ特徴パーティションは、教師から生徒モデルへの密で構造的な知識をどれほど効果的に転送できるか。
  • RQ3チャネルおよび空間次元にわたる包括的対比(omni-dimensional contrasting)は、複雑なセグメンテーションシナリオにおけるモデルの汎化性能および性能にどのような影響を及ぼすか。
  • RQ4CIRKD などの既存の対照的 distillation 手法と比較して、提案手法は GPU メモリおよびトレーニング時間の観点から、効率性と正確性の両面で優れているか。
  • RQ5境界領域、小規模オブジェクト、隠蔽領域といった困難なケースのセグメンテーションにおいて、この手法はどの程度向上を達成できるか。

主な発見

  • Af-DCD は、教師モデルが DeepLabV3-Res101、生徒モデルが DeepLabV3-Res18 の場合、Cityscapes データセットで 77.03% の新しい最先端の mIOU を達成した。
  • 本手法は、Cityscapes データセットにおける個別にトレーニングされたベースラインと比較して、mIOU を 3.26% 向上させた。
  • Pascal VOC、Camvid、ADE20K、COCO-Stuff-164K それぞれにおいて、絶対的な mIOU の向上は 3.04%、2.75%、2.30%、1.42% を記録した。
  • GPU メモリ使用量は CIRKD の 10.09 GB から 7.94 GB に削減され、トレーニング時間も 4.34 時間から 4.23 時間に短縮されたが、性能は向上した。
  • 可視化結果から、Af-DCD は細分化レベルでの生徒および教師特徴間の距離を顕著に短縮し、自己類似性分布を向上させ、境界領域や隠蔽領域のセグメンテーションを改善することが確認された。
  • アブレーションスタディの結果、本手法はハイパーパramータの変動に対して頑健であり、最大プーリングがより大きなパーティション数よりも効率的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。