Skip to main content
QUICK REVIEW

[論文レビュー] Transformer-CNN Cohort: Semi-supervised Semantic Segmentation by the Best of Both Students

Zheng Xu, Yunhao Luo|arXiv (Cornell University)|Sep 6, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

本稿では、ビジョントランスフォーマー(ViT)と畳み込みニューラルネットワーク(CNN)を二重の学生モデルとして用いる、半教師ありセマンティックセグメンテーションの新規フレームワークであるTransformer-CNNコhort(TCC)を提案する。クラスに依存する特徴一貫性 distillation(CFCD)と一貫性に依存するクロス distillation(CCD)を導入することで、疑似ラベルを用いて特徴空間および予測空間の両方で多段階の一貫性を強制し、CityscapesおよびPascal VOC 2012で最先端の性能を達成し、従来手法に比べ顕著な精度向上を実現した。

ABSTRACT

The popular methods for semi-supervised semantic segmentation mostly adopt a unitary network model using convolutional neural networks (CNNs) and enforce consistency of the model's predictions over perturbations applied to the inputs or model. However, such a learning paradigm suffers from two critical limitations: a) learning the discriminative features for the unlabeled data; b) learning both global and local information from the whole image. In this paper, we propose a novel Semi-supervised Learning (SSL) approach, called Transformer-CNN Cohort (TCC), that consists of two students with one based on the vision transformer (ViT) and the other based on the CNN. Our method subtly incorporates the multi-level consistency regularization on the predictions and the heterogeneous feature spaces via pseudo-labeling for the unlabeled data. First, as the inputs of the ViT student are image patches, the feature maps extracted encode crucial class-wise statistics. To this end, we propose class-aware feature consistency distillation (CFCD) that first leverages the outputs of each student as the pseudo labels and generates class-aware feature (CF) maps for knowledge transfer between the two students. Second, as the ViT student has more uniform representations for all layers, we propose consistency-aware cross distillation (CCD) to transfer knowledge between the pixel-wise predictions from the cohort. We validate the TCC framework on Cityscapes and Pascal VOC 2012 datasets, which outperforms existing SSL methods by a large margin.

研究の動機と目的

  • 既存の半教師あり学習(SSL)手法が、グローバルおよびローカル特徴を効果的に学習できないこと、および異種モデル同士の補完的知識を活用できないという限界に対処すること。
  • 一様なアーキテクチャのSSLモデルが一貫性正則化に依存するのみであるため、特徴および予測の冗長性が生じるという制約を克服すること。
  • ビジョントランスフォーマー(ViT)とCNNが、異種特徴空間および予測ヘッドを介して知識を相互に転送することで、半教師ありセグメンテーションをどのように向上させられるかを検討すること。
  • 予測レベルだけでなく、クラスに依存する特徴マップを用いて特徴レベルでも疑似ラベル化を効果的に行い、特徴レベルの一貫性を向上させること。
  • ImageNetの事前学習を必要としない状況でも、異種モデルコホート(ViT + CNN)が同種モデルを上回ることを実証すること。

提案手法

  • TCCフレームワークは、ビジョントランスフォーマー(ViT)に基づく学生モデルと、畳み込みニューラルネットワーク(CNN)に基づく学生モデルの2つを採用し、異種のコホートを形成する。
  • クラスに依存する特徴一貫性 distillation(CFCD)は、疑似ラベル付きの予測からクラスに依存する特徴(CF)マップを生成することで、二つの学生間での知識伝達を実現し、特徴レベルの一貫性正則化を可能にする。
  • 一貫性に依存するクロス distillation(CCD)は、ViTとCNNの両学生間で予測を相互に distillation することで、ピクセル単位の予測一貫性を強化し、予測レベルのロバスト性を向上させる。
  • 未ラベルデータに対して疑似ラベル化を適用し、予測および特徴レベルの監督信号を生成する。CFマップは、同じ疑似ラベルを持つピクセルの特徴を平均することで計算される。
  • 多段階の一貫性正則化を採用する:CFCDは中間特徴マップで動作し、CCDは最終的なセマンティックセグメンテーション予測で動作する。これにより、補完的知識伝達が保証される。
  • 本手法は、ラベル付きデータに対する教師あり損失と、未ラベルデータに対する一貫性損失(CFCDおよびCCD)の組み合わせにより、エンド・ツー・エンドで学習される。ImageNetでの事前学習は不要である。

実験結果

リサーチクエスチョン

  • RQ1ViTとCNNを組み合わせた異種の二重学生フレームワークは、単一アーキテクチャのモデルを上回る半教師ありセマンティックセグメンテーション性能を達成できるか?
  • RQ2MSAとConvという根本的に異なるアーキテクチャを持つモデル間で、SSLの文脈において、知識をどのように効果的に転送できるか?
  • RQ3クラスに依存する特徴マップを介して特徴レベルでの疑似ラベル化が、予測のみの疑似ラベル化に比べ、モデルの一般化性能および特徴の判別性を向上させるか?
  • RQ4異種特徴空間および予測ヘッドをまたがる一貫性正則化は、ロバスト性および性能向上に効果的に適用できるか?
  • RQ5ImageNetの事前学習を一切行わない状況でも、二重学生フレームワークが、最先端の手法を上回る性能を発揮できるか、その程度はどの程度か?

主な発見

  • TCCは、CityscapesおよびPascal VOC 2012の両データセットで最先端の性能を達成し、特に前回のSoTA手法CPSを大きく上回った。
  • Pascal VOC 2012で1/8のラベル率を用いた場合、TCC-Sは82.32%のmIoUを達成し、ラベル付きデータのみで完全に教師あり学習を行った場合に比べ5.49%の向上を示した。
  • ImageNetでの事前学習を一切行わない状況でも、TCC-Sは事前学習に依存する前回のSoTA手法を上回った。これは、未ラベルデータからの強力な一般化能力を示している。
  • アブレーションスタディの結果、CFCDおよびCCDの両損失が、すべてのラベル率においてmIoUの向上に寄与していることが判明した。CFCDは、未ラベルデータが減少するに従い、効果の飽和傾向を示した。
  • TSNE可視化により、CFCDがクラスごとの特徴分離性を向上させ、特徴の判別性を高め、クラス内分散を低減することが確認された。
  • 推論段階において、ViTベースの学生モデルが常にCNNベースの学生モデルを上回った。これは、コホート内におけるMSAベースの表現学習能力の優位性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。