[論文レビュー] Decoder Denoising Pretraining for Semantic Segmentation
本稿では、ImageNet上で自己符号化によるノイズ除去を用いて、セマンティックセグメンテーションモデルのデコーダーヘッドを事前学習するデコーダーノイズ除去事前学習(DDeP)を提案する。この手法は、特にラベル付きデータが少ない状況下でも顕著な性能向上を達成する。教師ありエンコーダー事前学習と組み合わせることで、Cityscapes、Pascal Context、ADE20Kの各ベンチマークで最先端の結果を達成し、完全な訓練データセットを用いても、従来のエンコーダーのみの事前学習を上回る。
Semantic segmentation labels are expensive and time consuming to acquire. Hence, pretraining is commonly used to improve the label-efficiency of segmentation models. Typically, the encoder of a segmentation model is pretrained as a classifier and the decoder is randomly initialized. Here, we argue that random initialization of the decoder can be suboptimal, especially when few labeled examples are available. We propose a decoder pretraining approach based on denoising, which can be combined with supervised pretraining of the encoder. We find that decoder denoising pretraining on the ImageNet dataset strongly outperforms encoder-only supervised pretraining. Despite its simplicity, decoder denoising pretraining achieves state-of-the-art results on label-efficient semantic segmentation and offers considerable gains on the Cityscapes, Pascal Context, and ADE20K datasets.
研究の動機と目的
- ラベル付きデータが少ない状況下で、ランダムなデコーダー初期化の非効率性を是正すること。
- 従来の研究で無視されがちなデコーダーの事前学習が、転移性能を向上させることを調査すること。
- 従来の教師ありまたは自己教師ありエンコーダー事前学習と相性の良い、シンプルで効果的なノイズ除去ベースのデコーダー事前学習手法を開発すること。
- 拡散モデルにインspiredされたノイズ除去自己符号化器が、密度予測タスクに適した転移可能な表現を学習できることを実証すること。
提案手法
- ImageNet上でエンコーダーを教師あり分類器として事前学習し、その後固定する。
- 固定されたエンコーダーを用いてノイズの加わった画像から特徴を抽出し、デコーダーがこれらの特徴から元の綺麗な画像を再構成できるように学習する。
- 固定された標準偏差σを用いて、入力画像にガウスノイズを付加し、ノイズ付き入力ŝ = x + σϵを形成する。
- L2再構成損失を用いてデコーダーを最適化する:||gϕ(fθ(ŝ)) − x||²、ここで更新対象はデコーダーのパラメータϕのみ。
- ノイズを加える前に画像入力をスケーリングすることで、学習の安定性と性能を向上させる。
- 標準的な教師ありエンコーダー事前学習と組み合わせ、セマンティックセグメンテーションにおけるエンドツーエンドのファインチューニングを可能にする。
実験結果
リサーチクエスチョン
- RQ1セマンティックセグメンテーションモデルのデコーダーヘッドを事前学習することで、特にラベル付きデータが少ない状況下でも顕著な性能向上が達成可能か?
- RQ2エンコーダーのみを教師ありで事前学習するのと比較して、デコーダーのノイズ除去事前学習はどのように性能を向上させるか?
- RQ3ノイズスケーリングとノイズ予測を損失関数に組み込むことで、セグメンテーションのための表現学習が向上するか?
- RQ4拡散モデルにインspiredされたノイズ除去目的関数が、セマンティックセグメンテーションにおけるデコーダー事前学習に効果的に適応可能か?
- RQ5エンコーダー事前学習と組み合わせたデコーダーのノイズ除去事前学習は、複数のベンチマークデータセットにおいて一貫した向上をもたらすか?
主な発見
- デコーダーのノイズ除去事前学習(DDeP)は、特にラベル付き学習データの一部しか利用できない状況下で、セマンティックセグメンテーションの性能を顕著に向上させる。
- Pascal Contextデータセットでは、10%の学習データしか使わない状況下でも、教師ありエンコーダー事前学習のみの結果をDDePが上回る平均IoUを達成する。
- Cityscapes、ADE20K、Pascal Contextの各データセットにおいて、DDePはすべてのデータレジームで従来のエンコーダーのみの事前学習を上回り、一貫した向上を示す。
- ラベル効率の悪い設定下で、DDePは3つのベンチマークデータセットすべてで最先端の性能を達成し、デコーダー事前学習の重要性を裏付けた。
- ノイズを加える前に画像入力をスケーリングすることで、ノイズ除去事前学習の効果が向上し、入力分布への感受性があることが示唆された。
- 完全な訓練データセットを用いても、DDePによる向上は顕著であり、一般にランダムなデコーダー初期化は最適でないことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。