[論文レビュー] DFormer: Diffusion-guided Transformer for Universal Image Segmentation
DFormerは、自己教師付き学習の枠組みで、深層特徴とマスク付き自己注意機構を用いて、ノイズの多いマスクからクリアなマスクを再構築するように訓練された拡散ガイド付きトランスフォーマーを提案する。この手法は、SOTA性能を達成し、COCOパンセグメンテーションで3.6%、ADE20Kセマンティックセグメンテーションで2.2%の向上を達成した。
This paper introduces an approach, named DFormer, for universal image segmentation. The proposed DFormer views universal image segmentation task as a denoising process using a diffusion model. DFormer first adds various levels of Gaussian noise to ground-truth masks, and then learns a model to predict denoising masks from corrupted masks. Specifically, we take deep pixel-level features along with the noisy masks as inputs to generate mask features and attention masks, employing diffusion-based decoder to perform mask prediction gradually. At inference, our DFormer directly predicts the masks and corresponding categories from a set of randomly-generated masks. Extensive experiments reveal the merits of our proposed contributions on different image segmentation tasks: panoptic segmentation, instance segmentation, and semantic segmentation. Our DFormer outperforms the recent diffusion-based panoptic segmentation method Pix2Seq-D with a gain of 3.6% on MS COCO val2017 set. Further, DFormer achieves promising semantic segmentation performance outperforming the recent diffusion-based method by 2.2% on ADE20K val set. Our source code and models will be publicly on https://github.com/cp3wan/DFormer
研究の動機と目的
- 複数のタスク(セマンティック、インスタンス、パノプティック)を統一したアーキテクチャで、セグメンテーションモデルの汎用性を向上させること。
- 従来の拡散ベースのセグメンテーション手法は、非拡散SOTA手法に比べて性能が劣るという限界を克服すること。
- 統一されたセグメンテーションフレームワークにおいて、拡散モデルをマスク予測の生成的事前分布として用いる可能性を検討すること。
- 現在のセグメンテーションモデルが依然として困難とされる小形物体や隠蔽インスタンスの性能を向上させること。
提案手法
- 教師付きマスクにマルチレベルのガウスノイズを追加することで、セグメンテーションタスクをノイズ除去問題に変換し、モデルを訓練する。
- 深層ピクセルレベル特徴量とノイズの入力されたマスクを用いて、拡散ベースのデコーダーによりマスク特徴量と注意マスクを生成する。
- トレーニング中、ノイズ入力から段階的にクリアなマスクを予測するために、トランスフォーマーのデコーダーでマスク付き自己注意機構を採用する。
- 推論時、ランダムにノイズの入ったマスクの集合を生成し、同じ拡散ベースのデコーダーを用いて最終的なマスクとそのカテゴリを予測する。
- ノイズの入ったマスクに二値閾値処理を施して注意マスクを生成し、予測時に関連領域に注目できるようにする。
- スケール制御(例:二値またはシャッフルエンコーディング)を備えた学習可能なマスクエンコーディング戦略を採用し、マスク表現学習を向上させる。
実験結果
リサーチクエスチョン
- RQ1拡散ベースの生成プロセスは、単一のトランスフォーマー枠組み内で複数の画像セグメンテーションタスクを統合するために効果的に適応可能か?
- RQ2マスクにガウスノイズを適用するノイズ除去パラダイムは、直接的なマスク予測と比較して、セグメンテーション精度と一般化性能にどのように影響するか?
- RQ3異なるセグメンテーションタスクで高い性能を達成するための最適なデコーダー層数と推論ステップ数は何か?
- RQ4異なるバックボーンネットワーク(例:ResNet-50 と Swin-T)およびマスクエンコーディング戦略が、パノプティック、インスタンス、セマンティックセグメンテーションにおけるモデル性能に与える影響は何か?
主な発見
- ResNet-50バックボーンを用いた場合、DFormerはMS COCO val2017でパノプティック品質(PQ)スコア51.1%を達成し、Pix2Seq-𝒟を3.6ポイント上回った。
- ADE20K valセットでは、Swin-Tバックボーンを用いたDFormerは、平均交差率(mIoU)48.3%を達成し、最近の拡散ベース手法DDPを2.2%上回った。
- 9層のデコーダーを用いることで、インスタンスセグメンテーションで最高の性能(AP = 42.6)を達成した。これは、より深いデコーダーがマスク予測品質を向上させることを示している。
- 1ステップの前方プロセスを用いた推論でも、ほぼ最適な性能が得られた。これは、モデルが最小限のノイズ除去ステップでも良好に一般化できることを示している。
- スケール0.1の二値マスクエンコーディング戦略は、ランダムシャッフルに比べて優れた結果を示し、特に低スケールで顕著であった。
- DFormerは動画インスタンスセグメンテーションにも良好に一般化でき、YouTube-VIS 2019 valセットでAP 46.5を達成した。これは、静的画像を超えた汎用性の高さを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。