[論文レビュー] DiffusionEdge: Diffusion Probabilistic Model for Crisp Edge Detection
本稿では、後処理を経ずにクリアで正確なエッジマップを直接生成する一般化エッジ検出のための最初の拡散確率モデル、DiffusionEdgeを提案する。不確実性を考慮した蒸留とアダプティブ・フォーリエフィルタリングを用いて潜在空間で訓練することで、複数のベンチマークで最先端の性能を達成し、NYUDv2においてはODS、OIS、ACがそれぞれ最大30.2%、28.1%、65.1%向上した。
Limited by the encoder-decoder architecture, learning-based edge detectors usually have difficulty predicting edge maps that satisfy both correctness and crispness. With the recent success of the diffusion probabilistic model (DPM), we found it is especially suitable for accurate and crisp edge detection since the denoising process is directly applied to the original image size. Therefore, we propose the first diffusion model for the task of general edge detection, which we call DiffusionEdge. To avoid expensive computational resources while retaining the final performance, we apply DPM in the latent space and enable the classic cross-entropy loss which is uncertainty-aware in pixel level to directly optimize the parameters in latent space in a distillation manner. We also adopt a decoupled architecture to speed up the denoising process and propose a corresponding adaptive Fourier filter to adjust the latent features of specific frequencies. With all the technical designs, DiffusionEdge can be stably trained with limited resources, predicting crisp and accurate edge maps with much fewer augmentation strategies. Extensive experiments on four edge detection benchmarks demonstrate the superiority of DiffusionEdge both in correctness and crispness. On the NYUDv2 dataset, compared to the second best, we increase the ODS, OIS (without post-processing) and AC by 30.2%, 28.1% and 65.1%, respectively. Code: https://github.com/GuHuangAI/DiffusionEdge.
研究の動機と目的
- 後処理に依存せずに、同時に高い正確性とシャープネスを達成するエッジ検出の長年の課題に対処すること。
- エンコーダ・デコーダネットワークのアーキテクチャ的制限を超えることができるかどうか、拡散確率モデル(DPMs)がその可能性を有するかを検証すること。
- ピクセルレベルの交差エントロピー損失からの不確実性を考慮した監督を保持しつつ、潜在空間におけるDPMの有効な訓練を可能にすること。
- 分離アーキテクチャとアダプティブ・フォーリエフィルタリングを用いて、推論効率と特徴の適応性を向上させること。
- 拡散モデルがエンドツーエンドの下流タスクに適した単一幅の高品質エッジマップを直接生成できることを実証すること。
提案手法
- 計算コストを低減しつつ高解像度のエッジ予測を維持するため、潜在空間における拡散確率モデル(DPM)を採用する。
- ピクセルレベルの交差エントロピー損失から得られる勾配を潜在空間に伝達する不確実性蒸留を用い、アノテータに頑健な不確実性事前知識を保持する。
- 特徴学習段階と精練段階を分離することで、ノイズ除去プロセスの高速化を図る分離型アーキテクチャを導入する。
- 潜在空間における周波数成分を効果的に調整するアダプティブ・フォーリエフィルタを適用し、エッジの局所化とシャープネスを向上させる。
- 標準的なピクセルレベルの監督を用いて潜在パラメータを最適化する蒸留ベースの訓練戦略を採用し、複雑な再訓練を回避する。
- DPMの反復的ノイズ除去プロセスを活用し、アップサンプリングアーチファクトを回避するため、元の画像解像度で複雑なエッジ分布を直接学習する。
実験結果
リサーチクエスチョン
- RQ1拡散確率モデルは、正確性とシャープネスの両方を達成する一般化エッジ検出に効果的に適応可能か?
- RQ2潜在空間で拡散モデルを訓練する際、ピクセルレベルの交差エントロピー損失からの不確実性を考慮した監督をどのように保持できるか?
- RQ3周波数ドメインにおけるアダプティブ周波数フィルタリングは、拡散ベースのエッジ検出におけるエッジの局所化とシャープネスを向上させられるか?
- RQ4分離型アーキテクチャは、高性能を維持しつつ、拡散ベースのエッジ検出における推論速度を向上させられるか?
- RQ5拡散モデルは、単一幅で後処理不要のエッジマップを生成でき、最先端のCNNベースの手法を正確性とシャープネスの両面で上回ることができるか?
主な発見
- NYUDv2データセットにおいて、DiffusionEdgeは2番目に優れた手法と比較して、ODS、OIS(後処理なし)、ACをそれぞれ30.2%、28.1%、65.1%向上させた。
- BIPEDデータセットでは、DiffusionEdgeはACが0.849を達成し、曇りのない単一幅のエッジ予測を示しており、最小限の曇りがある。
- Multicueでは、DiffusionEdgeはACが0.462を達成し、ランダムフリップのみを用いたデータオーグメンテーションでも、PiDiNetベースの手法を最大0.138のシャープネス向上で上回った。
- 質的評価でも優れた結果を示し、エッジは正確かつ明確に局所化されており、正解境界に非常に近い。
- UAED や EDTER などの最先端のCNNベースのモデルと比較して、DiffusionEdgeは特に複雑なテクスチャを含む困難なベンチマークにおいて、正確性とシャープネスの両面で優れた性能を示した。
- アブレーションスタディの結果、アダプティブ・フォーリエフィルタと不確実性蒸留が高性能を達成するために不可欠であることが確認され、ACおよびODS指標において顕著な向上が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。