[論文レビュー] Tiny and Efficient Model for the Edge Detection Generalization
本論文では、BIPEDデータセット上で新規で効率的なトレーニング手順を用いて学習された、58Kパラメータのみを有する軽量畳み込みニューラルネットワークであるTEEDを提案する。極めて小さなサイズであるにもかかわらず、TEEDは最先端の一般化性能を達成し、明確で高品質なエッジマップを生成し、定量的指標および下流のスケッチベース画像検索タスクにおいて、より大きなモデルを上回る性能を発揮する。
Most high-level computer vision tasks rely on low-level image operations as their initial processes. Operations such as edge detection, image enhancement, and super-resolution, provide the foundations for higher level image analysis. In this work we address the edge detection considering three main objectives: simplicity, efficiency, and generalization since current state-of-the-art (SOTA) edge detection models are increased in complexity for better accuracy. To achieve this, we present Tiny and Efficient Edge Detector (TEED), a light convolutional neural network with only $58K$ parameters, less than $0.2$% of the state-of-the-art models. Training on the BIPED dataset takes $less than 30 minutes$, with each epoch requiring $less than 5 minutes$. Our proposed model is easy to train and it quickly converges within very first few epochs, while the predicted edge-maps are crisp and of high quality. Additionally, we propose a new dataset to test the generalization of edge detection, which comprises samples from popular images used in edge detection and image segmentation. The source code is available in https://github.com/xavysp/TEED.
研究の動機と目的
- 低レベルのコンピュータビジョンタスクにおける軽量で効率的かつ一般化可能なエッジ検出モデルのニーズに対応すること。
- 現在のSOTAモデルが計算コストが高く、広範なハイパーパramータチューニングや転移学習を必要としているという限界を克服すること。
- エッジ検出の一般化性能を公平に評価できるように、UDEDと呼ばれる新しいベンチマークデータセットを構築すること。
- 最小限の計算コストで迅速なトレーニングと収束を実現しつつ、高いエッジ検出品質を維持すること。
- 下流タスク(例:スケッチベース画像検索)での評価を通じて、小さなモデルが優れた一般化性能を達成できることを示すこと。
提案手法
- 最小限の推論およびトレーニングコストを実現するための、わずか58KパラメータのコンパクトなCNNアーキテクチャであるTEEDを提案する。
- Cofusionにインspiredされたが、1,000パラメータ未満の非常に軽量で効率的な特徴マッピング統合機構であるdfuseモジュールを導入する。
- トレーニング収束を加速させ、最適化の安定性を向上させるために、独自のdloss関数を設計する。
- 転移学習を避けて、BIPEDデータセット上でTEEDをスクラッチからトレーニングし、1エポックあたり5分未塔、合計30分未満でトレーニング時間を短縮する。
- 複数のエッジ検出およびセグメンテーションデータセットから周波数基準に基づいて画像を選択することで、UDED(エッジ検出のための統一データセット)を構築する。これにより、多様で知覚的に関連性のあるテストケースを確保する。
- 標準指標に加え、QMULデータセット上の下流タスク(スケッチベース画像検索)を用いて性能を検証することで、実世界での一般化能力を評価する。
![Figure 1: Edges from our proposal (TEED) and the state-of-the-art models. EDTER [ 33 ] and PiDiNet [ 42 ] have been trained in BSDS500 [ 1 ] following the standard training procedure. TEED has been trained from the scratch with BIPED [ 41 ] with a reduced hyper-parameters tuning.](https://ar5iv.labs.arxiv.org/html/2308.06468/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1転移学習やハイパーパramータチューニングなしで、小さな軽量CNNがエッジ検出において最先端の一般化性能を達成できるか?
- RQ2BIPEDのような選別済みデータセットで学習したモデルは、トレーニング分布外の未観測で多様な画像に一般化できるか?
- RQ3新規で効率的な損失関数と軽量な統合モジュールが、トレーニング速度とエッジ検出品質に与える影響は何か?
- RQ4最小限のモデルが、スケッチベース画像検索のような下流タスクで、より大きなSOTAモデルを上回ることができるか?
- RQ5提案されたUDEDデータセットは、エッジ検出器の真の一般化能力を評価するためにどれほど効果的か?
主な発見
- QMUL-ShoeV2データセットにおいて、TEEDはトップ10精度が0.9565、トップ1精度が0.5565を達成し、はるかに多くのパラメータを有するモデルを上回る。
- QMUL-ChairV2データセットでは、トップ1精度が0.8865、トップ10精度が1.0を達成し、より大きなモデルと同等またはそれを上回る性能を示した。
- TEEDは6エポック未満で収束し、トレーニング時間は30分未塔であり、迅速な収束と低いトレーニングコストを実証した。
- 複雑なシーンに密集したエッジが存在する場合でも、PiDiNet や EDTER などのSOTAモデルよりも、より鋭くクリアなエッジマップを生成した。
- TEEDは未観測のデータセットに対しても良好に一般化され、BIPEDでのみ学習したにもかかわらず、スケッチベース画像検索タスクで優れた性能を発揮した。
- UDEDデータセットは知覚的エッジ多様性を効果的に捉えており、一般化能力の公平な評価を可能にした。標準ベンチマークでの性能は、下流タスクでの成功を保証しないことが明らかになった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。