Skip to main content
QUICK REVIEW

[論文レビュー] Highly Efficient Salient Object Detection with 100K Parameters

Shanghua Gao, Yongqiang Tan|arXiv (Cornell University)|Mar 12, 2020
Visual Attention and Saliency Detection参考文献 91被引用数 12
ひとこと要約

本稿では、100Kパラメータのみを有する非常に効率的な顕著オブジェクト検出モデルであるCSNetを提案する。gOctConvモジュールを用いて、段階間および段階内での柔軟なマルチスケール特徴の統合を可能にした。また、パラメータスパarsityを促進する新しい動的重み減衰スキームを導入し、性能の著しい低下を伴わず80%のパラメータ削減を実現。これにより、ImageNetの事前学習を一切用いずにトレーニング可能でありながら、SODベンチマークで最先端の性能を達成した。

ABSTRACT

Salient object detection models often demand a considerable amount of computation cost to make precise prediction for each pixel, making them hardly applicable on low-power devices. In this paper, we aim to relieve the contradiction between computation cost and model performance by improving the network efficiency to a higher degree. We propose a flexible convolutional module, namely generalized OctConv (gOctConv), to efficiently utilize both in-stage and cross-stages multi-scale features, while reducing the representation redundancy by a novel dynamic weight decay scheme. The effective dynamic weight decay scheme stably boosts the sparsity of parameters during training, supports learnable number of channels for each scale in gOctConv, allowing 80% of parameters reduce with negligible performance drop. Utilizing gOctConv, we build an extremely light-weighted model, namely CSNet, which achieves comparable performance with about 0.2% parameters (100k) of large models on popular salient object detection benchmarks.

研究の動機と目的

  • 既存の顕著オブジェクト検出(SOD)モデルの高い計算コストが、低パワーデバイスへの展開を制限している問題に対処すること。
  • ネットワーク段階間および段階内でのマルチスケール特徴の効率的統合により、SODにおけるモデルの冗長性を低減すること。
  • 性能の劣化を最小限に抑えつつ、極端なモデル圧縮を実現すること、特にパラメータスパarsityと学習可能なチャネルプルーニングに焦点を当てる。
  • ImageNetの事前学習に依存しない、軽量なSODモデルを設計すること。
  • 最小限のパラメータで最先端の性能を達成し、エッジデバイスでのリアルタイム推論を実現すること。

提案手法

  • 段階内および段階間の両方の特徴から任意のスケール数をサポートする、柔軟な畳み込みモジュールである一般化OctConv(gOctConv)を提案する。
  • トレーニング中にチャネルスパarsityを安定化させるとともに、各スケールごとの学習可能なチャネル数を可能にする、動的重み減衰スキームを導入する。
  • 動的重み減衰を用いてスパarsityを促進し、性能の著しい低下を伴わず最大80%のパラメータ削減を実現する。
  • gOctConvモジュールを用いて構築された軽量なSODモデルであるCSNetを設計し、ImageNetの事前学習を一切用いずにトレーニング可能である。
  • より広いトレーニング空間を探索し、圧縮後のモデル品質を向上させるために、チャネル幅の拡張戦略を採用し、その後プルーニングを実施する。
  • ネットワークの深さおよび解像度レベルにおける特徴の利用状況を分析するため、学習済みチャネル分布を可視化する。

実験結果

リサーチクエスチョン

  • RQ1100Kパラメータ未満で、最先端の性能を維持しつつ、極めて効率的なSODモデルを構築可能か?
  • RQ2段階間および段階内でのマルチスケール特徴表現を効率的に統合することで、冗長性を低減できるか?
  • RQ3動的重み減衰が、モデルの精度を維持したままパラメータスパarsityを効果的に促進できるか?
  • RQ4ImageNetの事前学習に依存せずに、軽量なSODモデルをどれほど効果的にトレーニングできるか?
  • RQ5標準的またはヴァナイルなOctConvと比較して、本稿で提案するgOctConvモジュールは、SODタスクにおける柔軟性および効率性においてどのように優れているか?

主な発見

  • CSNetは、100Kパラメータというわずかな数で、大規模な最先端モデルと同等の性能を達成しており、大規模モデルの約0.2%のパラメータ数に相当する。
  • 動的重み減衰スキームにより、性能の著しい低下を伴わず最大80%のパラメータ削減が可能であり、トレーニング中に安定したスパarsityが維持された。
  • ImageNetの事前学習を一切用いずにトレーニングされたCSNetは、複数の既存の軽量モデルを上回るF-measureを達成し、他のタスク向けに設計されたモデルと比較して最大6%高いF-measureを記録した。また、推論速度は10倍速い。
  • 標準的な重み減衰と比較して、動的重み減衰を用いたモデルは、特に深層部においてより安定したチャネル分布を示した。
  • プルーニング実験の結果、初期チャネル幅を大きくすることで性能が向上し、圧縮後のモデルは初期モデルの性能を維持またはわずかに上回ることが確認された。
  • 実行時評価では、CSNetはPiCANet や PoolNet といった大規模モデルと比較して、単一コアCPU上でも10倍以上の高速化を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。