Skip to main content
QUICK REVIEW

[論文レビュー] GhostSR: Learning Ghost Features for Efficient Image Super-Resolution

Ying Nie, Kai Han|arXiv (Cornell University)|Jan 21, 2021
Advanced Image Processing Techniques参考文献 53被引用数 21
ひとこと要約

GhostSRは、冗長な畳み込みフィルタを学習可能なシフト操作に置き換えることで、『ゴースト特徴』を生成する軽量な画像超解像手法を提案する。この手法により、モデルの複雑さが顕著に低減される。事前学習済み特徴をクラスタリングして内在的なフィルタを特定し、微分可能シフト操作を適用することで、ベースラインのEDSRと比較して、パラメータ数を最大46%削減し、FLOPsを46%、GPU待機時間も42%低減するが、ベンチマークデータセットでの性能はほぼ損なわれない。

ABSTRACT

Modern single image super-resolution (SISR) system based on convolutional neural networks (CNNs) achieves fancy performance while requires huge computational costs. The problem on feature redundancy is well studied in visual recognition task, but rarely discussed in SISR. Based on the observation that many features in SISR models are also similar to each other, we propose to use shift operation to generate the redundant features (i.e., ghost features). Compared with depth-wise convolution which is time-consuming on GPU-like devices, shift operation can bring a practical inference acceleration for CNNs on common hardwares. We analyze the benefits of shift operation on SISR task and make the shift orientation learnable based on Gumbel-Softmax trick. Besides, a clustering procedure is explored based on pre-trained models to identify the intrinsic filters for generating intrinsic features. The ghost features will be derived by moving these intrinsic features along a specific orientation. Finally, the complete output features are constructed by concatenating the intrinsic and ghost features together. Extensive experiments on several benchmark models and datasets demonstrate that both the non-compact and lightweight SISR models embedded with the proposed method can achieve a comparable performance to that of their baselines with a large reduction of parameters, FLOPs and GPU inference latency. For instance, we reduce the parameters by 46%, FLOPs by 46% and GPU inference latency by 42% of $ imes2$ EDSR network with basically lossless performance.

研究の動機と目的

  • 現代のSISRモデルにおける高い計算コストが冗長な特徴に起因する問題に対処すること。
  • 分類タスクにおける応用と同様に、超解像ネットワークにおける特徴の冗長性を調査すること。
  • 実行時の高速化を実現するため、高価なディープワイド畳み込みを、より効率的でハードウェアにやさしい操作に置き換えること。
  • より良い特徴表現を得るために、方向を適応的に学習可能な微分可能シフト機構を開発すること。
  • 事前学習モデルのクラスタリングを統合し、効率的なゴースト特徴生成に適した内在的フィルタを特定すること。

提案手法

  • ゴースト特徴を生成するための、ディープワイド畳み込みの安価な代替手段として、学習可能なシフト操作を導入する。
  • シフト方向を微分可能かつ学習可能にするために、Gumbel-Softmaxのテクニックを用いる。
  • ベース特徴を生成する内在的フィルタを特定するために、事前学習済みモデルに対してクラスタリング手順を適用する。
  • 内在的特徴とゴースト特徴を連結することで最終的な特徴を構築し、ゴースト特徴は内在的特徴に対する学習可能なシフト操作によって生成する。
  • 内在的フィルタとシフト操作を同時に学習可能な、微分可能なアーキテクチャを用いて、エンドツーエンドでモデルを訓練する。
  • 効率性と性能のバランスを取るために、ゴースト特徴の割合(λ)を最適化する。

実験結果

リサーチクエスチョン

  • RQ1GPU上で実用的な高速化を実現するため、シフト操作がSISRモデルにおける冗長な特徴生成にディープワイド畳み込みを効果的に置き換えることができるか?
  • RQ2Gumbel-Softmaxを用いてシフト方向を学習することで、固定またはコピーベースの手法と比較して、特徴表現が向上するか?
  • RQ3事前学習済みモデルのクラスタリングが、ゴースト特徴生成に適した重要な特徴を保持する内在的フィルタを信頼性を持って特定できるか?
  • RQ4SISRモデルにおけるモデル効率性と性能のバランスを最適化するための最適なゴースト特徴の割合(λ)は何か?
  • RQ5GhostSRは、競争力のあるPSNR/SSIMスコアを維持しながら、パラメータ数、FLOPs、推論待機時間をどの程度削減できるか?

主な発見

  • ×2 EDSRモデルにおいて、GhostSRはパラメータ数を46%削減し、FLOPsを46%、GPU推論待機時間を42%低減したが、性能の低下はほとんどなかった。
  • 可視化結果から、単純なコピー操作よりも、学習可能なシフト操作がテクスチャやエッジの保持という点で特徴品質を向上させていることが示された。
  • 事前学習済みモデルのクラスタリングを用いることで、学習を初期から行う場合と比較して、Urban100データセットで0.13 dBのPSNR向上が達成された。
  • 最適なゴースト特徴割合(λ = 0.25)は、全データセットで0.04–0.08 dBのPSNR向上をもたらし、モデルサイズと待機時間を低減した。
  • Set5データセットでは、元のCARNモデル(1.59Mパラメータ、119G FLOPs)と比較して、1.33Mパラメータ、96G FLOPsで0.04 dBのPSNR向上を達成した。
  • モデルは高い知覚的品質を維持しており、全データセットでベースラインとSSIM値の差が0.0006以内に収まっていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。