Skip to main content
QUICK REVIEW

[論文レビュー] Collapsible Linear Blocks for Super-Efficient Super Resolution

Kartikeya Bhardwaj, Miloš Milosavljević|arXiv (Cornell University)|Mar 17, 2021
Advanced Image Processing Techniques参考文献 38被引用数 10
ひとこと要約

本稿では、推論時に解析的に畳み込み層に統合可能な可収縮線形ブロックを用いる、計算効率に優れた新規CNNアーキテクチャ「Super-Efficient Super Resolution (SESR)」を提案する。このアーキテクチャにより、画像品質を損なわずに計算コストを大幅に削減でき、従来モデル比で2倍から330倍のMAC演算を削減する。これにより、モバイルNPU上で1080pから4K(×2)および1080pから8K(×4)へのリアルタイム超解像が可能となり、既存手法に比べ最大8倍のFPS向上を達成する。

ABSTRACT

With the advent of smart devices that support 4K and 8K resolution, Single Image Super Resolution (SISR) has become an important computer vision problem. However, most super resolution deep networks are computationally very expensive. In this paper, we propose Super-Efficient Super Resolution (SESR) networks that establish a new state-of-the-art for efficient super resolution. Our approach is based on linear overparameterization of CNNs and creates an efficient model architecture for SISR. With theoretical analysis, we uncover the limitations of existing overparameterization methods and show how the proposed method alleviates them. Detailed experiments across six benchmark datasets demonstrate that SESR achieves similar or better image quality than state-of-the-art models while requiring 2x to 330x fewer Multiply-Accumulate (MAC) operations. As a result, SESR can be used on constrained hardware to perform x2 (1080p to 4K) and x4 (1080p to 8K) SISR. Towards this, we estimate hardware performance numbers for a commercial Arm mobile-Neural Processing Unit (NPU) for 1080p to 4K (x2) and 1080p to 8K (x4) SISR. Our results highlight the challenges faced by super resolution on AI accelerators and demonstrate that SESR is significantly faster (e.g., 6x-8x higher FPS) than existing models on mobile-NPU. Finally, SESR outperforms prior models by 1.5x-2x in latency on Arm CPU and GPU when deployed on a real mobile device. The code for this work is available at https://github.com/ARM-software/sesr.

研究の動機と目的

  • リソース制約のあるモバイルデバイスにおける単一画像超解像(SISR)のための従来の深層CNNの計算非効率性を解決すること。
  • 画像品質(PSNR)と計算コスト(MAC演算)のトレードオフにおける新たなパレートフロンティアを確立すること。
  • 正確かつ極めて効率的なモデル設計により、モバイルNPU上でリアルタイムの×2および×4 SISRを実現すること。
  • RepVGGのような既存の線形過パラメータ化手法に内在する理論的限界、特に浅いネットワークでは勾配更新に利点がないことへの対処。
  • エンドツーエンドのデプロイとオープンソースのパフォーマンス推定を用いて、実際のモバイルハードウェア(CPU、GPU、NPU)における実用的パフォーマンス向上を実証すること。

提案手法

  • 推論時に解析的に統合可能な可収縮線形ブロックを提案。過パラメータ化された線形畳み込み層の系列を推論時のみに単一の狭い畳み込み層に統合することで、MAC演算量を削減しつつアーキテクチャの変更なしに実現。
  • 線形過パラメータ化を用いて学習安定性と一般化性能を向上させるとともに、トレーニング後における正確なパラメータ圧縮を可能にする。
  • 既存の過パラメータ化技術を理論的に分析し、RepVGGのような手法が浅いネットワークでは勾配更新に変化をもたらさないことを示す。
  • 過パラメータ化されたブロック構造をトレーニング段階で使用するが、推論時には単一の層に統合する、修正されたトレーニングプロトコルを採用。これにより、モデルの正確性を保持しつつ推論コストを削減。
  • NPUパフォーマンス向上のため、カーネル形状(偶数サイズおよび非対称カーネルなど)の最適化を目的としたニューラルアーキテクチャ探索(NAS)を適用。
  • Arm Ethos-U55およびEthos-N78 NPUにおける推論パフォーランスを予測・検証するために、オープンソースのNPUパフォーマンス推定ツール(例:Vela)を活用。

実験結果

リサーチクエスチョン

  • RQ1線形過パラメータ化を活用することで、モバイルデプロイに適した正確かつ高効率なSISRモデルを構築可能か?
  • RQ2RepVGGのような既存の過パラメータ化手法は、浅いネットワークにおいて実際の学習優位性を提供するのか、それとも勾配ダイナミクスに変化をもたらさないのか?
  • RQ3可収縮線形ブロックは、複数のベンチマークでSISRの品質-計算コストトレードオフにおいて新たなパレートフロンティアを達成できるか?
  • RQ4CPU、GPU、NPUといった実際のモバイルハードウェア上でのSESRの遅延およびFPSは、既存手法に比べてどのように向上しているか?
  • RQ5NASによるカーネル最適化は、正確性を損なわず、モバイルNPUにおける推論速度をさらに向上させられるか?

主な発見

  • SESRは、6つのベンチマークデータセットで、最先端のSISRモデルと比較して2倍から330倍のMAC演算を削減しながら、PSNRを維持または向上させた。
  • 4-TOP/sのArm Ethos-N78モバイルNPU上で、1080pから4K(×2)SISRの際、SESRは既存手法に比べ6倍から8倍のFPSを達成。一部のバージョンでは60 FPSを超えた。
  • 1080pから8K(×4)SISRの際、同じNPU上でのSESRの最大速度は22 FPSに達し、FSRCNNの6 FPSを大きく上回った。
  • 実際のモバイルハードウェア(Arm Cortex-A77 CPUおよびMali-G78 GPU)上では、SESR-M5は×2および×4 SISRタスクの両方で、FSRCNNと比較して遅延を1.5倍から2倍まで短縮した。
  • より小さいサイズ、偶数サイズ、非対称カーネルを用いたNAS最適化されたSESRネットワークは、SESR-M5と同等の正確性を維持しながら、NPU上での推論時間を15%短縮した。
  • Velaを用いたオープンソースのNPUパフォーマンス推定により、SESR-M5がArm Ethos-U55(0.5 TOP/s)で22.67 FPSを達成したことが確認され、FSRCNNの2.71 FPSに比べ8.4倍の向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。