Skip to main content
QUICK REVIEW

[論文レビュー] Enhancing sensor resolution improves CNN accuracy given the same number of parameters or FLOPS

Ali Borji|arXiv (Cornell University)|Mar 9, 2021
Advanced Neural Network Applications参考文献 2被引用数 4
ひとこと要約

この論文は、モデルのパラメータ数やFLOPSを増やさずに、計算リソース予算を維持するようにネットワーク層を体系的に再設計することで、入力画像の解像度を向上させることでCNNの精度が向上することを示している。主な貢献は、解像度そのものがモデル容量とは独立して性能を向上させることを証明し、4つの解像度に適応したアーキテクチャ変換手法を提案することにある。

ABSTRACT

High image resolution is critical to obtain a good performance in many computer vision applications. Computational complexity of CNNs, however, grows significantly with the increase in input image size. Here, we show that it is almost always possible to modify a network such that it achieves higher accuracy at a higher input resolution while having the same number of parameters or/and FLOPS. The idea is similar to the EfficientNet paper but instead of optimizing network width, depth and resolution simultaneously, here we focus only on input resolution. This makes the search space much smaller which is more suitable for low computational budget regimes. More importantly, by controlling for the number of model parameters (and hence model capacity), we show that the additional benefit in accuracy is indeed due to the higher input resolution. Preliminary empirical investigation over MNIST, Fashion MNIST, and CIFAR10 datasets demonstrates the efficiency of the proposed approach.

研究の動機と目的

  • 高解像度でのCNN精度向上が、解像度そのものに起因するのか、それともモデル容量の増加に起因するのかを調査すること。
  • パrameter数やFLOPSを同じに保ちながら、入力解像度を向上させることのできる手法を開発すること。
  • 計算リソース予算を固定した条件下で、解像度のみに最適化することで実用的な精度向上を実現すること。
  • 完全なNASやEfficientNet風の多次元探索とは対照的に、スケーラブルで低予算の代替手法を提供すること。

提案手法

  • パrameter数やFLOPSを維持しつつ、より高い解像度の入力を処理できるように既存のCNNレイヤーを再構成する4つの手法(I–IV)を提案する。
  • 手法Iは、ストライド付き畳み込みとアダプティブ平均プーリングを用いて、解像度とFLOPSを維持する。
  • 手法IIは、畳み込み層後の特徴マップサイズとFLOPSを維持するように、カーネルサイズとストライドを調整する。
  • 手法IIIは、複数のレイヤーにわたって解像度とFLOPSを維持するように、プーリング層と畳み込み層を変更する。
  • 手法IVは、拡張畳み込み(dilated convolutions)とカーネルサイズの調整を用いて、FLOPSを増やさずに受容 field を拡大し、解像度を向上させる。
  • MNIST、Fashion-MNIST、CIFAR-10のデータセット上で、解像度、カーネルサイズ、ストライド、パディングのグリッドサーチを用いて手法を実証的に評価する。

実験結果

リサーチクエスチョン

  • RQ1パrameter数とFLOPSを固定した場合、高解像度の入力がCNNの精度向上に寄与するのか、モデル容量の増加に起因するのか?
  • RQ2パrameter数やFLOPSを同じに保ちながら、CNNを高解像度入力に対応できるように体系的に再設計できるか?
  • RQ3固定された計算リソース予算下で、解像度強化に最も効果的なアーキテクチャ変換技術は何か?
  • RQ4高解像度による性能向上は、モデル容量の増加ではなく、空間的な細分化された特徴表現に起因するのか?

主な発見

  • パrameter数とFLOPSを固定した状態で、高解像度の入力がCNNの精度を一貫して向上させることを示しており、解像度そのものが性能向上に寄与することが証明された。
  • 拡張畳み込みとカーネルサイズの調整を用いる手法IVが、特に解像度の低い状態でより大きな精度向上を達成しており、最良の性能を示した。
  • 平均プーリングに依存する手法Iは、解像度が上昇するにつれて特徴マップの収縮に起因する情報損失のため、性能が劣化した。
  • 手法IIとIIIはわずかな改善にとどまり、効果的な解像度スケーリングを実現するには、レイヤーの再構成に細心の注意を払う必要があることが示された。
  • 結果から、同じモデル容量のままでも、高解像度から得られる空間的な細分化された情報がCNNによって有効に利用可能であることが確認された。
  • すべてのデータセットにおいて、同じFLOPSまたはパrameter数のまま、元のモデルを上回る性能を持つ高解像度モデルを容易に見つけることができる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。