Skip to main content
QUICK REVIEW

[論文レビュー] ParC-Net: Position Aware Circular Convolution with Merits from ConvNets and Transformer

Haokui Zhang, Wenze Hu|arXiv (Cornell University)|Mar 8, 2022
Advanced Image and Video Retrieval Techniques被引用数 6
ひとこと要約

ParC-Net は、ビジョントランスフォーマーからのグローバルモデリングと、畳み込みニューラルネットワーク(ConvNets)からの局所的なインダクティブバイアスを、位置に敏感な円形畳み込み(ParC)を用いて統合した、軽量で純粋なConvNetアーキテクチャである。ParCとメタフォーマー・ブロック、チャネルごとのアテンションを組み合わせることで、エッジデバイス上でMobileViT や DeiT を上回る精度(ImageNet-1k でトップ-1 78.6%)、パラメータ効率、推論速度を達成した。

ABSTRACT

Recently, vision transformers started to show impressive results which outperform large convolution based models significantly. However, in the area of small models for mobile or resource constrained devices, ConvNet still has its own advantages in both performance and model complexity. We propose ParC-Net, a pure ConvNet based backbone model that further strengthens these advantages by fusing the merits of vision transformers into ConvNets. Specifically, we propose position aware circular convolution (ParC), a light-weight convolution op which boasts a global receptive field while producing location sensitive features as in local convolutions. We combine the ParCs and squeeze-exictation ops to form a meta-former like model block, which further has the attention mechanism like transformers. The aforementioned block can be used in plug-and-play manner to replace relevant blocks in ConvNets or transformers. Experiment results show that the proposed ParC-Net achieves better performance than popular light-weight ConvNets and vision transformer based models in common vision tasks and datasets, while having fewer parameters and faster inference speed. For classification on ImageNet-1k, ParC-Net achieves 78.6% top-1 accuracy with about 5.0 million parameters, saving 11% parameters and 13% computational cost but gaining 0.2% higher accuracy and 23% faster inference speed (on ARM based Rockchip RK3288) compared with MobileViT, and uses only 0.5 times parameters but gaining 2.7% accuracy compared with DeIT. On MS-COCO object detection and PASCAL VOC segmentation tasks, ParC-Net also shows better performance. Source code is available at https://github.com/hkzhang91/ParC-Net

研究の動機と目的

  • 畳み込みニューラルネットワーク(ConvNets)の利点を保ちつつ、ビジョントランスフォーマーからのグローバルモデリング能力を統合した、軽量で純粋なConvNetを設計すること。
  • 標準畳み込みの受容 field の制限を克服するため、位置に敏感な円形畳み込み(ParC)を導入し、空間的構造を保持しながらグローバルなコンテキストを捉えること。
  • メタフォーマー・ブロック設計とチャネルごとのアテンションを組み合わせることで、動的特徴精錬を可能にし、モバイルおよびエッジデバイスでのパフォーマンスを向上させること。
  • リソース制限のあるハードウェア上で、MobileViT や DeiT と同様の軽量モデルに比べ、より高い精度、少ないパラメータ、より速い推論を達成すること。

提案手法

  • 位置に敏感な円形畳み込み(ParC)を提案。円形パディングを適用し、位置埋め込みを学習することで、空間的構造を維持しながらグローバルな受容 field を実現する。
  • ビジョントランスフォーマーの自己アテンション機構を、畳み込み操作のみで模倣できるように、メタフォーマー・ブロックアーキテクチャとParCを統合する。
  • フィードフォワードネットワーク(FFN)パスにチャネルごとのアテンションを適用し、入力依存の動的カーネル重み付けを可能にし、特徴表現を強化する。
  • MobileViT や CoatNet と同様の分岐構造(bifurcate network structure)を採用し、段階ごとに局所的およびグローバルな特徴学習のバランスをとる。
  • アーキテクチャの大幅な見直しを必要とせず、既存のConvNet やトランスフォーマー・アーキテクチャにParCブロックを簡単に挿入可能なプラグアンドプレイ設計を採用する。
  • Rockchip RK3288 や DP2000 といった低消費電力チップ上で、高度に最適化された畳み込み演算子と効率的な推論パイプラインを用いてエッジデプロイに最適化する。

実験結果

リサーチクエスチョン

  • RQ1純粋なConvNetアーキテクチャは、エッジデバイス上でハードウェア効率を保ちながら、ビジョントランスフォーマーと同等のパフォーマンスを達成できるか?
  • RQ2自己アテンション機構に依存せずに、畳み込みネットワークに効果的かつ効率的にグローバルな受容 field を実装する方法は何か?
  • RQ3位置に敏感な円形畳み込みは、長距離特徴集約を可能にしつつ、空間的構造をどの程度保持できるか?
  • RQ4メタフォーマー・ブロック設計とチャネルごとのアテンションをConvNetに統合することで、モデル複雑性を増加させずに視覚タスクのパフォーマンスを向上させられるか?
  • RQ5提案されたParC-Netは、低消費電力ハードウェア上で、最先端の軽量モデルよりも高速な推論と低い計算コストを達成できるか?

主な発見

  • ParC-Net は、ImageNet-1k で500万パラメータで78.6%のトップ-1精度を達成し、MobileViT よりも精度(+0.2%)と推論速度(Rockchip RK3288 で23%速い)で優れている。
  • MobileViT より11%少ないパラメータ、13%少ないFLOPsを実現しながらも、高い精度を維持しており、パラメータ効率に優れていることが示された。
  • DP2000 低消費電力プロセッサ上では、ParC-Net はMobileViT より3.77倍速く動作し、ハードウェア効率とエッジデバイス適合性を裏付けた。
  • ParC-Net は、パラメータ数が少ないにもかかわらず、MS-COCO オブジェクト検出およびPASCAL VOC セグメンテーションタスクでmAPとmIOUを他の軽量モデルより向上させた。
  • アブレーションスタディの結果、ParC、メタフォーマー・ブロック、チャネルごとのアテンションのすべてのコンponents が不可欠であることが確認された。いずれかを削除すると、特に位置に敏感なタスクでパフォーマンスが著しく低下した。
  • プラグアンドプレイ設計のParCブロックは、ResNet50 や MobileNetV2、ConvNeXt-T といった既存モデルに挿入可能で、あらゆるアーキテクチャで一貫して精度と効率が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。