Skip to main content
QUICK REVIEW

[論文レビュー] RevBiFPN: The Fully Reversible Bidirectional Feature Pyramid Network

Vitaliy Chiley, Vithursan Thangarasa|arXiv (Cornell University)|Jun 28, 2022
Advanced Neural Network Applications被引用数 11
ひとこと要約

本稿では、活性化の記憶を排除する可逆計算を用いることで、高解像度でマルチスケールなネットワークの効率的な学習を可能にする、完全に可逆な双方向特徴ピラミッドネットワーク、RevBiFPNを提案する。この手法は、EfficientNetと比較して最大19.8倍、HRNetと比較して2.4倍の少ない学習メモリを実現しながら、画像分類、検出、セグメンテーションの分野で最先端の性能を達成しており、MS COCO上で最大2.5%のAP向上を実現した。

ABSTRACT

This work introduces RevSilo, the first reversible bidirectional multi-scale feature fusion module. Like other reversible methods, RevSilo eliminates the need to store hidden activations by recomputing them. However, existing reversible methods do not apply to multi-scale feature fusion and are, therefore, not applicable to a large class of networks. Bidirectional multi-scale feature fusion promotes local and global coherence and has become a de facto design principle for networks targeting spatially sensitive tasks, e.g., HRNet (Sun et al., 2019a) and EfficientDet (Tan et al., 2020). These networks achieve state-of-the-art results across various computer vision tasks when paired with high-resolution inputs. However, training them requires substantial accelerator memory for saving large, multi-resolution activations. These memory requirements inherently cap the size of neural networks, limiting improvements that come from scale. Operating across resolution scales, RevSilo alleviates these issues. Stacking RevSilos, we create RevBiFPN, a fully reversible bidirectional feature pyramid network. RevBiFPN is competitive with networks such as EfficientNet while using up to 19.8x lesser training memory for image classification. When fine-tuned on MS COCO, RevBiFPN provides up to a 2.5% boost in AP over HRNet using fewer MACs and a 2.4x reduction in training-time memory.

研究の動機と目的

  • マルチスケール特徴統合を用いる深層的で高解像度なネットワークの学習にかかる高いメモリコストに対処すること。
  • 既存の可逆手法では双方向のマルチスケール特徴統合をサポートできないという制限を克服すること。
  • 検出やセグメンテーションのような空間に敏感なタスクに適した、スケーラブルでメモリ効率の良い最先端のビジョンモデルの学習を可能にすること。
  • 中間活性化を保存せずに前向き計算と後向き計算の両方をサポートする可逆モジュールを設計すること。
  • 可逆なマルチスケール統合が、標準的なBiFPNやHRNetアーキテクチャを上回る精度と効率を達成できることを実証すること。

提案手法

  • バックプロパゲーション中に特徴を再計算することで、活性化フリーな学習を可能にする、新しい可逆な双方向マルチスケール特徴統合モジュール、RevSiloを提案する。
  • 複数の特徴スケールにわたる双方向統合をサポートするようにRevSiloを設計し、局所的およびグローバルな空間的一致性を維持する。
  • 可逆計算を用いることで、ネットワークの深さに応じて線形から定数にまで活性化メモリの複雑さを削減する。
  • RevSiloモジュールをスタックして、BiFPNアーキテクチャの完全に可逆なバージョン、RevBiFPNを構築する。
  • MBConvを主な構築ブロックとして使用し、メモリ制限のあるハードウェアでも効率的な学習を可能にする、標準的なビジョンモデルにRevBiFPNを統合する。
  • ネットワークの深さ、幅、入力解像度を効率的にスケーリングするための高速スケーリング(Fast Scaling)を適用する。

実験結果

リサーチクエスチョン

  • RQ1可逆計算をビジョンネットワークにおける双方向マルチスケール特徴統合に効果的に拡張できるか?
  • RQ2可逆なマルチスケール統合は、モデルの精度を損なわずに学習メモリをどの程度削減できるか?
  • RQ3EfficientNet や HRNet といったSOTAモデルと比較して、RevBiFPNは精度、MACs、メモリ使用量の観点でどの程度優れているか?
  • RQ4メモリ制約下でも、検出やセグメンテーションタスクにおいて、RevBiFPNはより大きなバッチサイズと高い入力解像度を可能にするか?
  • RQ5マルチスケール特徴統合における可逆計算は、分類を越えて他のアーキテクチャやタスクにも一般化可能か?

主な発見

  • ImageNetにおけるトップ-1精度は84.3%に達し、学習メモリは5.05 GBを要するが、EfficientNet-B7と同等の容量にスケーリングした場合、ベースラインと比較して19.8倍も少ないメモリを使用する。
  • MS COCOオブジェクト検出タスクにおいて、RevBiFPN-S6はHRNetV2p-W32と比較して2.4%高いBbox APと2.0%高いMask APを達成しており、学習時のGPUメモリは1.6 GBも少ない。
  • HRNetV2p-W48を2倍スケジュールで学習しても、依然として1倍スケジュールのRevBiFPN-S6を上回らないことから、RevBiFPNの優れたメモリ効率が裏付けられる。
  • RevBiFPN-S2はCOCO上でHRNetV2p-W18と同等の性能を発揮するが、MACsは1.2倍少なく、メモリは2.5倍も少ないことから、その効率性の向上が顕著に現れている。
  • RevBiFPNは、検出やセグメンテーションタスクにおいて、より大きなバッチサイズと高い入力解像度を可能にし、学習の安定性と性能を向上させる。
  • 本手法は、将来的にResNet やTransformer などの他のアーキテクチャ、およびプルーニング や量子化などの推論技術への応用も可能であり、広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。