Skip to main content
QUICK REVIEW

[論文レビュー] Network Augmentation for Tiny Deep Learning

Han Cai, Chuang Gan|arXiv (Cornell University)|Oct 17, 2021
Advanced Neural Network Applications被引用数 10
ひとこと要約

本稿では、従来の正則化手法が限られたモデル容量のため悪化させる過小適合問題を解消するために、小さなニューラルネットワークをより大きなアーキテクチャ内でのサブモデルとして訓練することで、その性能を向上させる手法であるNetwork Augmentation(NetAug)を提案する。NetAugは、画像分類とオブジェクト検出の両方で、推論コストを一切増加させずにImageNetの精度を最大2.2%向上させ、オブジェクト検出ベンチマークではMACsを38–41%削減する。

ABSTRACT

We introduce Network Augmentation (NetAug), a new training method for improving the performance of tiny neural networks. Existing regularization techniques (e.g., data augmentation, dropout) have shown much success on large neural networks by adding noise to overcome over-fitting. However, we found these techniques hurt the performance of tiny neural networks. We argue that training tiny models are different from large models: rather than augmenting the data, we should augment the model, since tiny models tend to suffer from under-fitting rather than over-fitting due to limited capacity. To alleviate this issue, NetAug augments the network (reverse dropout) instead of inserting noise into the dataset or the network. It puts the tiny model into larger models and encourages it to work as a sub-model of larger models to get extra supervision, in addition to functioning as an independent model. At test time, only the tiny model is used for inference, incurring zero inference overhead. We demonstrate the effectiveness of NetAug on image classification and object detection. NetAug consistently improves the performance of tiny models, achieving up to 2.2% accuracy improvement on ImageNet. On object detection, achieving the same level of performance, NetAug requires 41% fewer MACs on Pascal VOC and 38% fewer MACs on COCO than the baseline.

研究の動機と目的

  • 限られたモデル容量のため従来の正則化手法が悪化させる小さなニューラルネットワークにおける過小適合問題に対処すること。
  • 推論コストを増加させることなく、画像分類およびオブジェクト検出タスクにおける小さなモデルの性能を向上させること。
  • データや重みレベルのノイズではなく、アーキテクチャの拡張を通じた追加の監視を提供する訓練手法を開発すること。
  • 小さなモデルに対して、正則化ではなくネットワーク拡張がより効果的であることを示すこと。
  • リソース制限のあるエッジデバイスにおけるより良い転移学習と効率性のトレードオフを可能にすること。

提案手法

  • NetAugは、訓練中に小さなニューラルネットワークを、自身のより大きな、広いバージョンのネットワーク内でのサブモデルとして訓練し、勾配と重みを共有する。
  • この手法は逆ドロップアウト機構を適用し、小さなモデルをより大きなモデルに埋め込んで追加の監視を受ける。
  • 訓練中、より大きなモデルからの勾配を用いて小さなモデルのパラメータを精緻化し、学習能力を向上させる。
  • 推論時、元の小さなモデルのみを用いるため、推論オーバーヘッドはゼロである。
  • このアプローチは知識蒸留と互換性があり、他の技術と組み合わせることでさらなる性能向上が可能である。
  • この手法は、ImageNet、細分化分類データセット、およびオブジェクト検出ベンチマーク(Pascal VOC、COCO)を含む複数のデータセットに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャの拡張は、小さなニューラルネットワークに対して従来の正則化手法を上回る効果を示せるか?
  • RQ2大きなネットワーク内のサブモデルとして小さなモデルを訓練することで、過小適合が緩和され、精度が向上するか?
  • RQ3NetAugは、細分化画像分類やオブジェクト検出などの下流タスクで性能向上を達成できるか?
  • RQ4NetAugは、MACsやメモリ使用量の観点から、より良いモデルの効率性トレードオフを実現できるか?
  • RQ5転移学習の文脈で、NetAugは知識蒸留や延長された訓練と比較してどのように評価されるか?

主な発見

  • NetAugは、MobileNetV2-TinyでImageNetのトップ-1精度を最大2.2%向上させ、正則化手法を著しく上回る。
  • オブジェクト検出においては、Pascal VOCでMACsを41%、COCOで38%削減しながら、mAPを維持または向上させた。
  • ImageNetでは、わずか16.7%の追加訓練コストで1.6%の精度向上を達成し、推論オーバーヘッドはゼロであった。
  • 転移学習において、NetAugで事前学習されたモデルは、知識蒸留や長時間の訓練で事前学習されたモデルよりも、Cub200 や Pets などの細分化データセットで優れた性能を示した。
  • NetAugは、より小さな入力解像度でも精度を損なわずに、オブジェクト検出タスクでより良いパフォーマンス-効率トレードオフを実現した。
  • 大規模モデルで有効な検出混合(Detection Mixup)は、小さなモデルでは性能を低下させ、過小適合の問題が分類を越えて継続することを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。