Skip to main content
QUICK REVIEW

[論文レビュー] See More Than Once -- Kernel-Sharing Atrous Convolution for Semantic Segmentation

Ye Huang, Qingqing Wang|arXiv (Cornell University)|Aug 26, 2019
Advanced Neural Network Applications参考文献 27被引用数 13
ひとこと要約

本論文では、複数の並列ブランチが同じカーネルを共有する新しいセマンティックセグメンテーションモジュールであるKernel-Sharing Atrous Convolution (KSAC) を提案する。各ブランチは異なるアトラスレートを用い、同一の入力特徴マップを複数回スキャンすることで、1つのカーネルが異なる受容 field を持つようにする。この設計により、特徴表現力と一般化性能が向上し、パラメータ数を33%削減するとともに、MobileNetV2を用いたPASCAL VOC 2012ではmIOUが0.6%向上、Xceptionを用いた場合は2.62%向上した。モデルサイズや推論コストの増加なしに実現された。

ABSTRACT

The state-of-the-art semantic segmentation solutions usually leverage different receptive fields via multiple parallel branches to handle objects with different sizes. However, employing separate kernels for individual branches degrades the generalization and representation abilities of the network, and the number of parameters increases linearly in the number of branches. To tackle this problem, we propose a novel network structure namely Kernel-Sharing Atrous Convolution (KSAC), where branches of different receptive fields share the same kernel, i.e., let a single kernel see the input feature maps more than once with different receptive fields, to facilitate communication among branches and perform feature augmentation inside the network. Experiments conducted on the benchmark PASCAL VOC 2012 dataset show that the proposed sharing strategy can not only boost a network s generalization and representation abilities but also reduce the model complexity significantly. Specifically, on the validation set, whe compared with DeepLabV3+ equipped with MobileNetv2 backbone, 33% of parameters are reduced together with an mIOU improvement of 0.6%. When Xception is used as the backbone, the mIOU is elevated from 83.34% to 85.96% with about 10M parameters saved. In addition, different from the widely used ASPP structure, our proposed KSAC is able to further improve the mIOU by taking benefit of wider context with larger atrous rates. Finally, our KSAC achieves mIOUs of 88.1% and 45.47% on the PASCAL VOC 2012 test set and ADE20K dataset, respectively. Our full code will be released on the Github.

研究の動機と目的

  • セマンティックセグメンテーションにおける並列マルチブランチネットワークの限界、例えばブランチ間通信の不足や、ブランチ数に比例してパラメータが線形に増加する問題に対処すること。
  • 入力特徴マップを繰り返しスキャンすることで、1つのカーネルが複数の受容 field を学習可能となるようにし、局所的・グローバルな特徴を同時に学習可能とすることで、モデルの一般化性能と表現力を向上させること。
  • パラメータ数を削減し、推論コストを維持または低下させながら、PASCAL VOC 2012 や ADE20K などのベンチマークデータセットで高い性能を維持または向上させること。
  • 標準的なASPPで見られるパラメータ増加に伴う性能劣化を回避し、大きなアトラスレート(例:24)を効果的に活用できるようにすることで、広いコンテキストを捉える能力を向上させること。

提案手法

  • KSACは、複数の並列ブランチに共通する1つのカーネルを導入し、各ブランチが同じ3×3カーネルを異なるアトラスレートで同じ入力特徴マップに適用する。
  • 共有カーネルは、複数のブランチにわたって同一の入力に対して逐次適用され、1回の順伝播で局所的およびグローバルな特徴を学習可能となる。
  • このメカニズムにより、スケール間での特徴通信が可能となり、カーネルごとの有効なトレーニングサンプル数が増加し、表現力が向上する。
  • 新しいブランチ(例:レート24)を追加しても、同じカーネルを共有するためパラメータ数が増加しない。
  • KSACはDeepLabV3+などの既存アーキテクチャに統合可能であり、TensorFlow 2.0 などの標準的なディープラーニングフレームワークでも容易にデプロイ可能である。
  • 出力ストライド16の設定でモデルを訓練・評価し、OS=8設定と比較してメモリ使用量を削減し、推論速度を向上させた。

実験結果

リサーチクエスチョン

  • RQ1複数のアトラスレートブランチに共通する1つのカーネルが、セマンティックセグメンテーションにおける特徴表現力と一般化性能を向上させられるか?
  • RQ2カーネル共有により、パラメータ数を削減しながらも、セグメンテーション精度を維持または向上させられるか?
  • RQ3KSACは、パラメータ数を増加させずに大きなアトラスレート(例:24)を効果的に活用でき、広いコンテキストを捉えることができるか?
  • RQ4PASCAL VOC 2012 や ADE20K において、KSACは標準的なASPPと比較してmIOU、パラメータ数、推論効率の点で優れているか?
  • RQ5出力ストライド16の設定下でもKSACは高い性能を発揮でき、OS=8設定に伴う速度低下やGPUメモリ増加を回避できるか?

主な発見

  • MobileNetV2をバックボーンとするPASCAL VOC 2012では、パラメータ数を33%削減(4.5M → 3.0M)し、mIOUを0.6%向上(75.70% → 76.30%)した。
  • Xceptionをバックボーンとすると、パラメータ数を約1000万個削減(54.3M → 44.8M)し、mIOUを83.34%から85.96%に向上させた。
  • レート24のブランチを追加することで、パラメータ数に変化なしにmIOUを87.01%まで向上させ、DeepLabV3+を3.67%上回った。
  • PASCAL VOC 2012のテストセットでは、KSACはmIOUが88.1%を達成し、SOTA手法のDeepLabV3+(87.8%)やExFuse(87.9%)を上回った。
  • ADE20Kでは、マルチスケールテスト下で45.47%のmIOUを達成し、CFNet(44.89%)やEncNet(44.65%)をすべて上回った。
  • 出力ストライド16の設定下でも高い性能を発揮し、通常OS=8設定に伴う3倍の速度低下と4倍のGPUメモリ増加を回避したため、より高速かつメモリ効率が良かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。