Skip to main content
QUICK REVIEW

[論文レビュー] AOGNets: Compositional Grammatical Architectures for Deep Learning

Xilai Li, Xi Song|arXiv (Cornell University)|Nov 15, 2017
Adversarial Robustness in Machine Learning参考文献 73被引用数 6
ひとこと要約

本論文は、AND-OR文法(AOG)を統合することで構成的で再構成可能なニューラルネットワーク構造を生成する、新しい深層学習アーキテクチャであるAOGNetsを提案する。AOGの構成要素を用いて特徴マップをフレーズ構文および依存構文の両方で統合的に解析することで、CIFAR-10、CIFAR-100、ImageNet-1K、MS-COCOベンチマークにおいて、ResNet、ResNeXt、DenseNet、SENetの変種を凌駕する最先端の精度を達成するとともに、FLOPsとパラメータ数を削減しながら、モデルの解釈可能性と敵対的ロバスト性を向上させる。

ABSTRACT

Neural architectures are the foundation for improving performance of deep neural networks (DNNs). This paper presents deep compositional grammatical architectures which harness the best of two worlds: grammar models and DNNs. The proposed architectures integrate compositionality and reconfigurability of the former and the capability of learning rich features of the latter in a principled way. We utilize AND-OR Grammar (AOG) as network generator in this paper and call the resulting networks AOGNets. An AOGNet consists of a number of stages each of which is composed of a number of AOG building blocks. An AOG building block splits its input feature map into N groups along feature channels and then treat it as a sentence of N words. It then jointly realizes a phrase structure grammar and a dependency grammar in bottom-up parsing the "sentence" for better feature exploration and reuse. It provides a unified framework for the best practices developed in state-of-the-art DNNs. In experiments, AOGNet is tested in the CIFAR-10, CIFAR-100 and ImageNet-1K classification benchmark and the MS-COCO object detection and segmentation benchmark. In CIFAR-10, CIFAR-100 and ImageNet-1K, AOGNet obtains better performance than ResNet and most of its variants, ResNeXt and its attention based variants such as SENet, DenseNet and DualPathNet. AOGNet also obtains the best model interpretability score using network dissection. AOGNet further shows better potential in adversarial defense. In MS-COCO, AOGNet obtains better performance than the ResNet and ResNeXt backbones in Mask R-CNN.

研究の動機と目的

  • 最新のDNNのベストプラクティスを文法モデルを用いて一貫性のある構成的フレームワークに統合すること。
  • 巨大なニューラルアーキテクチャ空間の探索という課題に、AND-OR文法(AOG)に基づく文法誘導型ネットワーク生成器を導入することで対処すること。
  • 計算コストやモデルの複雑さを増大させることなく、モデルの性能、解釈可能性、敵対的ロバスト性を向上させること。
  • 明示的な構成性と横方向接続の統合を通じて、構造的で再構成可能かつ解釈可能な深層ネットワークアーキテクチャを実現すること。
  • 文法誘導型アーキテクチャが、複数のベンチマークで既存のSOTAモデルを上回る精度とロバスト性を達成できることを実証すること。

提案手法

  • AOGNetsは複数の段階から構成され、各段階には1つ以上のAOG構成要素が含まれ、これらは入力特徴マップをN個のチャネルグループの「文」として処理する。
  • 各AOG構成要素は、下位から上位へのパース方式でフレーズ構文文法と依存構文文法を適用し、柔軟な特徴探索と再利用を可能にする。
  • 構造は階層的なAND-OR構造であり、ORノードは代替的な特徴パスを表し、ANDノードは複数のパスの共同処理を表す。
  • 勾配の流れと異なるレベル間での特徴伝搬を向上させるために、横方向接続(LC)を統合する。
  • 対称的な子ノードをORノードから削除するプルーニング戦略(RS)を採用し、構造的複雑さを低減するとともに、有効な特徴次元を拡大する。
  • フレームワークは再構成可能性と構成的設計をサポートしており、文法ルールに従ってネットワーク構造を動的に再編成可能である。

実験結果

リサーチクエスチョン

  • RQ1文法誘導型ネットワーク生成器は、現代のDNNのベストプラクティスを1つの解釈可能で再構成可能なアーキテクチャに統合できるか?
  • RQ2AOGに基づくアーキテクチャは、ResNet や DenseNet などの最先端モデルと比較して、画像分類およびオブジェクト検出ベンチマークで優れた性能を達成できるか?
  • RQ3構成的文法原理の統合は、モデルの解釈可能性と敵対的ロバスト性を向上させるか?
  • RQ4AOGNetは、FLOPsとパラメータ数を維持または削減しつつ、既存のモデルを上回る性能を発揮できるか?
  • RQ5横方向接続と構造的プルーニング(RS)は、AOGNetアーキテクチャにおける性能向上にどの程度寄与しているか?

主な発見

  • ImageNet-1Kでは、AOGNetは40.3Mパラメータでトップ-1精度80.18%を達成し、ResNet-152(77.0%、60.2M)、ResNeXt-101(79.6%、83.9M)、DualPathNet-98(79.85%、61.6M)を上回った。
  • CIFAR-10では、AOGNetは4.23Mパラメータでテスト誤差率3.52%を達成し、ResNet(4.62%)、Wide ResNet(4.81%)、DenseNet-BC(4.51%)を上回った。
  • CIFAR-100では、AOGNetは4.23Mパラメータでテスト誤差率17.99%を達成し、ResNet(22.71%)、Wide ResNet(22.07%)、DenseNet-BC(22.27%)を上回った。
  • ネットワークディスsectionを用いた評価で、AOGNetは最高のモデル解釈性スコアを記録し、優れた構造的透明性と特徴の分離性を示した。
  • MS-COCOオブジェクト検出およびインスタンスセグメンテーションでは、AOGNetにMask R-CNNバックボーンを適用した場合、ResNet や ResNeXt バックボーンを用いたモデルを上回った。
  • アブレーションスタディの結果、横方向接続(LC)と構造的プルーニング(RS)の両方が性能向上に寄与しており、CIFAR-100ではLCが誤差を0.05%、RSが0.13%削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。