Skip to main content
QUICK REVIEW

[論文レビュー] Neural Spectrahedra and Semidefinite Lifts: Global Convex Optimization of Polynomial Activation Neural Networks in Fully Polynomial-Time

Burak Bartan, Mert Pilancı|arXiv (Cornell University)|Jan 7, 2021
Sparse and Compressive Sensing Techniques参考文献 41被引用数 5
ひとこと要約

本稿は、2層ニューラルネットワークの2次多項式活性化関数を用いた学習に対して、半定値計画法(SDP)を用いた完全多項式時間の凸最適化フレームワークを提案する。半定値リフトによる正確なグローバル解が得られることを証明し、正則化の選択が計算の実行可能性に著しく影響することを示している——重み減衰はNP困難であるが、他の凸ペナルティでは多項式時間での最適化が可能である。

ABSTRACT

The training of two-layer neural networks with nonlinear activation functions is an important non-convex optimization problem with numerous applications and promising performance in layerwise deep learning. In this paper, we develop exact convex optimization formulations for two-layer neural networks with second degree polynomial activations based on semidefinite programming. Remarkably, we show that semidefinite lifting is always exact and therefore computational complexity for global optimization is polynomial in the input dimension and sample size for all input data. The developed convex formulations are proven to achieve the same global optimal solution set as their non-convex counterparts. More specifically, the globally optimal two-layer neural network with polynomial activations can be found by solving a semidefinite program (SDP) and decomposing the solution using a procedure we call Neural Decomposition. Moreover, the choice of regularizers plays a crucial role in the computational tractability of neural network training. We show that the standard weight decay regularization formulation is NP-hard, whereas other simple convex penalties render the problem tractable in polynomial time via convex programming. We extend the results beyond the fully connected architecture to different neural network architectures including networks with vector outputs and convolutional architectures with pooling. We provide extensive numerical simulations showing that the standard backpropagation approach often fails to achieve the global optimum of the training loss. The proposed approach is significantly faster to obtain better test accuracy compared to the standard backpropagation procedure.

研究の動機と目的

  • 多項式活性化関数を有する2層ニューラルネットワークのグローバル最適で凸な最適化定式化を開発すること。
  • 半定値リフトが非凸な学習問題の正確な再定式化を提供することを確立すること。
  • 正則化の役割が計算複雑性に与える影響を分析し、重み減衰がNP困難な問題を引き起こすことを示すこと。
  • ベクトル出力、畳み込み層、プーリングを含む多様なアーキテクチャへの凸定式化の拡張を試みること。
  • 提案手法が標準的なバックプロパゲーションよりも高いテスト精度と高速な収束を達成することを示すこと。

提案手法

  • 凸双対性とS手続きを用いて、多項式活性化関数を有する2層ネットワークに対して等価な半定値計画問題(SDP)を導出する。
  • リフト空間におけるSDP解から元のネットワーク重みを回復するためのニューラル分解手順を導入する。
  • 多項式活性化関数には$\mathbb{S}^{(d+1)\times(d+1)}$、2次活性化関数には$\mathbb{S}^{d\times d}$のリフトパラメータ化を用いる。
  • 凸SDP定式化が元の非凸問題と同一のグローバル最適解集合を達成することを証明する。
  • 二乗損失、ハーバー損失、$\ell_1$ノルム損失を含む任意の凸損失関数にこのフレームワークを適用する。
  • 数値実験にはSCSソルバとCVXPYを用い、凸計画問題の効率的解法を実現する。

実験結果

リサーチクエスチョン

  • RQ1多項式活性化関数を有する2層ニューラルネットワークは、完全多項式時間でグローバル最適化可能か?
  • RQ2正則化はニューラルネットワーク学習の計算実行可能性にどのような役割を果たすか?
  • RQ3半定値リフトは、多項式活性化関数の非凸学習問題に対して正確な再定式化を提供するか?
  • RQ4凸定式化は、ベクトル出力、畳み込み層、プーリング層を含むアーキテクチャへ拡張可能か?
  • RQ5凸最適化アプローチの性能は、標準的なバックプロパゲーションと比較して、テスト精度および収束速度の面で優れているか?

主な発見

  • 提案された半定値計画問題(SDP)定式化は、元の非凸ニューラルネットワーク学習問題と同一のグローバル最適解集合を達成する。
  • 正則化が凸的かつ実行可能であれば、入力次元およびサンプルサイズに関して完全多項式時間でグローバル最適化が可能である。
  • 重み減衰正則化はNP困難な問題を引き起こすが、他の凸ペナルティでは多項式時間での解法が可能である。
  • クレジット承認やイオンオスフィアといったベンチマークデータセットにおいて、標準的なバックプロパゲーションよりも顕著に高いテスト精度と高速な収束を達成する。
  • 最適なニューロン数$m^*$は正則化係数$\beta$によって制御され、$\beta$が増加するにつれて$m^*$は減少する。
  • 多項式活性化関数における2次項の係数$a$が分類精度に最も顕著な影響を与え、定数項$c$の影響は無視できる程度である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。