Skip to main content
QUICK REVIEW

[論文レビュー] Robust low-rank training via approximate orthonormal constraints

Dayana Savostianova, Emanuele Zangrando|arXiv (Cornell University)|Jun 2, 2023
Sparse and Compressive Sensing Techniques被引用数 4
ひとこと要約

本稿では、低ランク重み行列に近似直交制約を課することにより、モデルの精度と効率を維持したまま敵対的ロバストネスを向上させる、ロバストな低ランク学習手法を提案する。勾配フローを低ランク多様体上に射影し、特異値を狭い帯に制約することで、条件数が有界となり、計算コストを標準的な低ランク学習を超えて増加させることなく、顕著なロバストネスの向上が達成される。

ABSTRACT

With the growth of model and data sizes, a broad effort has been made to design pruning techniques that reduce the resource demand of deep learning pipelines, while retaining model performance. In order to reduce both inference and training costs, a prominent line of work uses low-rank matrix factorizations to represent the network weights. Although able to retain accuracy, we observe that low-rank methods tend to compromise model robustness against adversarial perturbations. By modeling robustness in terms of the condition number of the neural network, we argue that this loss of robustness is due to the exploding singular values of the low-rank weight matrices. Thus, we introduce a robust low-rank training algorithm that maintains the network's weights on the low-rank matrix manifold while simultaneously enforcing approximate orthonormal constraints. The resulting model reduces both training and inference costs while ensuring well-conditioning and thus better adversarial robustness, without compromising model accuracy. This is shown by extensive numerical evidence and by our main approximation theorem that shows the computed robust low-rank network well-approximates the ideal full model, provided a highly performing low-rank sub-network exists.

研究の動機と目的

  • 低ランクニューラルネットワークにおけるモデル効率と敵対的ロバストネスのトレードオフを解消すること。
  • 低ランク因子分解がロバストネスを低下させる理由を特定し、特異値の発散と高い条件数と関連付けること。
  • 低ランク構造を維持しつつ、特異値を有界に制約することでネットワークの条件数を改善する学習アルゴリズムを開発すること。
  • 仮にそのような有界な特異値を持つ理想的な低ランクモデルが存在するならば、そのモデルを理論的に近似できることを証明すること。
  • 複数のアーキテクチャおよびデータセットにおいて、精度およびロバスト精度が保持または向上することを実証的に示すこと。

提案手法

  • ニューラルネットワークの条件数を用いてロバストネスをモデル化し、低ランク行列における特異値が無限大に発散することによる高い条件数が、ロバストネスの低下を引き起こすことを関連付ける。
  • 低ランク因子 $U$、$S$、$V$ に対して、多様体上の幾何的統合を用いて、3つの別々の射影勾配フローを導出する。
  • 低ランク行列の特異値を、目標値 $s$ の周囲の狭い帯 $[s - \varepsilon, s + \varepsilon]$ に制約することで、近似直交性を課す。
  • 低ランク多様体 $\mathcal{M}_r$ の接空間への直交射影 $P(Y)$ を用いた連続時間勾配フローの定式化により、多様体構造を維持する。
  • 微分不等式フレームワークを用いて、計算された解 $Y(t)$ と理想の低ランク経路 $\widetilde{W}(t)$ の間の誤差をバインドし、有界な摂動のもとで $\|Y(t) - W(t)\| \leq 3t\eta$ が成り立つことを示す。
  • 1次近似定理を用いて、有界な特異値を持つ高性能な低ランクネットワークが存在する場合、本手法がそのモデルを小さな誤差範囲内で計算できることを証明する。

実験結果

リサーチクエスチョン

  • RQ1なぜ低ランクニューラルネットワークはフルランクモデルに比べて敵対的ロバストネスが低下するのか?
  • RQ2モデルの精度を損なわず、かつトレーニングコストを増加させずに、低ランク学習をロバスト化できるか?
  • RQ3低ランク因子に近似直交制約を課すことで、条件数およびロバストネスをどの程度向上できるか?
  • RQ4どのような条件下で、本手法が有界な特異値を持つ最適な低ランクモデルを近似できるか?
  • RQ5多様なアーキテクチャおよびデータセットにおいて、本手法は既存のベースラインと比べて精度、ロバスト精度、計算効率の点でどのように差をつけるか?

主な発見

  • 提案手法は、有界な特異値を保つことで、精度を損なわず敵対的ロバストネスを顕著に向上させるロバストな低ランク学習を実現する。
  • 実証的評価では、複数のデータセットおよびアーキテクチャにおいて、ロバストな低ランクネットワークがフルランクモデルと同等またはそれ以上のロバスト精度を達成していることが示された。
  • 低ランク因子分解を活用することでトレーニングおよび推論コストを削減するとともに、制約付きの特異値により条件数が有界に保たれ、ロバストネスが向上する。
  • 理論的分析により、有界な特異値を持つ高性能な低ランクネットワークが存在する場合、アルゴリズムがそのモデルを1次近似誤差の範囲内で計算できることを確認した。
  • 計算モデルと理想の低ランク経路の間の誤差は $3t\eta$ でバインドされ、射影勾配フローのもとで安定性および収束性が保証される。
  • 本手法は順方向ネットワークに適用可能であり、従来の低ランク手法と同様に、畳み込み層へはフィルタを行列に再形状することで拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。