Skip to main content
QUICK REVIEW

[논문 리뷰] Robust low-rank training via approximate orthonormal constraints

Dayana Savostianova, Emanuele Zangrando|arXiv (Cornell University)|2023. 06. 02.
Sparse and Compressive Sensing Techniques인용 수 4
한 줄 요약

이 논문은 낮은 랭크 가중치 행렬에 근사 직교 제약 조건을 도입하여 모델의 정확도와 효율성을 유지하면서 적대적 로버스트성을 향상시키는 강건한 낮은 랭크 훈련 방법을 제안한다. 기울기 흐름을 낮은 랭크 다양체 위에 투영하고 특이값을 좁은 밴드 내에 제한함으로써 조건 수가 유한해지게 하여, 표준 낮은 랭크 훈련을 초과하는 계산 비용을 증가시키지 않고도 로버스트성을 크게 향상시킨다.

ABSTRACT

With the growth of model and data sizes, a broad effort has been made to design pruning techniques that reduce the resource demand of deep learning pipelines, while retaining model performance. In order to reduce both inference and training costs, a prominent line of work uses low-rank matrix factorizations to represent the network weights. Although able to retain accuracy, we observe that low-rank methods tend to compromise model robustness against adversarial perturbations. By modeling robustness in terms of the condition number of the neural network, we argue that this loss of robustness is due to the exploding singular values of the low-rank weight matrices. Thus, we introduce a robust low-rank training algorithm that maintains the network's weights on the low-rank matrix manifold while simultaneously enforcing approximate orthonormal constraints. The resulting model reduces both training and inference costs while ensuring well-conditioning and thus better adversarial robustness, without compromising model accuracy. This is shown by extensive numerical evidence and by our main approximation theorem that shows the computed robust low-rank network well-approximates the ideal full model, provided a highly performing low-rank sub-network exists.

연구 동기 및 목표

  • 낮은 랭크 신경망에서 모델 효율성과 적대적 로버스트성 간의 상충 관계를 해결하기 위해.
  • 낮은 랭크 분해가 로버스트성을 떨어뜨리는 이유를 폭발하는 특이값과 높은 조건 수와 연결하여 규명하기 위해.
  • 낮은 랭潜 구조를 유지하면서 특이값을 유한하게 제약하여 네트워크의 조건 수를 향상시키는 훈련 알고리즘을 개발하기 위해.
  • 이론적으로, 그러한 모델이 존재할 경우, 제약된 특이값을 가진 이상적인 낮은 랭크 모델을 근사할 수 있음을 증명하기 위해.
  • 다양한 아키텍처와 데이터셋에서 정확도와 강건 정확도가 모두 유지되거나 향상됨을 경험적으로 입증하기 위해.

제안 방법

  • 신경망의 조건 수를 통해 로버스트성을 모델링하고, 낮은 랭크 행렬의 유한하지 않은 특이값으로 인한 높은 조건 수가 악영향을 미치는 원인을 규명한다.
  • 낮은 랭크 요소 $U$, $S$, $V$에 대해 기하학적 통합을 이용해 다양체 위에서의 세 개의 별도된 투영 기울기 흐름을 유도한다.
  • 목표 값 $s$를 중심으로 좁은 밴드 $[s - \varepsilon, s + \varepsilon]$ 내에 낮은 랭크 행렬의 특이값을 제약하여 근사 직교성을 도입한다.
  • 낮은 랭크 다양체 $\mathcal{M}_r$ 의 탄젠트 공간에 대한 직교 투영 $P(Y)$ 를 사용한 연속 시간 기울기 흐름 수식을 적용하여 다양체의 구조를 유지한다.
  • 미분 부등식 프레임워크를 적용하여 계산된 해 $Y(t)$ 와 이상적인 낮은 랭크 경로 $\widetilde{W}(t)$ 사이의 오차를 유한하게 제한하며, 유한한 외란 하에서 $\|Y(t) - W(t)\| \leq 3t\eta$ 를 보여준다.
  • 일阶 근사 정리에 따라, 유한한 특이값을 가진 고성능 낮은 랭크 네트워크가 존재할 경우, 이 방법은 작은 오차 범위 내에서 그 모델을 계산함을 증명한다.

실험 결과

연구 질문

  • RQ1왜 낮은 랭크 신경망은 전체 랭크 모델에 비해 적대적 로버스트성이 떨어지는가?
  • RQ2모델 정확도를 훼손하거나 훈련 비용을 증가시키지 않고 낮은 랭크 훈련을 강건하게 만들 수 있는가?
  • RQ3낮은 랭크 요소에 대한 근사 직교 제약 조건이 조건 수를 얼마나 향상시키고, 그로 인해 로버스트성이 얼마나 향상되는가?
  • RQ4제안된 방법이 유한한 특이값을 가진 최적의 낮은 랭크 모델을 어떤 조건에서 이상적으로 근사하는가?
  • RQ5다양한 아키텍처와 데이터셋에서 기존 베이스라인과 비교해 정확도, 강건 정확도, 계산 효율성 측면에서 이 방법은 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 제약된 특이값을 가진 강건한 낮은 랭크 훈련을 달성하여 정확도를 훼손하지 않고도 적대적 로버스트성을 크게 향상시킨다.
  • 경험적 평가 결과, 강건한 낮은 랭크 네트워크가 여러 데이터셋과 아키텍처에서 전체 랭크 모델의 강건 정확도를 따라하거나 초월함을 보였다.
  • 낮은 랭크 분해를 활용해 훈련 및 추론 비용을 줄였고, 제약된 특이값을 통해 조건 수가 유한하게 유지되어 조건 수가 안정됨을 확인했다.
  • 이론적 분석을 통해, 유한한 특이값을 가진 고성능 낮은 랭크 네트워크가 존재할 경우, 알고리즘이 일계 근사 오차 범위 내에서 그 모델을 계산함을 확인했다.
  • 계산된 모델과 이상적인 낮은 랭크 경로 사이의 오차는 $3t\eta$ 이내로 제한되어 있어, 투영 기울기 흐름 하에서 안정성과 수렴성을 보장한다.
  • 이 방법은 피드포워드 네트워크에 적용 가능하며, 이전의 낮은 랭크 방법에서처럼 필터를 행렬로 재구성함으로써 컨볼루션 레이어로도 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.