Skip to main content
QUICK REVIEW

[논문 리뷰] Generalization and Overfitting in Matrix Product State Machine Learning Architectures

Artem Strashko, E. Miles Stoudenmire|arXiv (Cornell University)|2022. 08. 08.
Parallel Computing and Optimization Techniques인용 수 6
한 줄 요약

이 논문은 행렬 곱 상태(MPS) 기계학습 모델에서 일반화와 과적합 현상을 조사하기 위해 정확히 MPS로 표현 가능한 인위적 데이터와 MNIST 데이터를 사용하여 학습한다. 한편, 1차원 데이터에서는 결합 차원이 최적 값 이상으로 증가할 경우 과적합이 발생하지만, MNIST 데이터에서는 그렇지 않음을 발견하여, MPS의 일반화 능력이 데이터의 구조와 복잡성에 의해 결정된다는 것을 시사한다.

ABSTRACT

While overfitting and, more generally, double descent are ubiquitous in machine learning, increasing the number of parameters of the most widely used tensor network, the matrix product state (MPS), has generally lead to monotonic improvement of test performance in previous studies. To better understand the generalization properties of architectures parameterized by MPS, we construct artificial data which can be exactly modeled by an MPS and train the models with different number of parameters. We observe model overfitting for one-dimensional data, but also find that for more complex data overfitting is less significant, while with MNIST image data we do not find any signatures of overfitting. We speculate that generalization properties of MPS depend on the properties of data: with one-dimensional data (for which the MPS ansatz is the most suitable) MPS is prone to overfitting, while with more complex data which cannot be fit by MPS exactly, overfitting may be much less significant.

연구 동기 및 목표

  • 행렬 곱 상태(MPS)의 결합 차원을 증가시킬 경우 기계학습에서 모델의 일반화 능력과 과적합에 어떤 영향을 미치는지 조사하기.
  • 유한한 데이터셋으로 학습된 MPS 모델에서 더블 드롭 또는 U자형의 테스트 손실 곡선이 나타나는지 확인하기.
  • 정확한 MPS 표현을 가진 인위적 데이터와 실제 세계의 데이터인 MNIST와의 일반화 행동을 비교하기.
  • 데이터의 복잡성, 학습 데이터셋 크기, 최적의 결합 차원 간의 상호작용을 탐색하기.
  • 텐서 네트워크 기반 학습 아키텍처에서 모델 용량과 데이터 구조가 과적합을 결정하는 데 어떤 역할을 하는지 평가하기.

제안 방법

  • 정확히 알려진 결합 차원을 가진 MPS로 표현 가능한 인위적 회귀 데이터셋을 구축하기.
  • 두 가지 방법으로 MPS 모델을 학습하기: 압축을 동반한 텐서 역행렬 계산과 DMRG 기반의 기울기 최적화.
  • 결합 차원(χ)과 학습 데이터셋 크기를 체계적으로 변화시켜 다양한 모델 용량에서의 테스트 성능을 평가하기.
  • 복잡도를 조절하는 데 사용되는 매개변수 ε로 조절되는 다항식 기반의 데이터 분포를 사용하여 일반화 한계를 탐색하기.
  • 동일한 MPS 아키텍처를 MNIST 이미지 데이터에 적용하여 인위적 데이터와의 일반화 행동을 비교하기.
  • 테스트 손실을 결합 차원의 함수로 분석하여 U자형(과적합) 또는 단조로운(더블 드롭) 행동을 탐지하기.

실험 결과

연구 질문

  • RQ1MPS로 정확히 표현 가능한 데이터를 사용할 경우, MPS의 결합 차원을 증가시키면 유한한 학습 데이터에서 과적합이 발생하는가?
  • RQ2기본 데이터 분포의 복잡성이 MPS 모델의 최적의 결합 차원과 일반화 성능에 어떤 영향을 미치는가?
  • RQ3정확한 MPS 표현을 가진 인위적 데이터와 실제 세계의 이미지 데이터인 MNIST 간의 MPS 일반화 행동은 상당히 다를까?
  • RQ4학습 데이터의 양이 MPS 기반 모델의 최적의 결합 차원과 과적합의 존재에 어떤 영향을 미치는가?
  • RQ5정확히 MPS로 표현 가능한 데이터를 학습하는 데서 MPS 학습이 MNIST보다 더 어려운 이유는 무엇인가? 이는 이론적으로 더 단순한데도 말이다?

주요 결과

  • 낮은 복잡성의 1차원 인위적 데이터를 학습한 MPS 모델에서는 최적의 결합 차원 χ*를 초월할 경우 테스트 손실이 증가하는 과적합 현상이 관찰된다.
  • 더 높은 복잡성(ε = 1.0)을 가진 데이터에서는 과적합이 크게 감소하며, 결합 차원을 늘일수록 테스트 성능이 계속 향상되며 U자형의 손실 곡선도 나타나지 않는다.
  • MNIST 이미지 데이터에서는 결합 차원을 늘일수록 테스트 성능이 단조롭게 향상되며, 과적합이나 더블 드롭 행동의 징후가 전혀 없다.
  • 최적의 결합 차원 χ*는 데이터를 정확히 표현하기 위해 필요한 차원보다 작으며, 데이터 복잡성과 학습 데이터셋 크기가 증가함에 따라 증가한다.
  • 학습 효율성은 데이터 유형에 따라 달라지며, 정확히 MPS로 표현 가능한 인위적 데이터에서는 이론적으로 더 단순한데도 학습이 더 어렵다.
  • MPS의 일반화 성질은 보편적이지 않으며, 데이터 구조, 복잡성, 모델 용량 간의 상호작용에 따라 달라지며, 유한한 결합 차원을 통한 데이터 의존적 정규화가 가능하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.