Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Incay for Representation Regularization

Yuhui Yuan, Kuiyuan Yang|arXiv (Cornell University)|2017. 05. 29.
Advanced Neural Network Applications참고 문헌 14인용 수 13
한 줄 요약

이 논문은 딥 네ural 네트워크의 특징 벡터가 학습 중에 노름(norm)이 커지도록 유도하는 새로운 정규화 기법인 feature incay를 제안한다. 이는 클래스 간 분리성과 클래스 내 밀집도를 향상시킨다. 특징 벡터의 L2 노름의 역수를 최소화하는 Reciprocal Norm Loss를 통해 일반화 성능을 향상시키며, MNIST, CIFAR10, CIFAR100에서 표준 소프트맥스와 대용량 마진 소프트맥스를 항상 능가하는 높은 정확도와 더 큰 특징 노름을 달성한다.

ABSTRACT

Softmax loss is widely used in deep neural networks for multi-class classification, where each class is represented by a weight vector, a sample is represented as a feature vector, and the feature vector has the largest projection on the weight vector of the correct category when the model correctly classifies a sample. To ensure generalization, weight decay that shrinks the weight norm is often used as regularizer. Different from traditional learning algorithms where features are fixed and only weights are tunable, features are also tunable as representation learning in deep learning. Thus, we propose feature incay to also regularize representation learning, which favors feature vectors with large norm when the samples can be correctly classified. With the feature incay, feature vectors are further pushed away from the origin along the direction of their corresponding weight vectors, which achieves better inter-class separability. In addition, the proposed feature incay encourages intra-class compactness along the directions of weight vectors by increasing the small feature norm faster than the large ones. Empirical results on MNIST, CIFAR10 and CIFAR100 demonstrate feature incay can improve the generalization ability.

연구 동기 및 목표

  • 표준 소프트맥스 손실에서 특징 노름이 제대로 활용되지 않는 문제를 해결하기 위해, 각각의 각도와 가중치 노름만 최적화하는 데 초점을 맞춘다.
  • 분류기 가중치뿐 아니라 특징 표현 자체를 명시적으로 정규화함으로써 모델의 일반화 성능을 향상시키기 위해 노력한다.
  • 잘 분류된 샘플에 대해 큰 특징 노름을 선호하는 새로운 인덕티브 바이어스를 제안한다.
  • 특징 노름이 표현 학습에서 중요한 이유를 이론적이고 실증적으로 입증한다.
  • feature incay가 대용량 마진 소프트맥스나 센터 손실과 같은 기존 방법들과 보완된다는 것을 보여준다.

제안 방법

  • 특징 벡터의 L2 노름의 역수를 최소화하는 Reciprocal Norm Loss를 도입하여 더 큰 노름을 유도한다.
  • 하이퍼파라미터 λ를 통해 소프트맥스 또는 대용량 마진 소프트맥스와 함께 feature incay를 정규화 기법으로 적용한다.
  • 작은 노름을 가진 특징의 노름을 큰 노름을 가진 특징보다 더 빠르게 증가시켜 클래스 내 밀집도를 향상시킨다.
  • feature incay는 각 특징 벡터를 해당 가중치 벡터 방향으로 원점에서 멀리 밀어내어 클래스 간 마진을 증가시킨다.
  • 손실 함수는 미분 가능하며 표준 백프로파게이션과 호환되어 엔드 투 엔드 학습이 가능하다.
  • 이 방법은 일반적이며 센터 손실이나 대용량 마진 제약과 같은 다른 정규화 기법과도 조합할 수 있다.

실험 결과

연구 질문

  • RQ1왜 표준 소프트맥스 손실은 잘 분류된 샘플조차도 특징 노름을 최적화하지 못하는가?
  • RQ2특징 노름을 증가시키는 것이 딥 네럴 네트워크에서 일반화 성능을 향상시키는 이유는 무엇인가?
  • RQ3큰 특징 노름을 유도하는 정규화 기법이 동시에 클래스 간 분리성과 클래스 내 밀집도를 향상시킬 수 있는가?
  • RQ4feature incay는 표현 학습에서 웨이트 디케이 또는 다른 정규화 기법과 비교해 어떻게 성능을 내는가?
  • RQ5대용량 마진 소프트맥스와 조합했을 때 feature incay의 최적 하이퍼파라미터 설정은 무엇인가?

주요 결과

  • feature incay는 테스트 세트에서 특징 벡터의 평균 L2 노름을 크게 증가시키며, λ=0.1일 때 RN+Softmax가 CIFAR10에서 92.04%의 top-1 정확도를 달성한다.
  • CIFAR100에서 RN+L-Softmax는 29.18%의 오차율을 기록하여 L-Softmax(29.53%)보다 0.37% 향상되어 일관된 성능 향상을 보였다.
  • 테스트 손실은 소프트맥스의 0.1498에서 RN+Softmax의 0.1432로 감소하여 더 나은 일반화 성능을 나타낸다.
  • 작은 λ 값조차도 feature incay가 L-Softmax 성능을 향상시켜 하이퍼파라미터 설정에 대한 강건성을 보였다.
  • Reciprocal Norm Loss는 큰 노름을 가진 특징보다 작은 노름을 가진 특징을 더 빠르게 증가시켜 클래스 내 분산을 감소시켰다.
  • 실증 결과는 feature incay가 MNIST, CIFAR10, CIFAR100의 세 데이터셋에서 모두 일반화 성능 향상을 이룬다는 것을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.