Skip to main content
QUICK REVIEW

[논문 리뷰] Differentiable Top-k Classification Learning

Felix Petersen, Hilde Kuehne|arXiv (Cornell University)|2022. 06. 15.
Anomaly Detection Techniques and Applications인용 수 10
한 줄 요약

이 논문은 학습 가능한 분포 P_K에서 k를 샘플링하여 동시에 여러 k-값을 최적화하는 미분 가능 top-k 교차 엔트로피 손실을 제안한다. 이는 미분 가능 정렬 및 순위 매기기 기법을 활용하여 엔드 투 엔드 학습을 가능하게 한다. 이 방법은 top-1 및 top-5 정확도를 향상시키며, 마지막 레이어의 피니튜닝만으로도 ImageNet-1K에서 새로운 최고 성능 기록을 달성한다.

ABSTRACT

The top-k classification accuracy is one of the core metrics in machine learning. Here, k is conventionally a positive integer, such as 1 or 5, leading to top-1 or top-5 training objectives. In this work, we relax this assumption and optimize the model for multiple k simultaneously instead of using a single k. Leveraging recent advances in differentiable sorting and ranking, we propose a differentiable top-k cross-entropy classification loss. This allows training the network while not only considering the top-1 prediction, but also, e.g., the top-2 and top-5 predictions. We evaluate the proposed loss function for fine-tuning on state-of-the-art architectures, as well as for training from scratch. We find that relaxing k does not only produce better top-5 accuracies, but also leads to top-1 accuracy improvements. When fine-tuning publicly available ImageNet models, we achieve a new state-of-the-art for these models.

연구 동기 및 목표

  • 기본적으로 하나의 k(예: top-1)로만 훈련되는 top-k 분류의 고정 k 문제를 해결하기 위해, 평가 시 다수의 k-메트릭을 사용하는 것과는 대비되는 문제를 제기한다.
  • 고정된 k가 아닌 k-값의 분포를 사용해 훈련함으로써 모델의 일반화 및 강인성을 향상시키기 위한 목적을 가진다.
  • 미분 가능 정렬 및 순위 매기기 기법을 손실 함수에 통합하여 top-k 분류에 대한 엔드 투 엔드 미분 가능 학습을 가능하게 한다.
  • k를 유연하게 조정함으로써 top-k 정확도 뿐만 아니라 top-1 성능까지 향상됨을 보여주며, 특히 피니튜닝 시나리오에서 두드러진다.

제안 방법

  • SinkhornSort, DiffSortNets 등의 미분 가능 정렬 및 순위 매기기 방법을 활용하여 클래스 순위에 대한 확률 분포를 계산함으로써, 미분 가능한 top-k 연산을 가능하게 한다.
  • 예: top-1 50%, top-2 50%와 같은 k-값에 대한 분포 P_K를 정의하여, 다양한 top-k 목표의 혼합으로 훈련할 수 있도록 한다.
  • P_K에서 유도된 누적 가중치를 사용해 top-k 확률의 가중합으로 효과적 손실을 계산함으로써, 순위 매기기 연산을 통해 기울기 흐름을 확보한다.
  • 결과로 유도된 확률 분포 p를 사용해 네트워크 가중치에 대해 미분 가능한 교차 엔트로피 손실을 계산한다.
  • k-선택을 위한 스플리터 선택 네트워크를 활용해 k-선택에 필요한 레이어 수를 줄여 효율성을 향상시킨다.
  • CIFAR-100, ImageNet-1K, ImageNet-21K-P에서의 피니튜닝 및 초기 훈련 시나리오에 대해 손실을 적용하여 확장성과 성능를 평가한다.

실험 결과

연구 질문

  • RQ1고정된 k가 아닌 k-값의 분포를 사용해 훈련하면 top-1 및 top-5 분류 정확도가 향상되는가?
  • RQ2미분 가능한 정렬 및 순위 매기기 기반의 미분 가능한 top-k 학습은 표준 분류 과제에서 더 나은 일반화 및 강인성을 이끌어내는가?
  • RQ3제안된 손실이 전체 재학습 비용의 일부에 불과한 최소한의 계산 비용(예: 분류기 헤드의 단지 피니튜닝만으로도)으로 ImageNet-1K에서 최고 성능을 달성할 수 있는가?
  • RQ4이 방법은 ImageNet-21K-P와 같이 10,000개 이상의 클래스를 가진 데이터셋에 대해 얼마나 확장 가능한가?
  • RQ5기본 모델이 이미 사전 훈련되어 고도로 최적화되어 있더라도, 이 방법이 표준 top-1 교차 엔트로피 손실을 능가하는가?

주요 결과

  • 제안된 top-k 손실은 CIFAR-100, ImageNet-1K, ImageNet-21K-P를 포함한 모든 평가된 데이터셋에서 top-1 및 top-5 정확도를 향상시킨다.
  • ImageNet-1K에서 Noisy Student EfficientNet-L2를 피니튜닝할 경우, 새로운 최고 기록인 top-1 정확도 88.37% 및 top-5 정확도 98.68%를 달성한다.
  • ResNeXt-101 32x48d WSL에서 top-5 정확도가 0.2% 향상되었으며, 이는 오차 감소율 10%에 해당하며, 전체 재학습 비용의 일부에 불과한 비용으로 달성되었다.
  • ImageNet-21K-P에서 단지 마지막 레이어의 피니튜닝만으로도 top-5 정확도가 1% 이상 절대적 향상되었으며, 이는 대규모 분류에 대한 확장성의 증거이다.
  • 유의미도 검정 결과, 향상된 성능는 통계적으로 유의미하다(p < 0.01), top-1 정확도의 p-값은 0.00001, top-5 정확도의 p-값은 0.00005이다.
  • DiffSortNets 및 SinkhornSort를 포함한 다양한 미분 가능 정렬 방법을 사용한 경우, 기준 top-1 교차 엔트로피 손실보다 일관되게 뛰어난 성능를 기록하며, 특히 이 두 방법에서 가장 높은 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.