[논문 리뷰] Drawing Multiple Augmentation Samples Per Image During Training Efficiently Decreases Test Error
이 논문은 훈련 중에 고유한 이미지당 여러 개의 증강 샘플을 추출하는 증강 다중성 증가를 제안하여 딥 ResNets와 NFNets의 테스트 정확도를 향상시킵니다. 배치 크기를 고정할 경우 훈련 수렴 속도가 느려지더라도, 높은 증강 다중성은 일관되게 일반화 성능을 향상시키며, 동일한 계산 예산 내에서 NFNet-F5를 사용해 ImageNet에서 86.8%의 top-1 정확도를 달성합니다.
In computer vision, it is standard practice to draw a single sample from the data augmentation procedure for each unique image in the mini-batch. However recent work has suggested drawing multiple samples can achieve higher test accuracies. In this work, we provide a detailed empirical evaluation of how the number of augmentation samples per unique image influences model performance on held out data when training deep ResNets. We demonstrate drawing multiple samples per image consistently enhances the test accuracy achieved for both small and large batch training. Crucially, this benefit arises even if different numbers of augmentations per image perform the same number of parameter updates and gradient evaluations (requiring the same total compute). Although prior work has found variance in the gradient estimate arising from subsampling the dataset has an implicit regularization benefit, our experiments suggest variance which arises from the data augmentation process harms generalization. We apply these insights to the highly performant NFNet-F5, achieving 86.8$\%$ top-1 w/o extra data on ImageNet.
연구 동기 및 목표
- 고유한 이미지당 데이터 증강 샘플 수가 딥 러닝에서 테스트 정확도에 미치는 영향을 조사하는 것.
- 데이터 증강이 일반화에 기여하는 편향과 분산의 역할을 분리하는 것.
- 데이터 증강의 이점이 기울기 분산에서 기인하는지, 아니면 증강이 유도하는 편향된 기울기 갱신에서 기인하는지 평가하는 것.
- 특정 계산 예산 하에서 증강 다중성이 성능 향상에 기여하는지 평가하는 것, 특히 대규모 배치 훈련에서의 효과를 중심으로 한다.
- NFNet-F5와 같은 최신 모델에 대해 증강 다중성의 효과를 검증하는 것.
제안 방법
- 고유한 이미지당 여러 증강된 버전을 미니배치에서 추출하는 '증강 다중성'을 도입하며, 배치 크기 또는 고유한 이미지 수를 변화시킵니다.
- 두 가지 훈련 방식을 구현합니다: 하나는 고정된 고유한 이미지 수에서 증가하는 배치 크기이고, 다른 하나는 고정된 배치 크기에서 증가하는 다중성에 따라 고유한 이미지 수를 줄이는 방식입니다.
- 두 방식 모두에서 딥 ResNets와 NFNets를 훈련시켜 테스트 정확도와 수렴 속도를 비교합니다.
- 훈련 기간과의 영향을 분리하기 위해 고정된 총 계산 예산(예: 112,600 또는 225,200 개의 파라미터 갱신)을 사용합니다.
- 강한 최적화 환경에서 성능을 평가하기 위해 NFNets에 SAM 정규화를 적용합니다.
- 표준 훈련(증강 다중성 = 1)과 이전 최고 성능 모델을 문헌 기반으로 비교합니다.
실험 결과
연구 질문
- RQ1고유한 이미지당 증강 샘플 수를 늘일수록 딥 ResNets에서 테스트 정확도가 향상되는가?
- RQ2데이터 증강의 일반화 성능 향상 요인이 기울기 추정의 편향인지, 아니면 증강이 유도하는 분산인가?
- RQ3총 파라미터 갱신 수를 일정하게 유지할 경우, 높은 증강 다중성의 성능 향상 효과가 유지되는가?
- RQ4증강 다중성은 대규모 배치 훈련과 유한한 학습률과 어떻게 상호작용하는가?
- RQ5높은 증강 다중성은 SOTA 성능에 도달하기 위해 필요한 훈련 에포크 수를 줄일 수 있는가?
주요 결과
- NFNet-F5에서 증강 다중성을 1에서 16으로 늘일 경우, ImageNet에서 테스트 정확도가 0.4% 향상되어 86.8%의 top-1 정확도를 달성하며, 추가 데이터 없이도 성능 향상을 이룹니다.
- 112,600개의 파라미터 갱신이라는 고정된 계산 예산 하에서도, 증강 다중성 16은 표준 훈련(다중성 = 1)보다 더 높은 테스트 정확도를 달성합니다.
- 고정된 배치 크기 조건에서 높은 증강 다중성은 수렴 속도를 느리게 하지만, 특히 대규모 배치 설정에서 뚜렷한 일반화 성능 향상을 이룹니다.
- 동일한 모델을 증강 다중성 16으로 훈련할 경우, 34 에포크(168,900단계) 만에 86.8%의 top-1 정확도를 달성하지만, 베이스라인은 더 많은 에포크가 필요로 하며 정확도도 낮습니다.
- SAM을 적용한 NFNet-F3의 경우, 증강 다중성 16으로 225,200개의 갱신 후 86.45%의 top-1 정확도를 달성했으며, 이는 NFNet-F6 베이스라인과 0.05% 이내의 정확도를 유지하지만, 계산량은 4분의 1로 줄이고 파라미터 수도 적게 사용합니다.
- 동일한 미니배치 내에서 동일한 이미지의 여러 증강 샘플을 추출할 경우, 증강 다중성의 성능 향상 효과가 가장 뚜렷합니다. 이는 배치 간 추출과 비교할 때 더욱 두드러집니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.