Skip to main content
QUICK REVIEW

[논문 리뷰] Data Dropout: Optimizing Training Data for Convolutional Neural Networks

Tianyang Wang, Jun Huan|arXiv (Cornell University)|2018. 09. 01.
Advanced Neural Network Applications참고 문헌 21인용 수 15
한 줄 요약

이 논문은 데이터 드롭아웃을 제안하며, 검증 손실에 대한 각 샘플의 影響를 측정하여 불리한 훈련 샘플을 식별하고 제거함으로써 딥러닝 일반화 성능을 향상시키는 이중 라운드 훈련 방식을 개발한다. 이 방법은 ResNet 및 DnCNN과 같은 CNN 모델의 이미지 분류 및 노이즈 제거 작업에서 추가 튜닝 없이도 훈련 오버헤드 없이 성능을 향상시킨다.

ABSTRACT

Deep learning models learn to fit training data while they are highly expected to generalize well to testing data. Most works aim at finding such models by creatively designing architectures and fine-tuning parameters. To adapt to particular tasks, hand-crafted information such as image prior has also been incorporated into end-to-end learning. However, very little progress has been made on investigating how an individual training sample will influence the generalization ability of a model. In other words, to achieve high generalization accuracy, do we really need all the samples in a training dataset? In this paper, we demonstrate that deep learning models such as convolutional neural networks may not favor all training samples, and generalization accuracy can be further improved by dropping those unfavorable samples. Specifically, the influence of removing a training sample is quantifiable, and we propose a Two-Round Training approach, aiming to achieve higher generalization accuracy. We locate unfavorable samples after the first round of training, and then retrain the model from scratch with the reduced training dataset in the second round. Since our approach is essentially different from fine-tuning or further training, the computational cost should not be a concern. Our extensive experimental results indicate that, with identical settings, the proposed approach can boost performance of the well-known networks on both high-level computer vision problems such as image classification, and low-level vision problems such as image denoising.

연구 동기 및 목표

  • 특정 훈련 샘플을 제거함으로써 딥러닝 모델의 일반화 성능 향상 여부를 조사하는 것.
  • 불리한 훈련 샘플을 식별하고 제거하여 훈련 데이터셋을 최적화하는 방법을 개발하는 것.
  • 모델 아키텍처 변경 없이도 기존 CNN 모델의 성능을 향상시키는 일반화 가능한 훈련 프레임워크를 설계하는 것.
  • 고수준(분류) 및 저수준(노이즈 제거) 문제를 포함한 다양한 컴퓨터 비전 작업에서 데이터 최적화의 효과를 입증하는 것.

제안 방법

  • 첫 번째 라운드에서 전체 훈련 세트로 CNN을 훈련시켜 각 훈련 샘플이 검증 손실에 미치는 영향을 계산한다.
  • 각 훈련 샘플에 대해, 검증 세트를 사용하여 그 샘플을 제거했을 때 검증 손실의 변화를 측정함으로써 영향을 추정한다.
  • 양의 영향 값(해당 샘플 제거 시 전체 검증 오차가 감소함)을 가진 샘플을 식별하고 제거한다.
  • 불리한 샘플을 제외하여 더 작고 최적화된 훈련 세트를 재구성한다.
  • 두 번째 라운드에서 최적화된 데이터셋으로 모델을 다시 처음부터 훈련시켜, 튜닝이나 계속된 훈련을 하지 않는다.
  • 표준 최적화(Adam) 및 훈련 프로토콜을 사용하며, 공정성을 유지하기 위해 데이터 증강은 두 번째 라운드에서만 적용한다.

실험 결과

연구 질문

  • RQ1특정 훈련 샘플을 제거함으로써 훈련된 CNN의 일반화 정확도를 향상시킬 수 있는가?
  • RQ2개별 훈련 샘플이 모델 성능에 미치는 영향을 정량적으로 측정할 수 있는가?
  • RQ3제안된 이중 라운드 훈련 방식이 모델 아키텍처를 수정하지 않고도 표준 훈련보다 더 나은 성능을 낼 수 있는가?
  • RQ4이 데이터 드롭아웃 방법은 다양한 CNN 아키텍처와 컴퓨터 비전 작업에 일반화될 수 있는가?
  • RQ5성능 향상은 데이터 최적화 단계의 결과인지, 아니면 추가적인 훈련 반복 때문인가?

주요 결과

  • 제안된 이중 라운드 훈련 방식과 데이터 드롭아웃은 이미지 분류 및 이미지 노이즈 제거 작업 모두에서 일반화 정확도 향상을 이룬다.
  • BSD68 데이터셋에서 이 방법은 DnCNN의 평균 PSNR를 약 0.04 dB 향상시켜 노이즈 제거 성능 향상이 명백하게 입증되었다.
  • 시각적 및 정량적 결과에서 이 방법은 원래 DnCNN 및 널리 사용되는 노이즈 제거 방법인 BM3D를 뛰어넘는 성능을 보였다.
  • ResNet, DenseNet, All-CNN-C와 같은 다양한 모델에서 효과적이며, 광범위한 적용 가능성을 보였다.
  • 첫 번째 라운드 모델은 영향 값 계산을 위해만 사용되며, 두 번째 라운드 훈련은 처음부터 시작되므로, 튜닝이나 계속된 훈련과 근본적으로 다르다.
  • 훈련 샘플 수가 줄었음에도 불구하고 두 번째 라운드 모델이 더 좋은 성능을 내어, 일부 경우에서 데이터 품질이 양보다 더 중요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.