[논문 리뷰] RecursiveMix: Mixed Learning with History
RecursiveMix (RM)는 이전 학습 반복에서 생성된 역사적 입력-예측-라벨 트리플릿을 반복적으로 재사용하여 다양한 다중 스케일의 혼합 샘플을 생성하는 새로운 데이터 증강 방법이다. 이는 최소한의 계산 부담으로 모델의 일반화 성능을 향상시킨다. RM은 SOTA 성능을 달성하여 CIFAR-100에서 ResNet-50의 성능을 3.2% 향상시키고, ImageNet에서는 2.8% 향상시키며, COCO 객체 검출에서 CutMix보다 1.4 AP 포인트 높은 성능을 기록한다.
Mix-based augmentation has been proven fundamental to the generalization of deep vision models. However, current augmentations only mix samples at the current data batch during training, which ignores the possible knowledge accumulated in the learning history. In this paper, we propose a recursive mixed-sample learning paradigm, termed "RecursiveMix" (RM), by exploring a novel training strategy that leverages the historical input-prediction-label triplets. More specifically, we iteratively resize the input image batch from the previous iteration and paste it into the current batch while their labels are fused proportionally to the area of the operated patches. Further, a consistency loss is introduced to align the identical image semantics across the iterations, which helps the learning of scale-invariant feature representations. Based on ResNet-50, RM largely improves classification accuracy by $\sim$3.2\% on CIFAR100 and $\sim$2.8\% on ImageNet with negligible extra computation/storage costs. In the downstream object detection task, the RM pretrained model outperforms the baseline by 2.1 AP points and surpasses CutMix by 1.4 AP points under the ATSS detector on COCO. In semantic segmentation, RM also surpasses the baseline and CutMix by 1.9 and 1.1 mIoU points under UperNet on ADE20K, respectively. Codes and pretrained models are available at \url{https://github.com/megvii-research/RecursiveMix}.
연구 동기 및 목표
- 기존의 혼합 기반 데이터 증강 방법이 현재 배치의 샘플들만 사용하고 학습 역사에서 축적된 유용한 지식을 간과하는 한계를 해결한다.
- 역사적 입력-예측-라벨 트리플릿이 어떻게 반복적으로 재사용되어 모델의 일반화 능력과 특징 학습을 향상시킬 수 있는지 탐구한다.
- 반복 과정에서 공간-의미적 일致성을 명시적으로 학습하는 학습 프레임워크를 개발하여 스케일 불변성 및 공간 인식 특징 표현을 향상시킨다.
- 이미지 분류, 검출, 세그멘테이션 벤치마크에서 성능을 크게 향상시키면서도 추가 계산 및 메모리 비용을 최소화한다.
- 공간 이해가 핵심적인 작업들인 객체 검출 및 세그멘테이션과 같은 후행 작업에서 RecursiveMix의 효과를 입증한다.
제안 방법
- RecursiveMix는 이전 학습 반복에서의 입력 배치를 반복적으로 크기 조정하고 현재 배치에 붙여넣어, 재귀적 데이터 혼합 프레임워크를 형성한다.
- 역사적 및 현재 샘플의 라벨은 붙여넣은 패치의 면적 비율에 따라 혼합 계수 λ에 따라 비례적으로 융합된다.
- 특징 표현 간의 대응 영역 관심 영역(ROI) 간의 일致성을 강제하기 위해 일치 손실 함수를 도입한다. 이는 공간-의미적 일치성을 강화한다.
- 경량 RoI 연산자와 선택적 완전 연결 계층을 사용하여 일치 손실을 계산함으로써 최소한의 계산 부담을 확보한다.
- 역사적 트리플릿(입력, 예측, 라벨)은 오직 한 번의 반복 동안만 미니배치로 저장되어 저장 비용이 극히 낮다.
- 재귀적 혼합 과정은 데이터 다양성을 증가시키며, 동일한 인스턴스에 대해 다중 스케일 및 다중 공간 시각을 제공함으로써 감독 신호를 풍부하게 한다.
실험 결과
연구 질문
- RQ1역사적 입력-예측-라벨 트리플릿을 활용하면 현재 배치 중심의 혼합 증강을 넘어서 딥 비전 모델의 일반화 능력을 향상시킬 수 있는가?
- RQ2역사 데이터를 활용한 재귀적 혼합이 스케일 불변성 및 공간 인식 특징 표현 측면에서 특징 학습을 어떻게 향상시키는가?
- RQ3RecursiveMix는 계산 및 메모리 비용을 최소화하면서도 이미지 분류, 객체 검출, 세그멘테이션 작업에서 성능을 얼마나 향상시킬 수 있는가?
- RQ4역사적 및 현재 혼합 샘플 간의 일치 손실이 기존 혼합 방법에 비해 더 정확하고 강건한 특징 학습을 이끌어내는가?
- RQ5RecursiveMix는 CutMix 및 Mixup과 같은 기존 최신 기술을 능가하는 단순하면서도 효과적인 베이스라인으로 활용될 수 있는가?
주요 결과
- RecursiveMix는 CIFAR-100에서 ResNet-50의 정확도를 3.2% 향상시키고, ImageNet에서는 2.8% 향상시켜 기준 모델 및 CutMix를 크게 능가한다.
- ATSS 검출기 기반 COCO 객체 검출 벤치마크에서 RM 사전학습된 ResNet-50 모델은 기준 모델보다 2.1 AP 포인트 높고, CutMix보다 1.4 AP 포인트 높은 성능을 기록한다.
- UperNet 기반 ADE20K 세그멘테이션에서 RM은 기준 모델보다 1.9 mIoU 높고, CutMix보다 1.1 mIoU 높은 성능을 보이며, 고밀도 예측 작업에서 강력한 일반화 능력을 입증한다.
- 메모리(5887.0 MB 대비 5832.0 MB)와 학습 시간(73.8시간)에서의 증가가 극히 미미하여 높은 효율성을 보인다.
- 클래스 활성화 맵 시각화 결과, RM은 Mixup 및 CutMix보다 더 다양한 다중 객체 입력을 생성하고 의미 있는 영역의 정확한 국소화를 가능하게 한다.
- 효율적 클래스 분석 결과, RM은 평균적으로 이미지당 4~5개의 객체를 위한 감독을 제공함을 확인하여 기준 방법보다 더 풍부하고 다양한 감독 신호를 제공함을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.