[논문 리뷰] C-Mixup: Improving Generalization in Regression
C-Mixup는 레이블 유사도를 기반으로 훈련 쌍을 샘플링함으로써 일반화를 향상시키는 새로운 회귀용 데이터 증강 방법이다. 특성 기반 또는 균일 샘플링 대신 레이블 거리에 대한 가우시안 커널을 사용함으로써 잡음이 많은 보간을 줄이고, 11개의 데이터셋에서 내분포 일반화, 태스크 일반화, 외분포 내성에 대해 최신 기술 수준의 성능을 달성한다. 이전 방법 대비 최대 6.56% 향상된다.
Improving the generalization of deep networks is an important open challenge, particularly in domains without plentiful data. The mixup algorithm improves generalization by linearly interpolating a pair of examples and their corresponding labels. These interpolated examples augment the original training set. Mixup has shown promising results in various classification tasks, but systematic analysis of mixup in regression remains underexplored. Using mixup directly on regression labels can result in arbitrarily incorrect labels. In this paper, we propose a simple yet powerful algorithm, C-Mixup, to improve generalization on regression tasks. In contrast with vanilla mixup, which picks training examples for mixing with uniform probability, C-Mixup adjusts the sampling probability based on the similarity of the labels. Our theoretical analysis confirms that C-Mixup with label similarity obtains a smaller mean square error in supervised regression and meta-regression than vanilla mixup and using feature similarity. Another benefit of C-Mixup is that it can improve out-of-distribution robustness, where the test distribution is different from the training distribution. By selectively interpolating examples with similar labels, it mitigates the effects of domain-associated information and yields domain-invariant representations. We evaluate C-Mixup on eleven datasets, ranging from tabular to video data. Compared to the best prior approach, C-Mixup achieves 6.56%, 4.76%, 5.82% improvements in in-distribution generalization, task generalization, and out-of-distribution robustness, respectively. Code is released at https://github.com/huaxiuyao/C-Mixup.
연구 동기 및 목표
- 비정상적인 레이블 보간으로 인해 기존의 Mixup가 회귀에서 일반화 성능이 떨어지는 문제를 해결하기 위해.
- 내분포 일반화, 메타러닝에서의 태스크 일반화, 외분포 내성성을 향상시키기 위해.
- 특성 기반 유사도 대신 레이블 기반 유사도를 사용하여 쌍 샘플링에 있어 계산 비용을 줄이고 보간 품질을 향상시키기 위해.
- 임의의 상관관계와 도메인 이동을 완화하는 확장 가능하고 내성적이며 이론적으로 탄탄한 회귀 방법을 개발하기 위해.
제안 방법
- C-Mixup는 레이블 간 유클리드 거리에 기반한 가우시안 커널을 사용하여 혼합 쌍에 대한 샘플링 확률을 계산한다.
- 균일하거나 특성 기반 샘플링을 레이블 유사도 기반으로 대체하여, 유사한 레이블을 가진 예시들만 혼합될 가능성이 높아지도록 보장한다.
- 메트릭은 표준 훈련에 통합되며, β 분포에서 유도된 혼합 계수 λ ~ Beta(α, α)를 사용해 특징과 레이블을 선형으로 보간한다.
- MetaMix를 통해 메타러닝에 확장되며, C-Mixup는 MAML 기반 소수의 태스크에서의 회귀에서 태스크 일반화를 향상시킨다.
- 이 알고리즘은 두 단계 과정을 거친다: 먼저 거리 계산을 위한 은닉 표현 계산, 그 다음 레이블 또는 표현 기반 유사도를 사용한 혼합 수행.
- 가우시안 커널의 대역폭 파라미터 σ를 사용하여 유사도 가중치의 민감도를 제어하며, 다양한 σ 값에 대해 경험적으로 안정적인 성능을 보인다.
실험 결과
연구 질문
- RQ1혼합에서 레이블 기반 샘플링이 균일하거나 특성 기반 샘플링보다 회귀 태스크의 일반화를 향상시키는가?
- RQ2C-Mixup는 도메인 불변 표현을 장려함으로써 외분포 내성성을 향상시키는가?
- RQ3소수의 태스크 회귀에서 C-Mixup는 기존의 Vanilla Mixup보다 메타러닝 환경에서 어떻게 성능을 내는가?
- RQ4C-Mixup는 가우시안 커널의 대역폭 σ와 베타 분포의 형상 파라미터 α와 같은 하이퍼파라미터 선택에 대해 내성적인가?
- RQ5레이블 노이즈가 존재할 경우 C-Mixup는 어떻게 성능을 내며, 표준 Mixup보다 우월한 성능 유지를 하는가?
주요 결과
- C-Mixup는 평가된 회귀 태스크에서 기존 최고의 방법 대비 내분포 일반화에서 최대 6.56% 향상된 성능을 달성한다.
- 메타러닝 환경에서 C-Mixup는 기존의 Vanilla MetaMix 대비 태스크 일반화에서 4.76% 향상된 성능을 기록한다.
- 외분포 내성성에서 C-Mixup는 5.82% 향상되었으며, 특히 공변량 이동 상황에서 두드러진다.
- 하이퍼파라미터 선택에 대해 매우 내성적이다: 다양한 대역폭 σ와 형상 파라미터 α 범위에서 성능이 안정적으로 유지된다.
- 표본, 이미지, 비디오 데이터를 포함한 11개의 데이터셋에서 C-Mixup는 기존의 Vanilla Mixup와 특성 기반 유사도 기반 혼합보다 모두 뛰어난 성능을 보였다.
- 레이블 노이즈가 30% 존재하는 상황에서도 C-Mixup는 ERM 대비 평균 1.0% 향상된 RMSE를 기록했으며, Mixup 대비 1.3% 향상된 성능 유지를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.