[논문 리뷰] The Robustness Limits of SoTA Vision Models to Natural Variation
이 논문은 3D 웨어하우스 오브젝트를 사용해 포즈, 크기, 조도, 배경, 위치의 조절된 영상 변형을 포함한 700만 건이 넘는 새로운 데이터셋을 통해 최신 비전 모델의 자연스러운 변형에 대한 내성 한계를 조사한다. 아키텍처 및 사전학습의 발전에도 불구하고 이러한 변형에 대해 모델은 여전히 취약하며, 내성은 유의미한 비율(≥50%)의 훈련 인스턴스에서 변형이 나타날 경우에만 향상되며, 유사한 클래스들 사이에서는 일반화가 가능하나, 비유사한 클래스들 사이에서는 일반화 실패가 발생한다.
Recent state-of-the-art vision models introduced new architectures, learning paradigms, and larger pretraining data, leading to impressive performance on tasks such as classification. While previous generations of vision models were shown to lack robustness to factors such as pose, it's unclear the extent to which this next generation of models are more robust. To study this question, we develop a dataset of more than 7 million images with controlled changes in pose, position, background, lighting, and size. We study not only how robust recent state-of-the-art models are, but also the extent to which models can generalize variation in factors when they're present during training. We consider a catalog of recent vision models, including vision transformers (ViT), self-supervised models such as masked autoencoders (MAE), and models trained on larger datasets such as CLIP. We find out-of-the-box, even today's best models are not robust to common changes in pose, size, and background. When some samples varied during training, we found models required a significant portion of diversity to generalize -- though eventually robustness did improve. When diversity is only seen for some classes however, we found models did not generalize to other classes, unless the classes were very similar to those seen varying during training. We hope our work will shed further light on the blind spots of SoTA models and spur the development of more robust vision models.
연구 동기 및 목표
- 최신 비전 모델이 포즈, 크기, 조도, 배경, 위치의 자연스러운 변형에 얼마나 내성적인지 평가하기.
- 특히 클래스 간 변동성의 영향을 고려해 훈련 데이터의 변동성이 새로운 변형에 대한 일반화에 어떻게 영향을 미치는지 평가하기.
- 다양한 아키텍처, 훈련 전략, 사전학습 데이터 규모가 내성에 미치는 영향을 비교하기.
- 한 요소의 변동성이 다른 요소의 내성에 영향을 미치는지 조사하기.
- 훈련 중에 변동성이 관찰된 클래스들과 유사한 클래스들에 대해 모델이 얼마나 잘 일반화되는지, 내성의 일반화 범위를 결정하기.
제안 방법
- 3D 웨어하우스 오브젝트를 사용해 포즈, 크기, 조도, 배경, 위치의 조절된 변형을 포함한 700만 건이 넘는 대규모 데이터셋을 구축.
- 표준 절차를 사용해 모델 평가: 하류 작업에서의 피니팅 및 선형 평가.
- ViT, MAE, CLIP, iBOT, ResNets 등 최신 모델들을 다양한 사전학습 데이터와 피니팅 전략으로 훈련 및 테스트.
- 요소별로 변동성이 나타나는 훈련 인스턴스의 비율을 체계적으로 변화시켜 내성에 미치는 영향을 연구.
- 훈련 중에 변동성이 관찰된 클래스들과의 유사도 기반으로 일반화 갭을 측정.
- 한 요소를 변화시킬 때 다른 요소에 대한 내성에 미치는 영향을 측정함으로써 교차 요소 효과 분석.
실험 결과
연구 질문
- RQ1최신 비전 모델은 포즈, 크기, 조도, 배경, 위치의 자연스러운 변형에 대해 얼마나 내성적인가?
- RQ2특히 일부 클래스에 국한된 훈련 데이터의 변동성은 요소 및 클래스 간 일반화에 얼마나 영향을 미치는가?
- RQ3예를 들어 포즈의 변동성이 조도나 배경과 같은 다른 요소의 내성에 향상 효과를 미치는가?
- RQ4훈련 중에 변동이 관찰된 클래스와 비유사한 클래스에 대해 모델 성능은 어떻게 일반화되는가?
- RQ5모델이 요소 간에 잘 내성적으로 작동하기 위해 필요한 최소한의 훈련 변동성 수준은 어느 정도인가?
주요 결과
- 최고의 최신 모델들이라도 배경의 새로운 변형에 대해 테스트 시 최대 48.09%의 정확도 하락을 보이며 내성 부족을 드러낸다.
- 내성 갭을 줄이기 위해 최소 50%의 훈련 인스턴스에서 요소별로 변동성이 나타나야 하며, 이 임계값 이하일 경우는 향상 없음.
- 변동성이 일부 클래스에서만 관찰될 경우, 비유사한 클래스로의 일반화가 떨어지며, iBot-21k의 배경 변형에서 평균 정확도 갭이 -57.96%에 이르게 된다.
- 한 요소의 변동성(예: 포즈)이 다른 요소(예: 조도 또는 크기)의 내성에 영향을 미치며, 모든 모델에서 교차 요소 확산 효과가 관찰된다.
- 훈련 중에 변동이 관찰된 클래스와 유사한 클래스로 모델의 일반화가 가장 잘 되지만, 클래스 유사도가 감소할수록 성능이 급격히 떨어지며, 특히 매우 비유사한 클래스에서 가장 큰 하락이 발생한다.
- 피니팅은 선형 평가 대비 항상 내성을 떨어뜨리며, 더 많은 사전학습 데이터가 내성 향상에 기여하지만, 아키텍처 및 훈련 전략은 미미한 영향을 미친다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.