[논문 리뷰] Increasing Shape Bias in ImageNet-Trained Networks Using Transfer Learning and Domain-Adversarial Methods
이 논문은 스타일 전이 데이터 증강과 도메인 적대적 훈련을 결합하여 ImageNet 사전 훈련된 CNN의 형태 편향을 높이는 방법을 제안한다. 이 방법은 정확도를 손상시키지 않은 채 텍스처 및 색상 변동성에 대한 강건성을 향상시키며, 도메인 적대적 훈련을 통해 여러 데이터셋에서 스타일화된 테스트 세트에서의 성능을 추가로 향상시켜 형태 기반 일반화 능력 향상이 확인된다.
Convolutional Neural Networks (CNNs) have become the state-of-the-art method to learn from image data. However, recent research shows that they may include a texture and colour bias in their representation, contrary to the intuition that they learn the shapes of the image content and to human biological learning. Thus, recent works have attempted to increase the shape bias in CNNs in order to train more robust and accurate networks on tasks. One such approach uses style-transfer in order to remove texture clues from the data. This work reproduces this methodology on four image classification datasets, as well as extends the method to use domain-adversarial training in order to further increase the shape bias in the learned representation. The results show the proposed method increases the robustness and shape bias of the CNNs, while it does not provide a gain in accuracy.
연구 동기 및 목표
- ImageNet 훈련된 CNN에서 잘 알려진 텍스처 및 색상 편향이 형태 기반 일반화 능력에 악영향을 미치는 문제를 해결하기 위해.
- 스タイル 전이 데이터 증강만으로도 다양한 이미지 분류 작업에서 CNN의 형태 편향과 강건성을 향상시킬 수 있는지 조사하기 위해.
- 스タイル 전이와 도메인 적대적 훈련을 통합할 경우 모델의 형태 편향과 일반화 능력이 향상되는지 평가하기 위해.
- 제안된 방법이 원본 데이터셋에서의 성능을 유지하거나 향상시키면서도 스타일화된 테스트 세트에서의 강건성을 향상시키는지 확인하기 위해.
제안 방법
- 예술적 스타일의 텍스처 및 색상 정보로 대체함으로써 형태 정보만 유지하는 방식으로 신경망 스타일 전이를 사용해 훈련 데이터를 증강한다.
- 기본 이미지와 스타일 전이된 이미지의 혼합 데이터셋을 사용해 CNN을 훈련함으로써 형태 기반 특징 학습을 장려한다.
- 특징 추출기가 도메인 불변 표현을 생성하도록 유도하기 위해 도메인 구분자 도입을 통해 도메인 적대적 훈련을 도입한다.
- 분류 손실과 도메인 적대적 손실을 조합한 다중 작업 손실을 사용해 정확도와 도메인 불변성을 동시에 최적화한다.
- SqueezeNet 1.1과 ResNet-34 아키텍처를 사용해 사전 훈련된 모델을 사전에 4개의 데이터셋(Dice, Dogs vs. Cats, Dog Breed Identification, Food101)에서 미세 조정한다.
- 기본(기본) 및 스타일화된 테스트 세트 양쪽에서 모델을 평가하여 형태 편향과 강건성을 측정한다.
실험 결과
연구 질문
- RQ1스タイル 전이 데이터 증강과 도메인 적대적 훈련을 결합하면 ImageNet 사전 훈련된 CNN의 형태 편향을 높일 수 있는가?
- RQ2기본 모델 대비 제안된 방법이 스타일화된 테스트 세트에서 얼마나 더 강건한가?
- RQ3도메인 적대적 훈련의 포함 여부가 원본 및 스타일화된 데이터에서의 일반화 능력 향상과 정확도 향상에 기여하는가?
- RQ4제안된 방법이 원본 데이터셋에서의 정확도를 유지하거나 향상시키면서도 형태 기반 일반화 능력을 크게 향상시킬 수 있는가?
- RQ5다양한 복잡도와 클래스 다양성을 가진 데이터셋 간에 제안된 방법의 성능 변화는 어떠한가?
주요 결과
- 제안된 방법은 모든 4개의 데이터셋에서 형태 편향과 강건성을 향상시켰으며, 원본(기본) 테스트 세트에서 정확도에 하락이 없었다.
- Dog Breed Identification 데이터셋에서 도메인 적대적 모델은 기본 세트에서 93.85%의 정확도를 기록했고, 스타일화된 세트에서는 94.21%를 기록하여 기본 모델보다 스타일화된 세트에서 더 높은 성능를 보였다.
- Food101 데이터셋에서 도메인 적대적 모델은 기본 세트에서 92.90%의 정확도를 기록했고, 스타일화된 세트에서는 90.36%의 정확도를 기록했으며, 절대 정확도는 낮아졌지만 강건성이 향상됨을 보였다.
- 도메인 적대적 훈련으로 인해 DBI 데이터셋에서 스타일화된 테스트 세트에서 기존 모델 대비 1.02% 향상되었고, Food101 데이터셋에서는 2.54% 향상되었다.
- 기본 이미지와 스타일화된 이미지를 혼합해 훈련한 결과 기본 정확도는 향상되지 않았지만, 스타일화된 데이터에서의 성능 향상이 뚜렷하여 형태 편향 증가가 확인되었다.
- 도메인 적대적 구성 요소는 정규화 효과를 제공하여 일반화 능력을 향상시키고, 특히 복잡하고 클래스 다양성이 높은 데이터셋에서 텍스처 신호에 대한 과도한 의존도를 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.