[논문 리뷰] When does Bias Transfer in Transfer Learning?
이 논문은 ImageNet과 같은 사전 훈련된 소스 모델의 편향이, 타겟 데이터셋이 명시적으로 편향 제거된 경우에도 다운스트림 작업으로 전이됨을 보여준다. 합성 백도어 공격과 자연스러운 편향 관련 상관관계를 사용하여, 미세조정된 모델이 소스 모델의 편향을 유지함을 입증함으로써, 전이 학습에서의 편향 제거 가정이 깨진다.
Using transfer learning to adapt a pre-trained "source model" to a downstream "target task" can dramatically increase performance with seemingly no downside. In this work, we demonstrate that there can exist a downside after all: bias transfer, or the tendency for biases of the source model to persist even after adapting the model to the target class. Through a combination of synthetic and natural experiments, we show that bias transfer both (a) arises in realistic settings (such as when pre-training on ImageNet or other standard datasets) and (b) can occur even when the target dataset is explicitly de-biased. As transfer-learned models are increasingly deployed in the real world, our work highlights the importance of understanding the limitations of pre-trained source models. Code is available at https://github.com/MadryLab/bias-transfer
연구 동기 및 목표
- 사전 훈련된 소스 모델의 편향이 미세조정 이후 다운스트림 작업으로 지속되는지 조사하기 위해.
- 타겟 데이터셋이 편향 관련 상관관계를 제거하도록 명시적으로 편향 제거된 경우에도 편향 전이가 발생하는지 확인하기 위해.
- 훈련 동역학, 소스 데이터셋 구성, 타겟 데이터 분포가 편향 전이 정도에 미치는 영향을 평가하기 위해.
- 편향 전이가 합성 백도어가 아닌 자연스럽게 발생하는 특징(예: 연령 예측에서의 성별)을 통해 일어나는지 보여주기 위해.
- 특히 공개된 사전 훈련된 모델에 의존할 경우, 널리 사용되는 전이 학습 파ip라인에서 편향 전이의 실제 세계적 영향을 부각하기 위해.
제안 방법
- 일부 이미지에 트리거(예: 노란 원형)를 추가하고 레이블을 뒤집음으로써 소스 데이터셋에 편향을 심는 합성 백도어 공격을 사용하여.
- 소스 모델의 가중치를 초기화로 사용하여, 확률적 경사 하강법(SGD)을 사용해 타겟 데이터셋에서 소스 모델을 미세조정함으로써.
- 타겟 데이터 포인트의 범위에 제한된 기울기 업데이트를 통해 모델의 행동을 분석함으로써, 타겟 데이터 부분공간에 수직인 소스 모델의 편향을 유지함을 보장함.
- 예: CelebA에서 성별과 연령 간의 편향 관련 상관관계를 강화하는 이미지를 걸러내어 자연스럽게 편향된 데이터셋을 구성함으로써, 이러한 편향의 전이 가능성을 테스트함.
- 타겟 데이터셋에서부터 사전 훈련된 ImageNet 소스 모델로 미세조정한 모델들과, 타겟 데이터셋에서부터 처음부터 학습한 모델들(예: CIFAR-10)을 비교함으로써 편향 전이 효과를 고립함.
- 테스트 이미지에 트리거(예: 테니스 볼)를 겹쳐서 올리고 예측 분포의 변화를 측정함으로써 편향을 평가함.
실험 결과
연구 질문
- RQ1소스 데이터셋에 심어진 편향이 미세조정 중에 타겟 작업으로 얼마나 전이되는가?
- RQ2타겟 데이터셋이 편향 관련 상관관계를 제거하도록 명시적으로 편향 제거된 경우에도 편향 전이가 발생할 수 있는가?
- RQ3훈련 루틴, 소스 데이터셋 구성, 타겟 데이터셋 분포가 편향 전이의 크기에 어떤 영향을 미치는가?
- RQ4편향 전이가 합성 트리거가 아닌 자연스럽게 발생하는 특징을 통해 일어나는가?
- RQ5타겟 데이터셋이 이러한 편향을 포함하지 않는 경우에도, 표준 사전 훈련된 모델(예: ImageNet)의 편향이 다운스트림 모델에서 감지될 수 있는가?
주요 결과
- 타겟 데이터셋이 명시적으로 편향 제거된 경우에도, 편향이 심어진 소스 모델에서 미세조정된 모델이 여전히 편향 관련 특징에 민감함을 보여, 편향 전이가 지속됨을 확인함.
- ImageNet에서 사전 훈련된 모델로 미세조정된 모델은 원형 노란 모양이 있는 경우 예측 분포가 비대칭이지만, CIFAR-10에서 처음부터 학습한 모델는 영향을 받지 않음.
- 원형 노란 모양이 있을 경우 '테니스 볼'을 예측하는 데 소스 모델의 편향이 타겟 작업으로 전이됨을 증명하는 바에 따라, 미세조정된 모델의 예측 분포에 심각한 비대칭이 나타남.
- 고정된 특징 미세조정 조건에서도 ImageNet 소스 모델의 편향이 다운스트림 분류기에서 지속됨을 확인함으로써, 특징 추출 과정에서 편향이 제거되지 않음을 입증함.
- 전체 네트워크 미세조정 과정에서도 소스 모델의 편향이 유지됨을 확인함으로써, 기울기 업데이트가 타겟 데이터 부분공간에 수직인 편향을 제거하지 않음을 확인함.
- 현상은 합성 트리거에 국한되지 않음: ImageNet에서 사전 훈련된 모델은 자연스럽게 발생하는 상관관계(예: 연령 예측에서의 성별)에 민감하며, 이는 다운스트림 작업으로 전이됨.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.