[논문 리뷰] Turning a Blind Eye: Explicit Removal of Biases and Variation from Deep Neural Network Embeddings
이 논문은 도메인 적응을 영감으로 삼은 방법인 JLU(Jacobian-based Linear Unlearning)를 제안하여, 나이, 성별, 조상 기원, 자세와 같은 다수의 비합리적 편향을 딥 네ural 네트워크 임베딩에서 명시적으로 제거한다. 보조 분류기를 통해 이러한 편향을 예측하고, 그 예측 분포와 균일 분포 간의 교차 엔트로피를 최소화함으로써 특징 공간이 이러한 변동성에 민감하지 않게 만든다. 이로 인해 주된 작업 성능은 유지되며, 편향된 데이터로 훈련할 경우 비편향 테스트 세트에서 최대 20%의 정확도 향상을 달성한다.
Neural networks achieve the state-of-the-art in image classification tasks. However, they can encode spurious variations or biases that may be present in the training data. For example, training an age predictor on a dataset that is not balanced for gender can lead to gender biased predicitons (e.g. wrongly predicting that males are older if only elderly males are in the training set). We present two distinct contributions: 1) An algorithm that can remove multiple sources of variation from the feature representation of a network. We demonstrate that this algorithm can be used to remove biases from the feature representation, and thereby improve classification accuracies, when training networks on extremely biased datasets. 2) An ancestral origin database of 14,000 images of individuals from East Asia, the Indian subcontinent, sub-Saharan Africa, and Western Europe. We demonstrate on this dataset, for a number of facial attribute classification tasks, that we are able to remove racial biases from the network feature representation.
연구 동기 및 목표
- 훈련 데이터에서 비합리적 편향(예: 성별, 나이, 조상 기원 등)을 학습하고 증폭하는 딥 네ural 네트워크 문제를 해결하기 위해.
- 주된 분류 작업 성능을 훼손하지 않으면서도 학습된 특징 표현에서 알려진 편향을 명시적으로 제거할 수 있는 방법을 개발하기 위해.
- 편향된 데이터셋으로 훈련함으로써 비편향 테스트 데이터에서의 모델 일반화 능력을 향상시키기 위해 명시적 편향 제거를 수행하기 위해.
- 편향 완화 연구를 지원하기 위해 14,000장의 이미지를 포함한 새로운 다양성 있는 조상 기원 데이터셋(LAOFIW)을 구축하고 공개하기 위해.
- 다수의 비합리적 변동성을 동시에 제거함으로써 얼굴 속성 분류의 공정성과 내구성을 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 주된 네트워크의 특징 임베딩에서 비합리적 변동성(예: 성별, 나이, 자세)을 예측하기 위한 보조 분류기를 사용한다.
- 각 비합리적 변동성의 예측 분포와 균일 분포 간의 교차 엔트로피를 최소화함으로써, 네트워크가 이러한 특성에 대해 정보를 갖지 않도록 유도한다.
- JLU 알고리즘은 훈련 중에 적용되어 특징 추출기가 지정된 편향에 대해 불변이 되도록 정밀하게 보정된다.
- 도메인 적응을 영감으로 삼아, 대조적 목표를 사용하여 특징 공간이 불필요한 변동성에 민감하지 않게 정렬되도록 한다.
- 다양한 비합리적 변동성에 대해 순차적 또는 동시적으로 적용되며, 각각의 경우에 대해 하류 분류 정확도를 통해 성능을 평가한다.
- 다양한 편향을 제거하는 데 어려움이 달라지므로 동적 가중치 기법을 제안한다.
실험 결과
연구 질문
- RQ1주된 분류 작업 성능을 유지하면서도, 성별, 나이, 조상 기원, 자세와 같은 다수의 비합리적 변동성에 대해 딥 네럴 네트워크가 민감하지 않게 만들 수 있는가?
- RQ2특징 표현에서 알려진 편향을 명시적으로 제거하면, 특히 매우 편향된 데이터셋으로 훈련할 경우 비편향 테스트 데이터에서의 일반화 능력이 향상되는가?
- RQ3JLU 알고리즘이 특정 편향을 어느 정도 제거할 수 있으며, 다양한 종류의 비합리적 변동성에 따라 성능가 어떻게 달라지는가?
- RQ4편향 제거가 주 작업 정확도에 어떤 영향을 미치며, 극단적인 편향 상황에서는 성능 향상이 가능할 수 있는가?
- RQ5대규모이고 다양한 조상 기원 데이터셋(LAOFIW)을 효과적으로 활용하여 편향 제거 기법을 훈련하고 평가할 수 있는가?
주요 결과
- JLU 알고리즘이 12개 사례 중 9개에서 비합리적 변동성의 분류 정확도를 랜덤 수준(랜덤과 5% 이내)으로 낮춰 효과적인 편향 제거를 입증했다.
- 나이 편향이 있는 데이터셋에서 성별 분류기를 훈련할 경우, JLU 방법은 비편향 테스트 세트에서 정확도를 최대 20% 향상시켜 일반화 능력 향상을 보였다.
- 나이 분류 작업에서는 주 작업 정확도가 기준선 대비 5% 감소했지만, 성별과 자세 정보는 각각 88%와 91% 제거되었다.
- 조상 기원 분류에서는 주 작업 정확도가 1% 향상되었으며, 나이 정보의 92%, 성별 정보의 98%, 자세 정보의 86%가 제거되었다.
- 자세 변동성이 가장 제거하기 어려웠으며, 자세 정보의 86%만 제거되었고, 조상 기원 정보는 제거가 가장 어려웠다. 이는 특징의 내재된 엔트레인먼트를 시사한다.
- 모든 실험에서 주 작업 성능을 유지하거나 향상시켰으며, 이는 편향 제거가 주 작업 성능을 손상시키지 않음을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.