Skip to main content
QUICK REVIEW

[논문 리뷰] Dictionary-based Debiasing of Pre-trained Word Embeddings

Masahiro Kaneko, Danushka Bollegala|arXiv (Cornell University)|2021. 01. 23.
Natural Language Processing Techniques참고 문헌 61인용 수 5
한 줄 요약

이 논문은 사전 정의된 편향어 목록이나 학습 데이터에 대한 접근이 없이도 사전 기반 방법을 통해 사전에 훈련된 단어 임베딩의 편향을 제거한다. 의미 유지, 사전 정의 일치, 편향 방향과의 수직성이라는 세 가지 목표를 동시에 최적화함으로써, 성별, 인종, 기타 편향을 효과적으로 제거하면서도 벤치마크 작업에서 의미 품질을 유지하거나 향상시킨다.

ABSTRACT

Word embeddings trained on large corpora have shown to encode high levels of unfair discriminatory gender, racial, religious and ethnic biases. In contrast, human-written dictionaries describe the meanings of words in a concise, objective and an unbiased manner. We propose a method for debiasing pre-trained word embeddings using dictionaries, without requiring access to the original training resources or any knowledge regarding the word embedding algorithms used. Unlike prior work, our proposed method does not require the types of biases to be pre-defined in the form of word lists, and learns the constraints that must be satisfied by unbiased word embeddings automatically from dictionary definitions of the words. Specifically, we learn an encoder to generate a debiased version of an input word embedding such that it (a) retains the semantics of the pre-trained word embeddings, (b) agrees with the unbiased definition of the word according to the dictionary, and (c) remains orthogonal to the vector space spanned by any biased basis vectors in the pre-trained word embedding space. Experimental results on standard benchmark datasets show that the proposed method can accurately remove unfair biases encoded in pre-trained word embeddings, while preserving useful semantics.

연구 동기 및 목표

  • 사전 정의된 편향어 목록에 의존하지 않고도 사전 훈련된 단어 임베딩에서 성별, 인종, 민족 편향과 같은 불공정한 편향을 제거하는 데 도전하는 것.
  • 사람이 작성한 사전을 편향이 없고 객관적인 단어 의미의 원천으로 삼아 편향 제거 과정을 안내하는 것.
  • 편향 제거 과정 중 사전 훈련된 임베딩의 의미 정보를 유지하여 후속 NLP 작업에서의 유용성을 보장하는 것.
  • 어휘 공간이 아닌 임베딩 공간에서 작동하므로 사전에 존재하지 않는 단어에도 일반화할 수 있는 방법을 개발하는 것.
  • 원래 학습 코퍼스에 대한 접근이나 단어 임베딩 학습 알고리즘의 세부 정보가 필요 없도록 하는 것.

제안 방법

  • 입력 단어 임베딩을 편향 제거된 표현으로 매핑하는 엔드 투 엔드로 학습 가능한 인코더-디코더 프레임워크를 사용한다.
  • 의미 유지 목적은 디코더를 통해 편향 제거된 출력에서 원래 임베딩을 재구성함으로써 강제로 구현한다.
  • 사전 일치는 두 번째 디코더를 훈련시켜 편향 제거된 임베딩를 단어의 사전 정의의 벡터 표현과 일치시키는 방식으로 달성한다.
  • 편향 수직성은 사전 훈련된 임베딩 공간 내에서 편향 방향과 일치하는 성분을 제거하는 파라미터 없는 투영을 통해 강제로 구현한다.
  • 의미 유지, 사전 일치, 편향 수직성의 세 가지 목표는 다중 작업 학습 목표를 통해 동시에 최적화된다.
  • 이 방법은 모델에 종속되지 않으며 원본 학습 데이터나 사전 훈련 알고리즘의 세부 정보에 접근할 필요가 없다.

실험 결과

연구 질문

  • RQ1사전 정의된 편향어 목록이 없이도 사전 기반 접근이 사전 훈련된 단어 임베딩에서 여러 유형의 편향을 효과적으로 제거할 수 있는가?
  • RQ2제안된 방법은 원래 임베딩과 비교해 편향 제거된 임베딩의 의미 정보를 어느 정도 유지할 수 있는가?
  • RQ3어휘 공간이 아닌 임베딩 공간에서 작동하므로, 사전에 존재하지 않는 단어에 대해 이 방법은 어떻게 일반화되는가?
  • RQ4편향 방향을 위한 수작업으로 구성된 단어 목록에 의존하는 기존의 편향 제거 기법보다 성능이 뛰어나게 작용할 수 있는가?
  • RQ5편향이 없는 의미의 원천으로서 사전 정의를 사용함으로써 후속 의미 작업에서 성능 향상이 이루어지는가?

주요 결과

  • WEAT 및 기타 편향 평가 벤치마크를 통해 측정한 결과, 제안된 방법은 사전 훈련된 단어 임베딩에서 성별, 인종, 연령 관련 편향을 크게 감소시켰다.
  • 의미 유사도 작업에서, 편향 제거된 임베딩는 원래 임베딩와 비슷하거나 略적으로 향상된 성능을 유지했으며, 슼머의 상관계수는 원래 임베딩와 유사하거나 이를 초월했다.
  • 단어 유추 작업에서는 성능을 유지하거나 향상시켰으며, Word2Vec의 WS 데이터셋에서 개선이 관찰되었고, GloVe 임베딩의 모든 데이터셋에서 개선이 이루어졌다.
  • 시각화 결과, 편향 제거된 임베딩는 성별, 인종, 연령 벡터 공간에서 원점 주변으로 더 중심이 맞춰져 있음을 보여, 방향성 편향이 감소했음을 시사한다.
  • 어휘 공간이 아닌 임베딩 공간에서 작동하므로, 사전에 존재하지 않는 단어에 대해서도 잘 일반화되며, 사전의 어휘 매칭에 의존하지 않는다.
  • 사전 정의에 일부 잔류 편향(예: '간호사'와 '가정부'에 성별 언어 포함)이 존재하더라도, 전체적으로 강력한 편향 제거 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.