[논문 리뷰] Towards Robustifying NLI Models Against Lexical Dataset Biases
이 논문은 자연어 추론(NLI) 모델의 어휘 편향을 줄이기 위해 모델 수준의 디 biases 방법을 제안한다. 특히 모순어 편향(CWB)과 어휘 겹침 편향(WOB)을 대상으로 한다. 백오브워드(BoW) 서브모델을 도입하고, 이를 주 모델과 수직으로 유지함으로써, 편향된 어휘적 신호에 대한 의존도를 크게 감소시키면서도 높은 전체 정확도를 유지한다. 이는 데이터 수준의 디 biases 및 임bedding 수준의 디 biases 방법보다 우수한 성능을 보인다.
While deep learning models are making fast progress on the task of Natural Language Inference, recent studies have also shown that these models achieve high accuracy by exploiting several dataset biases, and without deep understanding of the language semantics. Using contradiction-word bias and word-overlapping bias as our two bias examples, this paper explores both data-level and model-level debiasing methods to robustify models against lexical dataset biases. First, we debias the dataset through data augmentation and enhancement, but show that the model bias cannot be fully removed via this method. Next, we also compare two ways of directly debiasing the model without knowing what the dataset biases are in advance. The first approach aims to remove the label bias at the embedding level. The second approach employs a bag-of-words sub-model to capture the features that are likely to exploit the bias and prevents the original model from learning these biased features by forcing orthogonality between these two sub-models. We performed evaluations on new balanced datasets extracted from the original MNLI dataset as well as the NLI stress tests, and show that the orthogonality approach is better at debiasing the model while maintaining competitive overall accuracy. Our code and data are available at: https://github.com/owenzx/LexicalDebias-ACL2020
연구 동기 및 목표
- NLI 모델의 어휘 데이터셋 편향이 데이터 수준의 디 biases만으로 완전히 제거될 수 있는지 조사하기 위해.
- 기존의 성별 편향 완화 기법이 NLI의 어휘 편향에 대해 이식 가능할지 평가하기 위해.
- 편향 패턴에 대한 사전 지식 없이도 어휘 단서에 대한 의존도를 줄이기 위한 새로운 모델 수준의 접근법을 탐색하기 위해.
- BoW 서브모델과 주 모델 간의 수직성을 강제하여 편향된 특징 학습을 억제하는 방법을 개발하고 평가하기 위해.
제안 방법
- 어휘적 특징을 캡처하기 위해, 어휘 겹침과 否정어와 같은 데이터셋 편향을 악용할 가능성이 높은 백오브워드(BoW) 서브모델을 도입한다.
- 주 모델의 은닉 표현과 BoW 서브모델 간의 수직성을 투영 기반 메커니즘(HEX)을 통해 강제함으로써, 주 모델이 편향된 특징에 의존하지 않도록 한다.
- 공유 손실을 사용하여 주 모델과 BoW 서브모델을 함께 훈련함으로써, 모델이 편향된 어휘 패턴을 학습하는 것을 정규화한다.
- qualitative 분석을 위해 LIME을 적용하여, 수직성 메커니즘이 어떻게 'no'와 같은 편향된 단어에서 시맨틱적으로 관련 있는 특징(예: 시간적 동사, 내용어)으로 주의를 이동시키는지 시각화한다.
- MNLI에서 추출한 균형 잡힌 데이터셋과 악성 스트레스 테스트 데이터셋을 사용하여, CWB와 WOB에 대한 강건성을 평가한다.
- 다양한 어휘 편향에 대한 일반화를 향상시키기 위해 다수의 BoW 서브모델을 조합한 앙상블 버전을 탐색한다.
실험 결과
연구 질문
- RQ1NLI 모델의 어휘 데이터셋 편향은 데이터 수준의 디 biases만으로 완전히 제거될 수 있는가?
- RQ2성별 편향에 대해 개발된 기존의 디 biases 기법은 NLI의 어휘 편향에 적용 가능한가?
- RQ3특히 수직 특징 분해를 통한 모델 수준의 정규화가 어휘 단서에 대한 의존도를 효과적으로 줄일 수 있는가?
- RQ4BoW 서브모델과 주 모델 간의 수직성을 강제함으로써 성능 저하 없이 강건성을 향상시킬 수 있는가?
주요 결과
- 증강 또는 합성 데이터를 통한 데이터 수준의 디 biases는 모델 편향을 약간만 감소시키며, 대규모 데이터 추가에도 불구하고 완전히 제거하지 못한다.
- 임베딩 수준의 디 biases는 어휘 편향에 대해 효과적이지 않으며, 이는 이러한 편향이 임베딩 수준에 의해 캡처되지 않고 고차원적 조합성에서 발생하기 때문임을 시사한다.
- 수직성 정규화를 적용한 BoW 서브모델은 CWB 및 WOB 테스트 세트에서 유의미하게 높은 강건성을 확보하였으며, 스트레스 테스트 세트에서 Acc_hr 성능이 최대 15% 향상되었다.
- 모델은 경쟁력 있는 전체 정확도를 유지하였으며, 기준 모델 대비 MNLI 및 스트레스 테스트 세트에서 각각 1.4%와 1.3%의 정확도 하락만을 보였다.
- LIME를 활용한 정성적 분석 결과, BoW 서브모델 적용 후 'no'와 같은 편향된 단어에서 시간적 동사나 내용어 매칭과 같은 시맨틱적으로 관련 있는 특징으로 주의가 이동하는 것으로 확인되었다.
- 여러 개의 BoW 서브모델을 앙상블한 결과, WOB 스트레스 테스트에서는 약간의 성능 향상이 있었지만, 모든 설정에서 일관된 개선은 없었으며, 이는 단일 서브모델의 수직성 강제가 이미 매우 효과적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.