[논문 리뷰] Improving Gender Translation Accuracy with Filtered Self-Training
이 논문은 단일 언어 코퍼스를 사용하여 성별에 특화된 가짜 병렬 데이터를 생성하고 필터링하는 성별 필터링 자가학습을 제안하여 신경 기계 번역(NMT)에서 성별 번역 정확도를 향상시킨다. 이 방법은 전체 번역 품질에 해를 끼치지 않으면서 여성성 및 남성성 성별 정확도를 높이며, 다섯 개의 언어 쌍에서 뚜렷한 성과 향상을 이룬다.
Targeted evaluations have found that machine translation systems often output incorrect gender, even when the gender is clear from context. Furthermore, these incorrectly gendered translations have the potential to reflect or amplify social biases. We propose a gender-filtered self-training technique to improve gender translation accuracy on unambiguously gendered inputs. This approach uses a source monolingual corpus and an initial model to generate gender-specific pseudo-parallel corpora which are then added to the training data. We filter the gender-specific corpora on the source and target sides to ensure that sentence pairs contain and correctly translate the specified gender. We evaluate our approach on translation from English into five languages, finding that our models improve gender translation accuracy without any cost to generic translation quality. In addition, we show the viability of our approach on several settings, including re-training from scratch, fine-tuning, controlling the balance of the training data, forward translation, and back-translation.
연구 동기 및 목표
- 신경 기계 번역(NMT)에서 성별 편향을 해결하고, 특히 여성성 및 남성성 성별을 가진 입력에서의 성능 저하를 개선한다.
- 학습 데이터에서 선택 편향을 완화하며, 여성성 대비 남성성 참조가 과도하게 많이 포함된 것을 개선한다.
- 모호하지 않은 성별을 가진 입력에 대해 성별 번역 정확도를 향상시키되, 전체 번역 품질을 떨어뜨리지 않는다.
- 다양한 언어 쌍과 학습 프레임워크(예: 피나이팅, 백트랜스레이션)에 적용 가능한 확장성 있고 적응 가능한 방법을 개발한다.
제안 방법
- 어휘적 또는 형태소적 성별 표시자를 사용하여 원천 단일 언어 코퍼스에서 성별에 특화된 문장을 추출한다.
- 초기 NMT 모델을 사용하여 성별 필터링된 단일 언어 데이터를 번역하여 가짜 병렬 코퍼스를 생성한다.
- 이중 단계 필터링 프로세스를 적용한다: 먼저 원천 측에서 성별 표시가 올바른지 확인하고, 그 다음 목표 측에서 성별 번역이 정확한지 검증한다.
- 목표 언어(예: 독일어, 프랑스어, 러시아어)에서 문법적 성별을 탐지하기 위해 형태소 태거를 사용하여 필터링한다.
- 필터링된 성별 균형 잡힌 가짜 데이터를 원본 학습 데이터와 결합하여 NMT 모델을 재학습하거나 피나이팅한다.
- 언어 분석을 통해 원천 및 목표 측 모두를 필터링하여 오류 전파를 최소화한다.
실험 결과
연구 질문
- RQ1단일 언어 데이터를 사용한 자가학습이 모호하지 않은 성별을 가진 입력의 성별 번역 정확도를 향상시킬 수 있는가?
- RQ2원천 및 목표 측 모두를 필터링함으로써 오류 전파를 줄이고 성별 특화 번역 품질을 향상시킬 수 있는가?
- RQ3이 방법은 저자원 또는 높은 성별 표시가 필요한 언어 쌍에 효과적으로 적용될 수 있는가?
- RQ4성별 균형 잡힌 가짜 데이터를 추가하면 전체 번역 품질을 떨어뜨리지 않고 여성성 및 남성성 입력 양쪽에서 성능 향상을 이룰 수 있는가?
- RQ5피나이팅 또는 백트랜스레이션과 같은 다양한 학습 제도에서 이 방법의 성능은 어떻게 되는가?
주요 결과
- 제안된 방법은 명확하게 성별이 지정된 입력에서 성별 번역 정확도를 크게 향상시키며, 특히 부족하게 표현된 여성성 참조에서 두드러진 성과를 보인다.
- 필터링된 자가학습을 사용해 학습된 모델은 전체 번역 품질에 영향을 주지 않으면서도 성별 정확도에서 큰 향상을 보였다.
- 여성성 전용 데이터만 추가해도 균형 잡힌 여성성 및 남성성 데이터를 추가한 것과 거의 동일한 향상을 달성했으며, 이는 학습 데이터의 성별 불균형을 효과적으로 보완함을 시사한다.
- 이 방법은 다섯 개의 언어 쌍(en-de, en-fr, en-he, en-it, en-ru)에 걸쳐 일반화되어 있어 광범위한 적용 가능성을 보였다.
- 남성성 입력 성능은 유지하면서 여성성 입력의 정확도를 크게 향상시켜 번역에서의 성별 편향을 줄였다.
- 인간 평가 결과는 자동 평가 지표에 국한되지 않는 개선이 있음을 확인하였으며, 성과의 견고성을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.