Skip to main content
QUICK REVIEW

[論文レビュー] Improving Gender Translation Accuracy with Filtered Self-Training

Prafulla Kumar Choubey, Anna Currey|arXiv (Cornell University)|Apr 15, 2021
Natural Language Processing Techniques参考文献 43被引用数 11
ひとこと要約

本稿では、単語語彙を用いて性別にフィルタリングされた自己学習を提案し、ニューラル機械翻訳における性別翻訳の正確性を向上させる。単語語彙を用いて性別固有の偽並列データを生成・フィルタリングする。この手法により、全体の翻訳品質を損なうことなく、女性的および男性的性別の翻訳の正確性が向上し、5つの言語対で顕著な向上が得られた。

ABSTRACT

Targeted evaluations have found that machine translation systems often output incorrect gender, even when the gender is clear from context. Furthermore, these incorrectly gendered translations have the potential to reflect or amplify social biases. We propose a gender-filtered self-training technique to improve gender translation accuracy on unambiguously gendered inputs. This approach uses a source monolingual corpus and an initial model to generate gender-specific pseudo-parallel corpora which are then added to the training data. We filter the gender-specific corpora on the source and target sides to ensure that sentence pairs contain and correctly translate the specified gender. We evaluate our approach on translation from English into five languages, finding that our models improve gender translation accuracy without any cost to generic translation quality. In addition, we show the viability of our approach on several settings, including re-training from scratch, fine-tuning, controlling the balance of the training data, forward translation, and back-translation.

研究の動機と目的

  • ニューラル機械翻訳における性別バイアス、特に女性的および男性的性別を含む入力での性能不足を是正すること。
  • 訓練データにおける選択バイアスを軽減すること。ここでは、男性的表現が女性的表現よりも過剰に代表されている。
  • 曖昧さのない性別を含む入力の性別翻訳の正確性を向上させながら、全体の翻訳品質を損なわないこと。
  • 複数の言語対や訓練パラダイム(例:ファインチューニング、バックトランスレーション)に適応可能なスケーラブルで柔軟な手法を開発すること。

提案手法

  • 語彙的または屈折的性別マーカーを用いて、ソースの単語語彙コーパスから性別固有の文を抽出する。
  • 初期のNMTモデルを用いて、性別フィルタリング済みの単語語彙データを翻訳し、偽並列コーパスを生成する。
  • 二段階のフィルタリングプロセスを適用する:まずソース側で正しく性別がマークされているかを確認し、次にターゲット側で正確な性別翻訳がなされているかを検証する。
  • ターゲット言語(例:ドイツ語、フランス語、ロシア語)における文法的性別の検出に屈折タグジャを用い、フィルタリングに活用する。
  • フィルタリング済みの性別バランスの取れた偽データを元の訓練データと組み合わせ、NMTモデルを再学習またはファインチューニングする。
  • 言語学的分析を用いてソースおよびターゲット両側をフィルタリングすることで、誤りの伝搬を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1単語語彙データを用いた自己学習は、曖昧さのない性別を含む入力の性別翻訳の正確性を向上させることができるか?
  • RQ2ソースおよびターゲット両側をフィルタリングすることで、誤りの伝搬が軽減され、性別固有の翻訳品質が向上するか?
  • RQ3この手法は、低リソース言語や性別マークの多い言語を含む多様な言語対に効果的に適用可能か?
  • RQ4性別バランスの取れた偽データを追加することで、女性的および男性的入力の両方の性能が向上し、全体の翻訳品質が低下しないか?
  • RQ5ファインチューニングやバックトランスレーションなどの異なる訓練手法下でも、この手法は効果を発揮するか?

主な発見

  • 提案手法は、曖昧さのない性別を含む入力の性別翻訳の正確性を顕著に向上させ、とりわけ代表が不足している女性的表現において顕著な改善を示した。
  • フィルタリングされた自己学習を用いて訓練されたモデルは、全体の翻訳品質に何ら悪影響を及げることなく、性別翻訳の正確性が大幅に向上した。
  • 女性的固有のデータを追加するだけで、女性的および男性的データをバランスよく追加した場合とほぼ同等の改善が得られた。これは、この手法が訓練データ内の性別バイアスを効果的に是正できることを示唆している。
  • このアプローチは5つの言語対(en-de, en-fr, en-he, en-it, en-ru)に一般化可能であり、広範な適用可能性を示した。
  • 男性的入力の性能を維持しながら、女性的入力の正確性を著しく向上させ、翻訳における性別バイアスを低減した。
  • 人間による評価では、自動評価指標に限らない改善が確認され、その恩恵の堅牢性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。