Skip to main content
QUICK REVIEW

[論文レビュー] Personalized Machine Translation: Preserving Original Author Traits

Ella Rabinovich, Shachar Mirkin|arXiv (Cornell University)|Oct 18, 2016
Authorship Attribution and Profiling被引用数 4
ひとこと要約

本稿では、性別アノテート済み並行コーパスを用いたドメイン適応技術を応用することで、翻訳において著者固有の性別的特徴を保持する性別に配慮した統計的機械翻訳(SMT)システムを提案する。標準モデルと比較して、パーソナライズドSMTモデルが翻訳品質を維持しつつも、性別マーカーを著しくよりよく保持していることを示しており、人間翻訳および機械翻訳の両方において、元のテキストからの性別信号が失われる傾向にあることが明らかになった。

ABSTRACT

The language that we produce reflects our personality, and various personal and demographic characteristics can be detected in natural language texts. We focus on one particular personal trait of the author, gender, and study how it is manifested in original texts and in translations. We show that author's gender has a powerful, clear signal in originals texts, but this signal is obfuscated in human and machine translation. We then propose simple domain-adaptation techniques that help retain the original gender traits in the translation, without harming the quality of the translation, thereby creating more personalized machine translation systems.

研究の動機と目的

  • 元のテキストに含まれる性別的特徴が、人間翻訳および機械翻訳の過程でどのように保持されるかを調査すること。
  • 手動翻訳および自動翻訳の両方において、性別マーカーがどの程度曇らされるかを評価すること。
  • SMTシステムに性別情報を統合するドメイン適応技術の開発および評価。
  • 多言語評価用に性別および年齢をアノテートした新しい並行コーパスの作成。
  • パーソナライズドSMTが翻訳品質を維持しつつ、元の著者固有の特徴に近いスタイルを保つことを実証すること。

提案手法

  • 英語、フランス語、ドイツ語のための新しい並行コーパス(Europarl)に性別および年齢情報をアノテートする。
  • 標準SMTシステムを訓練し、性別アノテート済み並行コーパスを用いてドメイン適応技術を適用することで、性別に配慮したSMTモデルを構築する。
  • 情報ゲイン特徴選択を用いて、元言語および対訳言語における性別を判別する語を同定する。
  • 元のテキスト、手動翻訳、自動翻訳(SMTおよびパーソナライズドSMT)における性別分類の正確性を比較する。
  • 並行コーパスの性別固有サブセット上でファインチューニングすることで、パーソナライズドSMTモデルを適用し、著者固有の特徴を保持する。
  • 翻訳出力における性別マーカー(例:‘really’ 対 ‘exactly’、‘think’ 対 ‘believe’)の分析を通じて、パーソナライズ化効果を評価する。

実験結果

リサーチクエスチョン

  • RQ1元のテキストと比較して、人間翻訳および機械翻訳においてどの程度性別的特徴が保持されているか。
  • RQ2なぜ手動翻訳ではSMT出力に比べて性別分類が困難になるのか。
  • RQ3ドメイン適応技術を用いて、著者固有の性別マーカーを保持する性別に配慮したSMTシステムを構築できるか。
  • RQ4元言語における性別マーカーが、対訳言語の翻訳における性別的特徴にどのように影響するか。
  • RQ5元のテキストおよび翻訳済みテキストにおいて、性別の違いを反映する具体的な語彙的および構文的特徴は何か。

主な発見

  • 元のテキストには強い性別信号が存在するが、この信号は手動翻訳および自動翻訳の両方で著しく弱体化する。
  • 手動翻訳の性別分類正確性はSMTより低く、人間翻訳者がSMTシステムよりも性別マーカーを曇らせる可能性があることを示唆している。
  • 性別に配慮したSMTモデルは、標準SMTと比較して翻訳出力における性別分類正確性を向上させつつ、全体の翻訳品質を損なわない。
  • 翻訳プロセスは、元言語の性別マーカーが対訳言語のそれらを支配するハイブリッド性別信号を生じさせる。
  • 英語における『really』(女性的)および『exactly』(男性的)といった特定の語彙的マーカーが、パーソナライズドSMT出力で保持または再導入されることが確認され、効果的なパーソナライズ化が実現していることが示された。
  • 元言語の選択が、翻訳における性別マーカーの検出可能性に顕著に影響し、ドイツ語およびフランス語の出力では英語翻訳において性別信号の持続性が強いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。