Skip to main content
QUICK REVIEW

[논문 리뷰] Personalized Machine Translation: Preserving Original Author Traits

Ella Rabinovich, Shachar Mirkin|arXiv (Cornell University)|2016. 10. 18.
Authorship Attribution and Profiling인용 수 4
한 줄 요약

이 논문은 성별에 민감한 통계적 기계 번역(SMT) 시스템을 제안하며, 성별이 주어진 병렬 데이터를 사용한 도메인 적응 기법을 적용하여 원문의 저자 성별 특성을 번역 시 유지한다. 표준 모델에 비해 개인화된 SMT 모델이 번역 품질을 유지하면서도 성별 표시를 훨씬 더 잘 유지하는 것으로 나타났으며, 인간 및 기계 번역에서 원문의 성별 신호가 손실된다는 점을 보여준다.

ABSTRACT

The language that we produce reflects our personality, and various personal and demographic characteristics can be detected in natural language texts. We focus on one particular personal trait of the author, gender, and study how it is manifested in original texts and in translations. We show that author's gender has a powerful, clear signal in originals texts, but this signal is obfuscated in human and machine translation. We then propose simple domain-adaptation techniques that help retain the original gender traits in the translation, without harming the quality of the translation, thereby creating more personalized machine translation systems.

연구 동기 및 목표

  • 원문의 성별 특성이 인간 및 기계 번역 과정에서 유지되는지 여부를 조사하는 것.
  • 수동 번역과 자동 번역 모두에서 성별 표시가 어느 정도 은폐되는지 평가하는 것.
  • SMT 시스템에 성별 정보를 통합하는 도메인 적응 기법을 개발하고 평가하는 것.
  • 다국어 평가를 위한 성별 및 연령 정보가 주석 처리된 새로운 병렬 코퍼스를 구축하는 것.
  • 개인화된 SMT가 번역 품질을 유지하면서도 원문 저자의 특성에 대한 스타일적 충실도를 향상시킬 수 있음을 보여주는 것.

제안 방법

  • 영어, 프랑스어, 독일어에 대해 성별 및 연령 정보가 주석 처리된 새로운 병렬 코퍼스(Europarl)를 구축하는 것.
  • 성별이 주석 처리된 병렬 데이터를 사용하여 표준 SMT 시스템을 학습하고, 도메인 적응 기법을 적용해 성별에 민감한 SMT 모델을 개발하는 것.
  • 원본 언어 및 목표 언어에서 성별을 구분하는 단어를 식별하기 위해 InfoGain 특성 선택 기법을 사용하는 것.
  • 원문, 수동 번역, 자동 번역(SMT 및 개인화된 SMT)에서의 성별 분류 정확도를 비교하는 것.
  • 병렬 데이터의 성별 특성에 맞는 서브셋으로 최적화하여 개인화된 SMT 모델을 적용하여 저자 특성을 유지하는 것.
  • 성별 표시(예: ‘really’ 대비 ‘exactly’, ‘think’ 대비 ‘believe’)를 분석하여 개인화 효과를 평가하는 것.

실험 결과

연구 질문

  • RQ1원문에 비해 인간 번역과 기계 번역에서 성별 특성은 어느 정도 유지되는가?
  • RQ2왜 수동 번역에서는 SMT 출력에 비해 성별 분류가 더 어려운가?
  • RQ3도메인 적응 기법을 사용해 저자 성별 표시를 유지하는 성별에 민감한 SMT 시스템을 구축할 수 있는가?
  • RQ4원본 언어의 성별 표시가 목표 언어 번역의 성별 특성에 어떻게 영향을 주는가?
  • RQ5원문 및 번역된 텍스트에서 성별 차이를 반영하는 특정 어휘적 및 문법적 특징은 무엇인가?

주요 결과

  • 원문에서는 성별이 강력한 신호를 가지지만, 이 신호는 수동 번역과 자동 번역 모두에서 크게 약화된다.
  • 수동 번역의 성별 분류 정확도가 SMT보다 낮아, 인간 번역가가 SMT 시스템보다 성별 표시를 더 많이 은폐할 수 있음을 시사한다.
  • 성별에 민감한 SMT 모델은 표준 SMT에 비해 번역 텍스트에서 더 높은 성별 분류 정확도를 달성하지만, 전체 번역 품질은 저하되지 않는다.
  • 번역 과정에서 원본 언어의 성별 표시가 목표 언어의 성별 표시를 지배하는 하이브리드 성별 신호가 생성된다.
  • 영어에서 여성어휘로 간주되는 ‘really’와 남성어휘로 간주되는 ‘exactly’와 같은 특정 어휘적 표시는 개인화된 SMT 출력에서 유지되거나 재도입되며, 효과적인 개인화를 보여준다.
  • 원본 언어의 선택은 번역에서 성별 표시의 탐지 가능성에 큰 영향을 미치며, 독일어 및 프랑스어 원본은 영어 번역에서 성별 신호의 지속성이 더 강하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.