Skip to main content
QUICK REVIEW

[논문 리뷰] Using natural language prompts for machine translation

Xavier García, Orhan Fırat|arXiv (Cornell University)|2022. 02. 23.
Natural Language Processing Techniques인용 수 15
한 줄 요약

이 논문은 전통적인 언어 태그 대신 자연어 프롬프트(예: '스페인어로 번역해 주세요:')를 사용하여 다국어 기계 번역 모델을 제어하는 방법을 제안한다. 사전 훈련된 모델을 태그 대신 프롬프트로 피니테이닝함으로써, 별도의 추가 파rameter 없이 오직 영어 언어명만으로도 훈련 중에 볼 수 없었던 언어로의 제로샷 번역이 가능해지며, 최소한의 피니테이닝으로도 뛰어난 성능을 달성한다.

ABSTRACT

We explore the use of natural language prompts for controlling various aspects of the outputs generated by machine translation models. We demonstrate that natural language prompts allow us to influence properties like formality or specific dialect of the output. We show that using language names to control the output language of multilingual translation models enables positive transfer for unseen language pairs. This unlocks the ability to translate into languages not seen during fine-tuning by using their English names. We investigate how scale, number of pre-training steps, number of languages in fine-tuning, and language similarity affect this phenomenon.

연구 동기 및 목표

  • 자연어 프롬프트가 번역 출력의 형식성 및 어조와 같은 성질을 제어할 수 있는지 탐색한다.
  • 프롬프트가 새로운 파rameter를 도입하지 않고도 다국어 번역 모델에서 언어 태그를 대체할 수 있는지 조사한다.
  • 프롬프트가 훈련 중에 볼 수 없었던 언어로의 제로샷 번역을 가능하게 하는지 평가한다.
  • 모델 규모, 사전 훈련 데이터, 언어 수, 언어 유사성 등이 프롬프트 기반 전이에 미치는 영향을 분석한다.

제안 방법

  • 입력 시퀀스에서 기존의 언어 태그(예: <2es>)를 자연어 프롬프트(예: '스페인어로 번역해 주세요:')로 대체한다.
  • 태그 대신 프롬프트를 사용하여 병렬 데이터에서 다국어 번역 모델을 피니테이닝함으로써 원래의 모델 아키텍처를 유지한다.
  • 추론 시에 영어 언어명(예: '스페인어', '독일어')을 사용하여 훈련 중에 볼 수 없었던 언어도 대상 언어로 지정한다.
  • 성능 저하를 방지하기 위해 언어 태그 모델을 단지 100스텝 동안만 프롬프트에 적응시키기 위해 피니테이닝하여 프롬프트 적응 모델을 훈련한다.
  • 완전히 감독된 학습, 제로샷, 한 개의 병렬 언어, 병렬 데이터가 없는 쌍의 네 가지 수준의 데이터 감독을 기반으로 성능을 평가한다.
  • 세 가지 모델 변종을 비교한다: 언어 태그 모델, 프롬프트로 처음부터 훈련한 모델, 언어 태그 모델에서 피니테이닝한 프롬프트 적응 모델.

실험 결과

연구 질문

  • RQ1자연어 프롬프트가 번역 출력의 형식성 및 어조를 효과적으로 제어할 수 있는가?
  • RQ2언어 이름을 프롬프트로 사용하면 훈련 중에 볼 수 없었던 언어로의 제로샷 번역이 가능한가?
  • RQ3모델 규모, 사전 훈련 데이터, 언어 수, 언어 유사성은 프롬프트 기반 전이에 어떤 영향을 미치는가?
  • RQ4언어 태그 모델을 프롬프트 사용으로 피니테이닝하는 것이 프롬프트로 처음부터 훈련하는 것보다 더 나은 성능을 내는가?

주요 결과

  • 언어 태그 모델을 프롬프트 사용으로 피니테이닝한 Adapted 모델은 특히 병렬 데이터가 없는 언어 쌍에서 제로샷 번역 성능을 크게 향상시켰다.
  • 영어 → 독일어 번역 작업에서 Adapted 모델은 BLEU 점수 36.6을 기록했으며, 언어 태그 베이스라인의 18.6보다 뛰어난 성능을 보였다. 이는 강력한 제로샷 전이 능력을 보여준다.
  • 제로샷 프랑스어 → 스페인어 쌍에서 Adapted 모델은 BLEU 점수 34.8을 기록했으며, 언어 태그 모델의 43.8보다 뚜렷한 향상을 보였다. 이는 프롬프트 일반화 능력이 효과적임을 시사한다.
  • 감독된 언어 쌍에서 Adapted 모델는 거의 동일한 성능(예: 영어 → 프랑스어: BLEU 40.4 vs. 언어 태그 모델의 40.0)을 유지했으며, 기존 언어 쌍에 대한 부정적 영향이 최소한임을 보였다.
  • 프롬프트로 처음부터 훈련한 결과는 언어 태그를 사용한 것보다 열등했으며, 이는 프롬프트 학습이 사전 훈련된 인덕티브 바이어스로부터 유의미한 이점을 얻음을 시사한다.
  • 이 방법을 통해 '구자라티' 또는 '체코어'와 같이 오직 영어 언어명만으로도 훈련 중에 볼 수 없었던 언어로의 번역이 가능해지며, 추가 파rameter나 레이블링된 데이터가 필요하지 않다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.