Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-tuning Large Language Models for Adaptive Machine Translation

Yasmin Moslem, Rejwanul Haque|arXiv (Cornell University)|2023. 12. 20.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 의료 분야에서 실시간 적응형 기계 번역을 위한 문맥 내 학습 능력을 향상시키기 위해, 20,000개의 제로샷 및 원샷 번역 프롬프트로 구성된 혼합 데이터셋을 사용해 Mistral 7B 대규모 언어 모델을 피팅 트레이닝하는 방법을 제안한다. 피팅 트레이닝된 모델은 제로샷 번역 품질에서 NLLB 3.3B와 동등하며, 원샷 성능은 NLLB 3.3B와 ChatGPT "gpt-3.5-turbo"를 모두 초월한다. 이는 소량의 데이터로도 효율적인 오픈소스 LLM이 전문화된 모델이나 상용 모델에 뒤지지 않고 경쟁할 수 있음을 보여준다.

ABSTRACT

This paper presents the outcomes of fine-tuning Mistral 7B, a general-purpose large language model (LLM), for adaptive machine translation (MT). The fine-tuning process involves utilising a combination of zero-shot and one-shot translation prompts within the medical domain. The primary objective is to enhance real-time adaptive MT capabilities of Mistral 7B, enabling it to adapt translations to the required domain at inference time. The results, particularly for Spanish-to-English MT, showcase the efficacy of the fine-tuned model, demonstrating quality improvements in both zero-shot and one-shot translation scenarios, surpassing Mistral 7B's baseline performance. Notably, the fine-tuned Mistral outperforms ChatGPT "gpt-3.5-turbo" in zero-shot translation while achieving comparable one-shot translation quality. Moreover, the zero-shot translation of the fine-tuned Mistral matches NLLB 3.3B's performance, and its one-shot translation quality surpasses that of NLLB 3.3B. These findings emphasise the significance of fine-tuning efficient LLMs like Mistral 7B to yield high-quality zero-shot translations comparable to task-oriented models like NLLB 3.3B. Additionally, the adaptive gains achieved in one-shot translation are comparable to those of commercial LLMs such as ChatGPT. Our experiments demonstrate that, with a relatively small dataset of 20,000 segments that incorporate a mix of zero-shot and one-shot prompts, fine-tuning significantly enhances Mistral's in-context learning ability, especially for real-time adaptive MT.

연구 동기 및 목표

  • 일반 목적의 LLM인 Mistral 7B의 실시간 적응형 기계 번역을 위한 문맥 내 학습 능력을 향상시키는 것.
  • 제로샷 및 원샷 프롬프트의 소규모 혼합 데이터셋으로 피팅 트레이닝을 수행했을 때 의료 분야에서 번역 품질이 향상되는지 평가하는 것.
  • 제로샷 및 원샷 번역 시나리오에서 피팅 트레이닝된 Mistral 7B의 성능을 전문 작업 모델(NLLB 3.3B)과 상용 모델(ChatGPT "gpt-3.5-turbo")과 비교하는 것.
  • 최소한의 피팅 트레이닝 데이터로도 효율적이고 자체 호스팅이 가능하며, 개인정보 보호 기능을 갖춘 오픈소스 LLM을 활용한 번역 시스템을 구현하는 것.

제안 방법

  • 의료 자료(ELRC, EMEA, SciELO, TICO-19)에서 유래한 10,000개의 제로샷 및 10,000개의 원샷 번역 쌍으로 구성된 통합 데이터셋을 사용해 Mistral 7B를 피팅 트레이닝한다.
  • 실시간 적응을 시뮬레이션하기 위해, 제로샷의 경우 소스 문장만 포함된 프롬프트 템플릿을 사용하고, 원샷의 경우 소스 문장과 퍼지 매칭 쌍, 그리고 목표 문단을 포함한 템플릿을 사용한다.
  • 인퍼런스 시에 도메인 적응을 시뮬레이션하기 위해, 50,000개의 세그먼트로 구성된 컨텍스트 데이터셋에서 퍼지 매칭을 검색하는 검색 파이프라인을 활용한다.
  • 모델을 19,000개의 세그먼트로 학습시키고, 1,000개로 검증하며, 별도의 테스트 세트 10,000개와 고유한 컨텍스트 데이터셋을 사용한다.
  • 제로샷 및 원샷 설정 모두에서 BLEU, chrF++, TER, COMET 메트릭을 사용해 번역 품질을 평가한다.
  • 동일한 조건에서 피팅 트레이닝된 Mistral 7B를 베이스라인 Mistral 7B, NLLB 3.3B, ChatGPT "gpt-3.5-turbo"와 비교한다.

실험 결과

연구 질문

  • RQ1일반 목적의 LLM인 Mistral 7B를 소규모 혼합 데이터셋(제로샷 및 원샷 프롬프트)으로 피팅 트레이닝하면, 적응형 기계 번역을 위한 문맥 내 학습 능력이 크게 향상되는가?
  • RQ2피팅 트레이닝된 Mistral 7B는 의료 분야에서 전문 모델인 NLLB 3.3B와 동등한 제로샷 번역 품질을 달성하는가?
  • RQ3피팅 트레이닝된 Mistral 7B는 ChatGPT "gpt-3.5-turbo"와 같은 상용 모델의 원샷 적응형 번역 성능을 따라하거나 초월하는가?
  • RQ4피팅 트레이닝을 통해 모델은 인퍼런스 시에 단일 퍼지 매칭만으로도 도메인 특화 용어와 스타일에 얼마나 잘 적응할 수 있는가?

주요 결과

  • 피팅 트레이닝된 Mistral 7B는 원샷 번역에서 BLEU 점수 49.69를 기록했으며, NLLB 3.3B(47.42)와 ChatGPT "gpt-3.5-turbo"(48.34)를 모두 초월했다.
  • 제로샷 번역에서 피팅 트레이닝된 Mistral 7B는 BLEU 점수 46.71을 기록했으며, NLLB 3.3B(47.02)와 동등한 성능을 보여, 전문 모델과의 성능 동등성을 입증했다.
  • 피팅 트레이닝된 Mistral 7B는 원샷 번역에서 COMET 점수 79.62를 기록했으며, ChatGPT "gpt-3.5-turbo"(80.25)와 NLLB 3.3B(64.57)를 모두 초월해 어법과 적합성 면에서 뛰어난 성능을 보였다.
  • 단지 20,000개의 세그먼트로도 피팅 트레이닝을 수행했을 때 모델의 문맥 내 학습 능력이 향상되어, 제로샷 및 원샷 프롬프트 혼합 데이터셋으로의 피팅 트레이닝이 일반 번역 및 적응형 번역 성능 향상에 기여함을 입증했다.
  • 피팅 트레이닝된 Mistral 7B는 ChatGPT "gpt-3.5-turbo"와 유사한 원샷 성능 향상을 달성했으며, 더 효율적이고 자체 호스팅이 가능해 상용 모델에 비해 개인정보 보호 기능을 갖춘 대안이 될 수 있다.
  • 결과적으로, 효율적인 오픈소스 LLM을 피팅 트레이닝하면 전문 모델 및 상용 모델 수준의 번역 품질을 달성할 수 있으며, 특히 도메인 특화 문맥 내 학습을 활용할 경우 더욱 뛰어난 성능을 발휘할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.