Skip to main content
QUICK REVIEW

[논문 리뷰] ParroT: Translating during Chat using Large Language Models tuned with Human Translation and Feedback

Wenxiang Jiao, Jen-tse Huang|arXiv (Cornell University)|2023. 04. 05.
Topic Modeling인용 수 6
한 줄 요약

ParroT는 인간이 작성한 번역과 피드백을 활용하여 지침 유형 3종(번역, 대비, 오류 유도)을 사용해 오픈소스 대규모 언어 모델(Large Language Models, LLMs)을 미세조정함으로써 실시간 채팅 번역을 향상시킨다. 특히 오류 유도 미세조정을 통해 성능 향상이 두드러지며, 낮은 품질의 인간 주석 번역에서 학습하는 것이 표준 지침 미세조정을 넘어서 번역 품질 향상에 기여한다는 것을 입증한다.

ABSTRACT

Large language models (LLMs) like ChatGPT have exhibited remarkable abilities on a wide range of natural language processing~(NLP) tasks, including various machine translation abilities accomplished during chat. However, these models are only accessible through restricted APIs, which creates barriers to new research and advancements in the field. Therefore, we propose ParroT, a framework to enhance and regulate the translation abilities during chat based on open-source LLMs (e.g., LLaMA), human-written translation and feedback data. Specifically, ParroT reformulates translation data into the instruction-following style, and introduces a "$\mathbf{Hint}$" field for incorporating extra requirements to regulate the translation process. Accordingly, we propose three instruction types for finetuning ParroT models, including translation instruction, contrastive instruction, and error-guided instruction. Experiments on Flores subsets and WMT22 test sets suggest that translation instruction improves the translation performance of vanilla LLMs significantly while error-guided instruction can lead to further improvement, which demonstrates the importance of learning from low-quality translations annotated by humans. We also demonstrate the potential of automatic evaluation tools in providing quality information of translations, when constructing error-guided instructions for directions that lack human annotation data. Please refer to our Github project for more implementation details: https://github.com/wxjiao/ParroT

연구 동기 및 목표

  • 인터랙티브 채팅 환경에서 오픈소스 LLM의 번역 능력을 향상시키고 규제하기 위한 프레임워크 개발
  • ChatGPT나 GPT-4와 같은 전용 모델에 대한 액세스 제한을 극복하기 위해 오픈소스 모델을 활용해 고품질 번역을 가능하게 하기
  • 인간이 작성한 번역 데이터와 인간 피드백을 활용해 LLM을 인간의 선호도와 번역 품질에 더 잘 맞추기 위해 미세조정 수행
  • 번역, 대비, 오류 유도 지침 유형의 효과성을 평가하여 번역 성능 향상에 기여하는지 탐구하기
  • 인간 주석 오류 데이터가 부족한 경우 자동 평가 도구(예: COMET)가 오류 유도 지침을 생성할 잠재력을 탐색하기

제안 방법

  • 번역 데이터를 지침 수용 형식으로 재구성하고 번역 규제를 위한 추가 제약 조건을 포함하기 위해 '힌트' 필드를 도입
  • 세 가지 지침 유형 도입: (1) 기본 번역을 위한 번역 지침, (2) 두 번역을 비교하고 선호되는 출력을 제공하는 대비 지침, (3) 인간 주석 오류를 힌트로 사용하는 오류 유도 지침
  • WMT 검증 데이터와 MQM 인간 평가 데이터를 기반으로 오픈소스 LLM(LLaMA 및 BLOOM)을 지침 미세조정 수행
  • 과적합 방지를 위해 일반화 능력을 향상시키기 위해 저차원 적응(Low-Rank Adaptation, LoRA)을 적용한 파rameter 효율적 미세조정 수행
  • 인간 주석 오류 데이터가 없는 언어 조합의 경우 자동 평가 지표(예: COMET)를 활용해 가짜 오류 유도 지침 생성
  • 자동 평가 및 인간 평가 지표를 사용해 Flores 서브셋과 WMT22 테스트 세트에서 ParroT 모델 평가 수행

실험 결과

연구 질문

  • RQ1인간이 작성한 번역을 활용한 지침 미세조정이 채팅 환경에서 오픈소스 LLM의 번역 성능을 뚜렷이 향상시킬 수 있는가?
  • RQ2오류 유도 지침 형태로 인간 피드백을 통합할 경우 번역 품질 향상이 측정 가능한가?
  • RQ3대비 지침은 고품질과 저품질 번역 간의 차이를 인식하도록 LLM을 학습시키는 데 얼마나 효과적인가?
  • RQ4인간 주석 오류 데이터가 없는 경우 자동 평가 도구(예: COMET)가 신뢰성 있게 오류 신호를 생성해 효과적인 오류 유도 지침을 구성할 수 있는가?
  • RQ5파rameter 효율적 미세조정(LoRA)은 자원이 풍부한 언어 쌍과 자원이 부족한 언어 쌍 모두에서 성능을 얼마나 잘 유지하는가?

주요 결과

  • 번역 지침은 기본 LLM의 번역 성능을 뚜렷이 향상시키며, 특히 영어에서 다른 언어로의 번역 방향에서 두드러진다.
  • 오류 유도 지침은 모델이 오류 없는 번역을 생성하도록 가능하게 하여 낮은 품질의 인간 주석 번역에서 학습하는 것이 번역 품질 향상에 가치가 있음을 입증한다.
  • 대비 지침은 성능 향상 효과를 내지 못했으며, 이는 WMT 시스템 간의 미세한 품질 차이와 지침 형식이 최적화되지 않은 데 기인할 가능성이 높다.
  • LoRA 기반 미세조정은 과적합을 방지하고 주로 사용되는 언어에서 뛰어난 성능을 달성하지만, 자원이 부족한 언어의 경우 학습 속도가 느려진다.
  • COMET와 같은 자동 평가 도구는 인간 주석 오류 데이터가 없는 상황에서 오류 유도 지침 구성에 효과적인 품질 신호를 생성할 수 있다.
  • ParroT 프레임워크는 오픈소스 LLM이 채팅 환경에서 고품질 인터랙티브 번역을 수행할 수 있도록 성공적으로 가능케 하였으며, 기능 면에서 전용 모델에 맞먹는 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.