Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Lingual Supervision improves Large Language Models Pre-training

Andrea Schioppa, Xavier García|arXiv (Cornell University)|2023. 05. 19.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 인코더-디코더 대규모 언어 모델(LLM)의 사전 훈련 중에 다국어 지도 기계 번역(MT) 목표를 통합함으로써, 다양한 언어에서 개방형 및 폐쇄형 생성 작업 모두에서 문맥 내 학습 성능이 크게 향상됨을 보여준다. 훈련 중에 MT와 자기지도 학습 언어 모델링 데이터의 혼합 비율을 다이나믹하게 최적화하기 위해 자동 커리큘럼 학습과 다중 팔 랜덤 밴딧을 사용함으로써, 비용이 많이 드는 격자 탐색 없이도 뛰어난 성능을 달성하였으며, 정적 데이터 샘플링 전략과 최신 기준(SOTA) 기준선보다 번역 및 질문-응답 벤치마크에서 뛰어난 성능을 보였다.

ABSTRACT

The recent rapid progress in pre-training Large Language Models has relied on using self-supervised language modeling objectives like next token prediction or span corruption. On the other hand, Machine Translation Systems are mostly trained using cross-lingual supervision that requires aligned data between source and target languages. We demonstrate that pre-training Large Language Models on a mixture of a self-supervised Language Modeling objective and the supervised Machine Translation objective, therefore including cross-lingual parallel data during pre-training, yields models with better in-context learning abilities. As pre-training is a very resource-intensive process and a grid search on the best mixing ratio between the two objectives is prohibitively expensive, we propose a simple yet effective strategy to learn it during pre-training.

연구 동기 및 목표

  • LLM 사전 훈련 중에 병렬 다국어 데이터를 포함시킬 경우, 개방형 및 폐쇄형 생성 설정 모두에서 문맥 내 학습 능력이 향상되는지 조사하는 것.
  • 자기지도 학습 언어 모델링과 지도 기계 번역(MT) 목표 간 최적의 혼합 비율을 결정하는 문제를 해결하는 것. 이는 격자 탐색을 통한 튜닝이 계산적으로 비용이 많이 들기 때문에 어렵다.
  • 초기 설정이 필요 없고 하이퍼파rameter 탐색을 피하는 동적이고 자동화된 전략을 개발하고 평가하여 사전 훈련 중 병렬 데이터 사용을 스케줄링하는 것.
  • 다국어 지도 학습의 성과가 다국어 데이터 노출 증가 때문인지, 정렬된 병렬 문장의 구조적 특성 때문인지 평가하는 것.
  • 저자원 언어에 대한 다국어 지도 학습의 영향을 평가하고 강력한 MT 및 LLM 기준선과 성능을 비교하는 것.

제안 방법

  • 병렬 단일 언어 문장 쌍을 사용하여 자기지도 학습 언어 모델링(예: 다음 토큰 예측)과 지도 기계 번역(MT) 목표의 조합으로 인코더-디코더 LLM을 사전 훈련한다.
  • 각 훈련 단계에서 병렬 MT 데이터의 비율을 최적화하기 위해 다중 팔 랜덤 밴딧을 활용한 자동 커리큘럼 학습 기반의 동적 데이터 샘플링 전략을 도입한다.
  • 1.2B 및 3.8B 파라미터 모델을 대상으로 적용하여, 각 실험에서 256개의 TPUv4 코어를 5일간 사용해 충분한 규모를 확보한다.
  • 평가에 문맥 내 학습을 적용하며, 동일 언어 입력/출력인 폐쇄형 생성과 다국어 입력/출력인 개방형 생성을 구분한다.
  • 표준 평가 지표인 BLEU 및 TyDi QA, XTyDi QA에서의 F1 점수를 사용하여 M2M-124, GPT-3, XGLM, 미세조정된 mT5 모델 등 강력한 기준선과 비교한다.
  • 병렬 데이터를 사용하는 것과 단순히 비영어 데이터량을 늘리는 것의 영향을 분리하기 위해 추론 분석(ablation study)를 수행한다.
Figure 1: Measuring transfer as the reward on task Y resulting from a gradient step on task X (X to Y in the legend). At the beginning of training the rewards of MT to itself is lower and increases over time. There is always a substantial transfer from MT to LM. We use a running average with window
Figure 1: Measuring transfer as the reward on task Y resulting from a gradient step on task X (X to Y in the legend). At the beginning of training the rewards of MT to itself is lower and increases over time. There is always a substantial transfer from MT to LM. We use a running average with window

실험 결과

연구 질문

  • RQ1LLM 사전 훈련 중에 다국어 지도 기계 번역 데이터를 통합하면, 다국어 기계 번역 및 질문-응답 작업에서 문맥 내 학습 성능이 향상되는가?
  • RQ2자기지도 학습 언어 모델링과 지도 기계 번역 목표를 균형 잡는 데 있어, 정적 데이터 샘플링 정책보다 동적이고 자동화된 커리큘럼 학습 전략이 우월한가?
  • RQ3관찰된 성능 향상은 다국어 데이터 노출 증가 때문인지, 정렬된 병렬 문장의 구조적 특성 때문인가?
  • RQ4고자원 언어 쌍과 저자원 언어 쌍 모두에서 성능 향상은 개방형 및 폐쇄형 생성 설정에서 어떻게 다르게 나타나는가?
  • RQ5모델 크기가 커질수록 다국어 지도 학습의 성능 향상은 비례하는가? 그리고 최신 기준 MT 및 LLM 모델과 비교해 볼 때 어떻게 되는가?

주요 결과

  • 자동 커리큘럼 학습을 적용한 본 방법은 다국어 기계 번역에서 최신 기준(SOTA) 성능을 달성하였으며, M2M-124 및 기타 기준선을 초월하여 3.8B 모델이 개방형 생성 모드에서 Fr→En에서 47.6 BLEU, Sw→En에서 40.3 BLEU를 기록하였다.
  • 폐쇄형 생성 설정에서는 3.8B 모델이 En→Ru에서 41.2 BLEU, En→Sw에서 35.0 BLEU를 기록하였으며, 동일 작업에서 6.7B GPT-3 및 7.5B XGLM 모델보다 뚜렷하게 뛰어난 성능을 보였다.
  • 자동 커리큘럼 학습을 적용한 모델은 Kale 등(2021)의 정적 데이터 샘플링 기반 기준선을 초월하였으며, 하이퍼파rameter 튜닝 없이도 병렬 데이터의 동적 스케줄링 전략이 성능 향상에 기여함을 입증하였다.
  • 추론 분석 결과, 언어 모델 목표와 함께 MT 데이터를 사용할 경우 단순히 비영어 데이터량을 늘리는 것과 비교해 TyDi QA 및 번역 작업에서 성능 저하가 발생함을 확인하였으며, 이는 병렬 문장의 구조적 특성이 중요하다는 것을 시사한다.
  • 저자원 언어인 My 및 Ta에서는 훈련 데이터 부족으로 어려움을 겪었지만, Bg→En, Hi→En, Zh→En 쌍에서는 다른 시스템을 뛰어넘는 강력한 제로샷 일반화 성능을 보였다.
  • 결과는 다국어 지도 학습이 단순한 데이터 증강을 넘어서 다국어 능력을 향상시키며, 특히 다국어 일반화가 요구되는 개방형 생성 설정에서 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.