Skip to main content
QUICK REVIEW

[논문 리뷰] Meet in the Middle: A New Pre-training Paradigm

Anh‐Tu Nguyen, Nikos Karampatziakis|arXiv (Cornell University)|2023. 03. 13.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 동일한 데이터에서 왼쪽에서 오른쪽으로, 오른쪽에서 왼쪽으로 언어 모델을 동시에 학습시키며 예측 결과 간 일치를 강제하여 데이터 효율성과 인페닝 성능을 향상시키는 새로운 사전 훈련 프레임워크인 '미트 인 더 미들(Meet in the Middle, MIM)'을 제안한다. 이 방법은 양방향 추론 절차를 통해 양쪽에서 온 컨텍스트를 활용함으로써 지연 시간을 줄이고 정확도를 높이며, 퍼플렉서티와 코드 완성에서 최신 기준 성능을 달성한다.

ABSTRACT

Most language models (LMs) are trained and applied in an autoregressive left-to-right fashion, assuming that the next token only depends on the preceding ones. However, this assumption ignores the potential benefits of using the full sequence information during training, and the possibility of having context from both sides during inference. In this paper, we propose a new pre-training paradigm with techniques that jointly improve the training data efficiency and the capabilities of the LMs in the infilling task. The first is a training objective that aligns the predictions of a left-to-right LM with those of a right-to-left LM, trained on the same data but in reverse order. The second is a bidirectional inference procedure that enables both LMs to meet in the middle. We show the effectiveness of our pre-training paradigm with extensive experiments on both programming and natural language models, outperforming strong baselines.

연구 동기 및 목표

  • 기존 언어 모델의 자동회귀적 성질에도 불구하고, 사전 훈련 과정에서 접두사 및 접미사 컨텍스트를 모두 활용하여 사전 훈련 데이터 효율성을 향상시키기 위해.
  • 사용자가 기존 시퀀스에 내용을 삽입하는 인페닝 작업에서, 양방향 컨텍스트를 활용할 수 있도록 모델 성능을 향상시키기 위해.
  • 기존 자동회귀 모델과의 호환성을 유지하면서 품질과 효율성을 향상시키는 통합된 훈련 및 추론 프레임워크를 개발하기 위해.
  • 앞서와 뒤에서 예측한 결과가 만나고 일치할 때를 기준으로 추론를 중단함으로써 인페닝 작업의 추론 지연 시간을 줄이기 위해.

제안 방법

  • 동일한 단조로운 순서의 훈련 데이터에서 공유 파rameter를 가진 두 개의 언어 모델—왼쪽에서 오른쪽으로(앞서가는) 모델과 오른쪽에서 왼쪽으로(뒤로가는) 모델—을 동시에 훈련한다.
  • 각 토큰 위치에서 앞서가는 모델과 뒤로가는 모델의 예측 확률 분포를 일치시키기 위해 총 변동 거리 기반의 일치 정규화 항을 도입한다.
  • 표준 언어 모델링 손실과 일치 정규화 항을 조합한 복합 손실 함수를 사용하여 두 모델을 동시에 최적화한다.
  • 추론 과정에서 앞서가는 모델과 뒤로가는 모델을 동시에 실행하며, 예측 토큰이 중간에서 만나고 일치할 때까지 진행한다.
  • 양쪽 모델의 수렴을 정지 기준으로 활용하여 생성 단계 수를 줄이고 지연 시간을 개선한다.
  • 앞서가는 모델은 표준 자동회귀 언어 모델의 즉각적인 대체로 사용할 수 있으며, 뒤로가는 모델은 인페닝과 같은 양방향 작업을 지원한다.

실험 결과

연구 질문

  • RQ1왼쪽에서 오른쪽으로, 오른쪽에서 왼쪽으로 언어 모델을 함께 훈련시키는 것이 사전 훈련 과정에서 데이터 효율성을 향상시킬 수 있는가?
  • RQ2앞서가는 예측과 뒤로가는 예측 간 일치를 강제하면 인페닝 작업의 성능이 향상되는가?
  • RQ3중간에서 만나는 양방향 추론 절차가 자동회귀 기반 모델 대비 지연 시간을 줄이고 정확도를 높일 수 있는가?
  • RQ4퍼플렉서티와 코드 완성 성능 측면에서 기존 방법들인 FIM 및 CM3와 비교해 MIM 프레임워크는 어떻게 성능을 내는가?

주요 결과

  • MIM 사전 훈련 프레임워크는 자연어 및 코드 데이터셋 모두에서 FIM과 같은 강력한 기준 모델보다 낮은 퍼플렉서티를 달성한다.
  • HumanEval 코드 완성 벤치마크에서 MIM은 FIM 및 기타 기준 모델보다 제로샷 코드 완성 정확도에서 뛰어난 성능을 보였다.
  • 양방향 추론 절차는 특히 모델의 수렴이 빠를 경우 FIM 대비 평균 추론 지연 시간을 최대 50%까지 줄였다.
  • 제거 실험 결과, 일치 정규화 항이 특히 인페닝 작업에서 일관성과 성능 향상에 크게 기여하는 것으로 확인되었다.
  • 이 방법은 기존 자동회귀 모델과 호환성을 유지하며, 앞서가는 모델이 표준 언어 모델의 즉각적인 대체로 사용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.