Skip to main content
QUICK REVIEW

[논문 리뷰] Investigating Data Contamination for Pre-training Language Models

Minhao Jiang, Ken Ziyu Liu|arXiv (Cornell University)|2024. 01. 11.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 사전 훈련된 언어 모델에서의 데이터 오염을 분석하기 위해 평가 데이터셋의 입력과 정답을 의도적으로 포함한 코퍼스로 GPT-2 모델을 처음부터 훈련시어, 입력 텍스트와 정답 오염이 모두 후행 작업 성능을 크게 향상시킨다는 것을 밝혀냈다. 이는 현재 LLM 보고서에서 사용하는 n-gram 기반의 오염 정의 방식이 부적절하며, 반복적인 오염이 성능 향상을 증폭시켜 오염에 대한 모델의 강건성에 대한 주장에 도전한다.

ABSTRACT

Language models pre-trained on web-scale corpora demonstrate impressive capabilities on diverse downstream tasks. However, there is increasing concern whether such capabilities might arise from evaluation datasets being included in the pre-training corpus -- a phenomenon known as extit{data contamination} -- in a manner that artificially increases performance. There has been little understanding of how this potential contamination might influence LMs' performance on downstream tasks. In this paper, we explore the impact of data contamination at the pre-training stage by pre-training a series of GPT-2 models extit{from scratch}. We highlight the effect of both text contamination ( extit{i.e.}\ input text of the evaluation samples) and ground-truth contamination ( extit{i.e.}\ the prompts asked on the input and the desired outputs) from evaluation data. We also investigate the effects of repeating contamination for various downstream tasks. Additionally, we examine the prevailing n-gram-based definitions of contamination within current LLM reports, pinpointing their limitations and inadequacy. Our findings offer new insights into data contamination's effects on language model capabilities and underscore the need for independent, comprehensive contamination assessments in LLM studies.

연구 동기 및 목표

  • 사용자 평가 시점이 아닌 사전 훈련 단계에서 데이터 오염의 영향을 사전 훈련 수준에서 조사하기.
  • 입력 텍스트와 정답 오염(프롬프트 및 답변 포함)이 후행 작업 성능에 미치는 영향을 분석하기.
  • 다양한 모델 크기에서 반복적인 오염의 영향을 모델 성능에 미치는 영향 평가하기.
  • 최근 LLM 보고서에서 사용하는 n-gram 기반 오염 정의의 타당성에 대한 비판적 평가하기.
  • 평가 수준에서의 오염 분석에 기반한 LLM의 강건성 주장에 도전하기. 이는 실제 사전 훈련 수준의 오염 영향을 가리킬 수 있다.

제안 방법

  • 평가 데이터셋의 입력과 정답 쌍을 의도적으로 포함한 코퍼스를 사용해 GPT-2-small 및 GPT-2-large 모델을 처음부터 훈련하기.
  • 사전 훈련 코퍼스에 평가 데이터를 다양한 형태로 체계적으로 삽입하기: 입력 전용, 입력+프롬프트, 입력+정답, 전체 입력+프롬프트+정답 오염.
  • 동일한 평가 샘플을 여러 번 반복하여 사전 훈련 코퍼스에 삽입함으로써 반복 오염이 후행 작업 성능에 미치는 영향을 연구하기.
  • 최근 LLM 보고서에서 사용하는 n-gram 기반 오염 정의를 적용해 훈련 데이터를 필터링하고, 그 효과를 평가하기 위해 모델을 재훈련하기.
  • 표준 NLP 벤치마크에서 모델을 평가하여 오염 조건과 필터링된 코퍼스 간의 성능 비교하기.
  • 다양한 후행 작업에서 모델 행동을 평가하기 위해 제로샷 및 피셔샷 평가 프로토콜을 조합하여 사용하기.

실험 결과

연구 질문

  • RQ1RQ1: 입력 텍스트와 정답 오염의 다양한 형태가 사전 훈련 중 언어 모델의 성능에 어떤 영향을 미치는가?
  • RQ2RQ2: 사전 훈련 코퍼스에 동일한 오염 데이터를 반복적으로 삽입할 경우 후행 작업 성능에 어떤 영향을 미치는가?
  • RQ3RQ3: 최근 LLM 보고서에서 사용하는 n-gram 기반 오염 정의는 사전 훈련 코퍼스의 진짜 오염을 탐지하는 데 얼마나 효과적인가?
  • RQ4RQ4: 기존 평가 수준의 오염 분석은 모델의 오염에 대한 강건성에 대해 얼마나 정확하게 반영하는가?

주요 결과

  • 정답 오염(프롬프트 및 답변 포함)은 입력 텍스트 오염만으로 하는 것보다 훨씬 높은 후행 작업 성능을 보이며, 이는 모델 행동이 기억된 지도 신호에 더 강하게 영향을 받음을 시사한다.
  • 동일한 평가 샘플이 사전 훈련 코퍼스에 반복적으로 삽입될 경우 후행 작업 성능이 단조롭게 증가하며, 다수의 삽입 이후에도 성능 향상이 지속됨을 확인했다.
  • 최근 LLM 보고서에서 사용하는 n-gram 기반 오염 정의는 평가 데이터가 약간 다르게 표현되거나 구조적으로 수정된 경우에도 많은 실제 오염 사례를 탐지하지 못하며, 이는 강건성 주장의 타당성을 약화시킨다.
  • n-gram 기반 정의로 필터링된 코퍼스를 사용해 훈련한 모델조차도 오염된 벤치마크에서 높은 성능를 보이며, 이는 이러한 필터가 오염을 신뢰성 있게 제거하지 못함을 의미한다. 결과적으로 모델의 강건성은 과대평가된다.
  • 평가 수준에서의 오염 분석(모델을 오염된 청크와 비오염된 청크로 별도로 테스트하는 방식)은 사전 훈련 수준의 오염 영향을 정확히 반영하지 못한다. 성능 차이가 모델의 인덕티브 바이어스에 의해 가려지기 때문이다.
  • 본 연구는 현재의 오염 탐지 및 강건성 평가 방법이 부족함을 드러내며, 의미 기반의 정밀한 정의와 탐지 기반 시스템의 긴급한 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.