Skip to main content
QUICK REVIEW

[논문 리뷰] Data Contamination Through the Lens of Time

Manley Roberts, Himanshu Thakur|arXiv (Cornell University)|2023. 10. 16.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 GPT-4와 GPT-3.5-Turbo의 알려진 훈련 종료 일자를 활용하여 대규모 장기적 분석을 통해 대규모 언어 모델(LM)에서의 데이터 오염을 처음으로 다룹니다. Codeforces와 Project Euler—장기적 코딩 벤치마크—를 사용하여, GitHub 인기도와 모델의 통과율 사이에 통계적으로 유의미한 상관관계가 전부 훈련 종료 이전 문제들에서만 관찰됨을 입증함으로써, 데이터 오염에 대한 강력한 실증적 증거를 제시합니다. 저자들은 향후 벤치마크 검증을 위한 엄밀하고 재현 가능한 오염 분석을 가능하게 하기 위해 데이터셋과 평가 프레임워크를 오픈소스화합니다.

ABSTRACT

Recent claims about the impressive abilities of large language models (LLMs) are often supported by evaluating publicly available benchmarks. Since LLMs train on wide swaths of the internet, this practice raises concerns of data contamination, i.e., evaluating on examples that are explicitly or implicitly included in the training data. Data contamination remains notoriously challenging to measure and mitigate, even with partial attempts like controlled experimentation of training data, canary strings, or embedding similarities. In this work, we conduct the first thorough longitudinal analysis of data contamination in LLMs by using the natural experiment of training cutoffs in GPT models to look at benchmarks released over time. Specifically, we consider two code/mathematical problem-solving datasets, Codeforces and Project Euler, and find statistically significant trends among LLM pass rate vs. GitHub popularity and release date that provide strong evidence of contamination. By open-sourcing our dataset, raw results, and evaluation framework, our work paves the way for rigorous analyses of data contamination in modern models. We conclude with a discussion of best practices and future steps for publicly releasing benchmarks in the age of LLMs that train on webscale data.

연구 동기 및 목표

  • 장기적 코딩 벤치마크인 Codeforces와 Project Euler에서 데이터 오염이 LLM 성능에 영향을 미치는지 조사하기 위해.
  • GPT-4와 GPT-3.5-Turbo의 알려진 훈련 종료 일자를 자연스러운 실험 분할로 활용하여 오염 정도를 측정하기 위해.
  • 시간순 문제 출시 순서에 따른 모델 성능 추세의 통계적 분석을 통해 오염에 대한 실증적 증거를 제공하기 위해.
  • 웹스케일 LLM 훈련 데이터가 공개 벤치마크에 미치는 위험을 규명하여 공개 벤치마크 배포의 최선의 실천 방식을 촉진하기 위해.
  • 데이터셋, 평가 코드, 결과를 오픈소스화하여 재현 가능한 오염 분석을 가능하게 하기 위해.

제안 방법

  • GPT-4와 GPT-3.5-Turbo의 알려진 훈련 종료 일자를 활용하여 벤치마크 문제를 훈련 종료 이전(일반적으로 접촉한 것으로 간주됨)과 이후(일반적으로 접촉하지 않은 것으로 간주됨) 그룹으로 분할합니다.
  • Codeforces(2010–2023)와 Project Euler(2001–2023)에서 장기적 데이터셋을 구축하여 문제 출시 일자와 GitHub 존재 여부를 추적합니다.
  • 문제 특성(예: GitHub 인기도, 난이도)과 LLM 성능 지표(통과율, 제목/태그 재생산) 사이의 관계를 분석하기 위해 회귀 모델을 활용합니다.
  • 테스트 케이스 통과율과 제목 및 태그의 의미적 재생산을 측정하여 기억 또는 오염 효과를 탐지합니다.
  • 훈련 종료 이전 및 이후 기간의 성능 추세에 유의미한 차이가 있는지 통계적 추론을 적용합니다.
  • 데이터셋 라이선싱 제약 조건을 고려하여 평가 프레임워크 전체, 원본 결과, 데이터셋 구축 파이프라인을 오픈소스화합니다.

실험 결과

연구 질문

  • RQ1모델의 훈련 종료 일자 이전과 이후에 출시된 문제를 평가할 때 LLM 성능에 통계적으로 유의미한 차이가 존재하는가?
  • RQ2문제가 GitHub에 존재할 경우, 오직 훈련 종료 이전 문제들에서만 LLM의 통과율이 높아지며, 이는 오염을 시사하는가?
  • RQ3LLM이 훈련 종료 이전에 출시된 문제의 제목과 태그를 얼마나 정확하게 재생산하는가?
  • RQ4문제 난이도와 출시 일자에 따라 모델 성능이 어떻게 변하는가? 이는 모델(GPT-4 대비 GPT-3.5-Turbo)에 따라 달라지는가?
  • RQ5웹스케일 LLM 훈련의 시대에 오염이 공개 벤치마크의 타당성에 어떤 영향을 미치는가?

주요 결과

  • GPT-4는 훈련 종료 이전의 Codeforces 문제에서만 GitHub 존재 여부와 통과율 사이에 통계적으로 유의미한 양의 상관관계(p = 0.010)를 보이며, 오염을 시사합니다.
  • GPT-4의 경우 훈련 종료 이전 기간 동안 GitHub 존재 여부의 계수는 1.010(95% 신뢰구간: [0.994, 1.026])이며, 약간이지만 유의미한 오염 효과를 시사합니다.
  • GPT-3.5-Turbo는 훈련 종료 이전 또는 이후 기간 모두에서 GitHub 존재 여부와 통과율 사이에 유의미한 상관관계가 없으며(p = 0.506 및 p = 0.216), 이는 오염이 없음을 시사합니다.
  • Project Euler 데이터셋에서 GPT-4는 훈련 종료 이전 기간 동안 난이도와 제목 재생산 사이에 유의미한 음의 상관관계(p = 0.00001)를 보이며, 기억 또는 오염 효과가 있을 가능성을 시사합니다.
  • 모든 모델에서 훈련 종료 이후 기간 동안 GitHub 존재 여부가 제목 재생산에 미치는 영향은 유의미하지 않으며, 이는 오염이 존재하지 않거나 오염이 탐지되지 않는다는 것을 시사합니다.
  • GPT-3.5-Turbo의 Project Euler에서 오염에 대한 증거는 발견되지 않았으며, 훈련 종료 이전 기간 동안 GitHub 존재 여부 계수는 0.981(p = 0.696)이었습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.