[논문 리뷰] Task Contamination: Language Models May Not Be Few-Shot Anymore
이 논문은 대규모 언어 모델(Large Language Models, LLMs)에서 작업 오염(task contamination)을 조사하며, 제로샷 및 희소샷 성능 향상의 대부분이 진정한 희소샷 일반화가 아니라 사전 훈련 중 작업 예제에 노출된 탓임을 입증한다. 시간 순서로 정렬된 데이터셋을 통한 모델 평가, 훈련 데이터 점검, 예제 추출, 소유자 인식 공격을 통해 저자들은 사전 훈련 시기 이전의 데이터셋에서 모델 성능이 뚜렷이 높음을 보이며, 추출 가능한 훈련 예제와 성능 향상 간 강한 상관관계를 확인한다 — 특히 GPT-3 시리즈 모델에서 두드러진다.
Large language models (LLMs) offer impressive performance in various zero-shot and few-shot tasks. However, their success in zero-shot and few-shot settings may be affected by task contamination, a potential limitation that has not been thoroughly examined. This paper investigates how zero-shot and few-shot performance of LLMs has changed chronologically over time. Utilizing GPT-3 series models and several other recent open-sourced LLMs, and controlling for dataset difficulty, we find that on datasets released before the LLM training data creation date, LLMs perform surprisingly better than on datasets released after. This strongly indicates that, for many LLMs, there exists task contamination on zero-shot and few-shot evaluation for datasets released prior to the LLMs' training data creation date. Additionally, we utilize training data inspection, task example extraction, and a membership inference attack, which reveal further evidence of task contamination. Importantly, we find that for classification tasks with no possibility of task contamination, LLMs rarely demonstrate statistically significant improvements over simple majority baselines, in both zero and few-shot settings.
연구 동기 및 목표
- LLMs의 강력한 제로샷 및 희소샷 성능이 사전 훈련 데이터에서의 작업 오염 때문인지 조사하는 것.
- LLMs의 사전 훈련 데이터 수집 일자와 비교하여 데이터셋 출시 일자의 연대기적 영향을 체계적으로 분석하는 것.
- 다양한 방법(훈련 데이터 점검, 작업 예제 추출, 소유자 인식 공격)을 통해 작업 오염에 대한 실증적 증거를 제공하는 것.
- LLMs가 진정으로 희소샷 설정에서 일반화하는지, 아니면 사전 훈련된 예제를 떠올리는지 평가하는 것.
- 모델 훈련 데이터의 투명성 강화를 주장하며, 오염로 인한 과도한 희소샷 능력 평가를 경계하는 것.
제안 방법
- 12개의 LLMs(GPT-3 시리즈 및 오픈소스 모델 포함)을 17개의 작업에 대해 시간 순서 평가하여, 모델의 사전 훈련 데이터 수집 일자 이전과 이후에 출시된 데이터셋 간 성능을 비교하는 것.
- 사전 훈련 코퍼스에서 정확하거나 유사한 중복 예제가 존재하는지 검색하기 위해 훈련 데이터 점검을 수행하는 것.
- 지시 테이닝된 모델에서 작업 예제를 추출하여, 훈련 예제가 기억되어 있고 재구할 수 있는지 확인하는 것.
- 스피더(Spider) 의미 분석 작업에서 소유자 인식 공격을 수행하여, 모델 예측이 사전 훈련 데이터에 훈련 예제가 존재하는지 여부와 관련이 있는지 테스트하는 것.
- 다수 기반 성능 향상에 대한 통계 분석을 수행하며, 99% 신뢰 수준에서 유의성 검정을 실시하는 것.
- 추출 가능한 훈련 예제의 수와 최종 작업에서의 모델 정확도 간 상관관계 분석을 수행하는 것.

실험 결과
연구 질문
- RQ1사전 훈련 데이터의 작업 오염이 LLMs의 높은 제로샷 및 희소샷 성능를 설명하는 데 어느 정도 기여하는가?
- RQ2모델의 사전 훈련 데이터 수집 일자 이전과 이후에 출시된 데이터셋에서 LLMs의 성능는 어떻게 비교되는가?
- RQ3지시 테이닝된 LLMs에서 작업 예제를 추출할 수 있는가? 그리고 추출 가능한 예제의 수가 모델 성능과 상관관계가 있는가?
- RQ4작업 오염 가능성이 없는 분류 작업에서, LLMs는 제로샷 또는 희소샷 설정에서 다수 기반 보다 통계적으로 유의미한 향상을 보이는가?
- RQ5추출 가능한 훈련 예제의 수와 최종 작업에서의 모델 정확도 사이에 측정 가능한 연관성이 있는가?
주요 결과
- LLMs는 사전 훈련 데이터 수집 일자 이전에 출시된 데이터셋에서 사전 훈련 이후에 출시된 데이터셋보다 뚜렷이 높은 성능를 보이며, 이는 작업 오염을 시사한다.
- 작업 오염 가능성이 없는 분류 작업에서, LLMs는 제로샷 또는 희소샷 설정에서 단순 다수 기반 보다 통계적으로 유의미한 향상을 거의 보이지 않는다.
- 스피더 의미 분석 작업에서 추출 가능한 훈련 예제의 수와 모델 정확도 간 강한 상관관계(R = .88)가 존재한다.
- GPT-3 시리즈 모델에서 추출 가능한 훈련 예제의 수는 davinci에서 GPT-3.5-turbo로 갈수록 증가하였으며, 동일 작업에서의 제로샷 성능 향상과 밀접하게 일치한다.
- 훈련 데이터 점검 및 예제 추출을 통해, 폐쇄형 GPT-3와 LLaMA, Vicuna와 같은 오픈소스 모델을 포함한 다수의 모델에서 작업 오염에 대한 일관된 증거를 확보하였다.
- 소유자 인식 공격를 통해, 일부 작업에서 모델 성능이 일반화 능력이 아니라 사전 훈련 중의 예제 노출 여부에 의해 강하게 영향을 받는다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.