Skip to main content
QUICK REVIEW

[논문 리뷰] Deduplicating Training Data Makes Language Models Better

Katherine Lee, Daphne Ippolito|arXiv (Cornell University)|2021. 07. 14.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 정확한 부분 문자열 매칭과 n-그램 해싱을 통한 근사 문서 매칭을 사용하여 언어 모델 훈련 데이터셋에 대한 확장 가능한 중복 제거 프레임워크를 제안한다. C4와 같은 데이터셋에서 근접 중복 및 정확한 반복 텍스트를 제거함으로써, 미세조정된 모델의 기억 현상이 10배 감소하고 훈련 효율성이 향상되며, 훈련-테스트 겹침을 제거함으로써 더 정확한 모델 평가가 가능하다는 것을 입증한다.

ABSTRACT

We find that existing language modeling datasets contain many near-duplicate examples and long repetitive substrings. As a result, over 1% of the unprompted output of language models trained on these datasets is copied verbatim from the training data. We develop two tools that allow us to deduplicate training datasets -- for example removing from C4 a single 61 word English sentence that is repeated over 60,000 times. Deduplication allows us to train models that emit memorized text ten times less frequently and require fewer train steps to achieve the same or better accuracy. We can also reduce train-test overlap, which affects over 4% of the validation set of standard datasets, thus allowing for more accurate evaluation. We release code for reproducing our work and performing dataset deduplication at https://github.com/google-research/deduplicate-text-datasets.

연구 동기 및 목표

  • C4, Wiki-40B, LM1B, RealNews와 같이 널리 사용되는 언어 모델 훈련 데이터셋에 중복 및 근접 중복 콘텐츠가 얼마나 퍼져 있는지 조사하기 위해.
  • 훈련-테스트 데이터 겹침과 데이터 중복으로 인해 모델 성능 지표가 과도하게 높아지고 언어 모델의 기억 현상이 증가하는 문제를 해결하기 위해.
  • 정확한 및 근사 중복 텍스트를 대규모 데이터셋에서 제거하는 확장 가능하고 계산적으로 효율적인 중복 제거 파이프라인을 개발하고 평가하기 위해.
  • 중복 제거된 데이터셋이 기억 현상이 크게 감소하고 훈련 효율성이 향상되며 더 신뢰할 수 있는 평가가 가능한 모델을 이끌어내는지 입증하기 위해.

제안 방법

  • 다른 예제에 나타나더라도 데이터셋 전반에서 텍스트 세그먼트의 정확한 부분 문자열 매칭을 통해 정확한 반복을 탐지하고 제거하기 위해.
  • n-그램 겹침 기반의 국소성에 민감한 해싱(LSH)을 활용한 근사 문서 매칭을 적용하여 높은 유사도를 가진 근접 중복 문서를 식별하기 위해.
  • C4와 같은 테라바이트 규모의 데이터셋에서도 확장 가능한 중복 제거를 가능하게 하기 위해 CPU 전용 선형 시간 알고리즘을 사용하여 처리하기 위해.
  • 여러 모델 아키텍처와 데이터셋을 대상으로 중복 제거가 모델 기억률, 퍼플렉서티, 훈련 효율성에 미치는 영향을 측정하기 위해.
  • 모델 출력을 원본 데이터셋과 중복 제거된 데이터셋에서 비교하여 결과를 검증하고, 기억된 텍스트의 빈도와 테스트 세트 겹침에 초점을 맞추기 위해.
  • 재현 가능성과 NLP 연구 분야에서의 도입을 촉진하기 위해 중복 제거 프레임워크를 오픈소스 코드로 공개하기 위해.

실험 결과

연구 질문

  • RQ1표준 NLP 훈련 데이터셋인 C4, Wiki-40B, LM1B, RealNews에서 근접 중복 및 정확한 중복 예제는 얼마나 퍼져 있는가?
  • RQ2표준 벤치마크 데이터셋에서 훈련-테스트 데이터 겹침이 모델 평가에 어떤 영향을 미치며 과적합을 유도하는가?
  • RQ3훈련 데이터의 중복 제거가 미세조정된 언어 모델에서 기억된 텍스트 생성 비율에 어떤 영향을 미치는가?
  • RQ4중복 제거가 퍼플렉서티와 수렴 속도 측정 기준으로 모델 훈련 효율성과 성능 향상에 기여하는가?
  • RQ5중복 제거된 데이터셋이 임의의 기억 현상과 데이터 泄露를 줄임으로써 더 신뢰할 수 있고 정확한 모델 평가를 가능하게 할 수 있는가?

주요 결과

  • 표준 데이터셋인 C4에서 훈련된 모델이 생성하는 자발적 출력 중 1% 이상이 훈련 데이터에서 정확히 복제된 텍스트를 기억하고 있다.
  • 중복 제거로 인해 기억된 텍스트 생성 비율이 10배 감소하였으며, 중복 제거된 데이터셋에서 훈련된 모델은 원본 데이터셋 대비 0.14–0.19%의 빈도로 기억된 콘텐츠를 생성하는 데 그치며, 원본 데이터셋에서는 1.93–3.34%의 빈도를 보였다.
  • C4에서 61,036번 반복된 61단어 문장과 검증 세트에서 61번 반복된 문장이 발견되어 훈련-검증 겹침이 심각하게 존재함을 입증했다.
  • 중복 제거된 데이터셋은 최대 19% 작아졌으며, 이는 훈련 시간, 비용, 환경 영향을 줄이고 퍼플렉서티를 유지하거나 향상시키는 데 기여했다.
  • 중복 제거된 데이터셋에서 훈련된 모델는 더 적은 훈련 스텝 수로 동일하거나 더 높은 정확도를 달성하여 훈련 효율성이 향상됨을 보였다.
  • 중복 제거로 인해 퍼플렉서티가 떨어지지 않았고, 일부 경우에서는 최대 10% 향상되어 더 고품질의 훈련 데이터가 더 나은 일반화를 이끌어낸다는 것을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.