[논문 리뷰] Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
이 논문은 데이터 오염을 탐지하고 추정하기 위해 블랙박스 방법으로 데이터 오염 탐지 문제를 다중 선택 독해 과제로 재정의한 새로운 방법인 Data Contamination Quiz (DCQ)를 제안한다. DCQ는 데이터셋 인스턴스의 단어 수준에서 변형된 세 가지 변형본과 '없음' 옵션을 포함하여 LLM의 기억력 특성을 활용해 훈련 데이터에 노출된 상태를 식별한다. 이는 모델 가중치나 사전 훈련 데이터에 접근하지 않더라도 기존 최고 성능 기법보다 최대 80배 높은 오염 수준 추정을 가능하게 한다.
We propose the Data Contamination Quiz (DCQ), a simple and effective approach to detect data contamination in large language models (LLMs) and estimate the amount of it. Specifically, we frame data contamination detection as a series of multiple-choice questions, devising a quiz format wherein three perturbed versions of each instance, subsampled from a specific dataset partition, are created. These changes only include word-level perturbations. The generated perturbations, along with the original dataset instance, form the options in the DCQ, with an extra option accommodating the selection of none of the provided options. Given that the only distinguishing signal among the options is the exact wording with respect to the original dataset instance, an LLM, when tasked with identifying the original dataset instance, gravitates towards selecting the original one if it has been exposed to it. While accounting for positional biases in LLMs, the quiz performance reveals the contamination level for the tested model with the dataset partition to which the quiz pertains. Applied to various datasets and LLMs, under controlled and uncontrolled contamination, our findings, while fully lacking access to training data and model parameters, suggest that DCQ achieves state-of-the-art results and uncovers greater contamination levels through memorization compared to existing methods. Also, it proficiently bypasses more safety filters, especially those set to avoid generating copyrighted content.
연구 동기 및 목표
- 모델 가중치나 사전 훈련 데이터에 접근할 수 없는 블랙박스 LLM에서 효과적이고 확장 가능한 데이터 오염 탐지 방법의 부족을 해결하기 위해.
- 단순히 오염 존재 여부를 탐지하는 것뿐만 아니라 오염 수준을 정량화하는 기법을 개발하기 위해.
- 기존 기법의 한계를 극복하기 위해, 안전 필터에 취약하거나 LLM의 위치적 편향으로 인한 과대 추정 문제를 해결하기 위해.
- 실제 운영 환경에서 LLM의 견고성과 공정성을 평가하기 위한 실용적이고 자원 소모가 적은 솔루션을 마련하기 위해.
제안 방법
- 각 데이터셋 인스턴스당 다섯 개의 선택지를 가진 다중 선택 퀴즈를 구성: 원본 하나, 문맥적으로 관련된 동의어로 변형된 세 가지 단어 수준의 변형본, 그리고 '없음' 옵션.
- GPT-4를 사용한 zero-shot 프롬프팅을 통해 변형된 변형본을 생성하여 의미적 유사성은 유지하면서 어휘적 형태만 변경한다.
- 원본 인스턴스를 식별하는 데 성능을 측정하여 기억력과 데이터 오염의 지표로 활용한다.
- 원본 인스턴스의 위치를 퀴즈 선택지에서 체계적으로 순열하여 위치 편향을 완화하고, 최고 성능을 오염 수준 추정치로 보고한다.
- 다양한 순열에서의 최고 정확도를 활용해 LLM의 위치 선호도를 고려한 견고한 오염 수준 추정치를 도출한다.
- 이전의 복제 기반 방법과 상호 평가를 통해 결과를 검증하여 일관성과 더 높은 감지 민감도를 확인한다.
실험 결과
연구 질문
- RQ1모델 가중치나 사전 훈련 데이터에 접근하지 않더라도 다중 선택 독해 과제가 블랙박스 LLM의 데이터 오염을 효과적으로 탐지할 수 있는가?
- RQ2DCQ 방법은 기존 최고 수준의 오염 탐지 기법과 비교해 감지 민감도와 추정 정확도 측면에서 어떻게 성능을 냈는가?
- RQ3DCQ는 저작권 침해나 기억된 콘텐츠 생성을 방지하기 위해 설계된 안전 필터를 얼마나 효과적으로 우회할 수 있는가?
- RQ4LLM 내재된 위치 편향에 대해 이 방법은 얼마나 견고한가? 실질적으로는 어떻게 완화되는가?
- RQ5정확한 오염 수준이 알려지지 않은 실제 세계의 통제되지 않은 데이터셋에서도 DCQ는 오염을 탐지할 수 있는가?
주요 결과
- DCQ는 사전 훈련 데이터에 접근하지 않더라도 Golchin & Surdeanu (2023)가 제안한 최고 수준 기법보다 오염 수준을 최대 80배 높게 탐지했다.
- 통제된 환경에서 DCQ의 오염 수준 추정치는 OpenAI에서 보고한 수치와 밀도적으로 일치했지만, 특히 GSM8k와 같은 고영향력 벤치마크에서 상당히 높은 오염 수준을 드러냈다.
- WNLI와 XSum과 같은 실제 세계 데이터셋에서는 각각 최대 50.70%와 95.00%의 오염 비율을 탐지하여 다양한 도메인에서의 탐지 능력을 입증했다.
- 저작권 침해 콘텐츠 생성을 방지하기 위한 안전 필터를 성공적으로 우회하여 일반적인 완화 전략에 저항력이 있음을 시사했다.
- 복제 기반 방법과의 상호 평가에서 완벽한 일치를 보였으며, DCQ의 신뢰성과 더 높은 민감도를 확인했다.
- 특히 오염 수준이 낮거나 중간인 상황에서 다른 방법들이 오염을 탐지하지 못하는 상황에서도 DCQ는 추정 성능에서 추출 기반 및 복제 기반 접근법을 모두 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.