[논문 리뷰] TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs
이 논문은 암호화 및 기밀 컴퓨팅 기법을 사용하여 모델이 테스트 데이터셋에 접근하지 못하도록 함으로써 LLM 벤치마크 오염을 방지하는 새로운 프레임워크인 Private Benchmarking을 소개한다. 이는 데이터 泄露 위험을 완화하고 신뢰할 수 있는 비교 평가를 보장하기 위해 평가 중 데이터를 폭 드러내지 않으면서도 안전하고 감사 가능한 LLM 평가를 가능하게 한다.
Benchmarking is the de-facto standard for evaluating LLMs, due to its speed, replicability and low cost. However, recent work has pointed out that the majority of the open source benchmarks available today have been contaminated or leaked into LLMs, meaning that LLMs have access to test data during pretraining and/or fine-tuning. This raises serious concerns about the validity of benchmarking studies conducted so far and the future of evaluation using benchmarks. To solve this problem, we propose Private Benchmarking, a solution where test datasets are kept private and models are evaluated without revealing the test data to the model. We describe various scenarios (depending on the trust placed on model owners or dataset owners), and present solutions to avoid data contamination using private benchmarking. For scenarios where the model weights need to be kept private, we describe solutions from confidential computing and cryptography that can aid in private benchmarking. We build an end-to-end system, TRUCE, that enables such private benchmarking showing that the overheads introduced to protect models and benchmark are negligible (in the case of confidential computing) and tractable (when cryptographic security is required). Finally, we also discuss solutions to the problem of benchmark dataset auditing, to ensure that private benchmarks are of sufficiently high quality.
연구 동기 및 목표
- LLM 사전학습 또는 미세조정 과정에서 발생하는 벤치마크 데이터셋 오염 문제의 증가를 해결하기 위해.
- 평가 중 모델이 테스트 데이터에 노출되지 않도록 보장하는 안전한 평가 프레임워크를 개발하기 위해.
- 암호학적 감사 메커니즘을 통해 데이터 품질을 검증할 수 있도록 하되, 데이터셋을 드러내지 않도록 하여 민감한 프라이버시를 보장하기 위해.
- TEE와 영지식 증명을 활용해 오픈소스, 클로즈드소스, 프라이버시 보장형 등 다양한 신뢰 모델을 지원하기 위해.
- SPEC이나 사이버보안 분야의 Truste 인증서와 유사한 산업 간 통합형 안전 벤치마크 플랫폼의 기반을 마련하기 위해.
제안 방법
- Private Benchmarking은 테스트 데이터셋을 암호화하거나 암호학적 커밋먼트로 처리하여 평가 중 모델이 원본 데이터에 접근하지 못하도록 한다.
- 해시 기반 등의 암호학적 커밋먼트를 사용해 벤치마크 데이터 포인트를 묶어, 감사자가 전체 데이터셋을 노출하지 않고도 품질을 검증할 수 있도록 한다.
- 동일한 벤치마크가 감사와 평가 모두에 사용됨을 보장하기 위해 영지식 증명을 활용한다. 이는 악성 소유자가 데이터를 교체하는 공격을 방지한다.
- 신뢰성 있는 실행 환경(TEE)을 활용해 모델을 안전하게 호스팅하고, 가중치나 데이터를 드러내지 않은 채로 비공개 벤치마크에서 평가를 수행한다.
- 감사자가 암호학적 커밋먼트된 데이터 포인트를 무작위로 샘플링하여 대표성 있는 부분집합을 테스트하고, 데이터 품질에 대한 통계적 보장을 제공한다.
- 보안 다자간 계산과 기밀 컴퓨팅을 적용해, 가중치가 비공개 상태로 유지되어야 하는 시나리오를 지원한다.
실험 결과
연구 질문
- RQ1LLM 평가 중 사전학습 또는 미세조정 과정에서 발생하는 오염을 방지하기 위해 벤치마크 데이터셋을 어떻게 모델에서 비공개로 유지할 수 있는가?
- RQ2어떤 암호학적 기법과 신뢰성 있는 실행 환경 기술이 감사 및 평가 단계에서 비공개 벤치마크의 무결성과 일관성을 보장하는가?
- RQ3감사자가 전체 데이터셋에 접근하지 않고도 비공개 벤치마크의 품질을 어떻게 검증할 수 있는가?
- RQ4비공개 벤치마크에서 실현 가능한 신뢰 모델은 무엇이며, 이는 프라이버시, 보안, 실용성 간의 균형을 어떻게 유지하는가?
- RQ5비공개 벤치마크는 경쟁 우위를 해치지 않으면서도 산업 간 안전한 평가 플랫폼을 구축하는 데 기여할 수 있는가?
주요 결과
- Private Benchmarking은 모델이 테스트 데이터에 접근하는 것을 효과적으로 방지하여, 사전학습 또는 미세조정 과정에서 발생하는 오염 위험을 제거한다.
- 암호학적 커밋먼트를 통해 감사자가 최소 α%의 데이터가 양호한 품질을 가짐을 고도로 신뢰할 수 있으며, 오류 확률은 약 (α/100)^κ (κ개의 샘플링 포인트 기준)이다.
- 영지식 증명을 통해 감사에서 사용된 동일한 벤치마크가 평가에도 사용됨을 보장하여, 악성 소유자가 데이터를 교체하는 공격을 방지한다.
- TEE 기반 솔루션은 영지식 증명이 필요 없이도 안전한 평가를 가능하게 하여 검증 과정을 단순화한다.
- 이 프레임워크는 오픈소스 모델, 신뢰할 수 있는 소유자가 있는 클로즈드 모델, 기밀 컴퓨팅을 활용한 프라이버시 보장 평가 등 다양한 배포 모델을 지원한다.
- 이 접근법은 SPEC이나 Truste 인증서와 유사한 산업 표준이 될 수 있는 안전하고 감사 가능한 벤치마크 플랫폼을 구축할 수 있도록 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.