[논문 리뷰] Decoding Secret Memorization in Code LLMs Through Token-Level Characterization
이 논문은 코드 LLM에서 진짜 비밀과 환각된 비밀을 식별하기 위해 토큰 수준의 확률 분석을 사용하는 이단계 방법 DeSec을 제안한다. 진짜 비밀 토큰의 네 가지 핵심 특성—높고 안정된 확률, 더 높은 확률, 더 강한 확률 우위, 그리고 엔트로피를 통한 조기 식별 가능성을 통해, 프롬프트 기반 기준보다 더 높은 신뢰성과 더 많은 진짜 비밀을 추출하도록 디코딩을 이끌어낸다.
Code Large Language Models (LLMs) have demonstrated remarkable capabilities in generating, understanding, and manipulating programming code. However, their training process inadvertently leads to the memorization of sensitive information, posing severe privacy risks. Existing studies on memorization in LLMs primarily rely on prompt engineering techniques, which suffer from limitations such as widespread hallucination and inefficient extraction of the target sensitive information. In this paper, we present a novel approach to characterize real and fake secrets generated by Code LLMs based on token probabilities. We identify four key characteristics that differentiate genuine secrets from hallucinated ones, providing insights into distinguishing real and fake secrets. To overcome the limitations of existing works, we propose DESEC, a two-stage method that leverages token-level features derived from the identified characteristics to guide the token decoding process. DESEC consists of constructing an offline token scoring model using a proxy Code LLM and employing the scoring model to guide the decoding process by reassigning token likelihoods. Through extensive experiments on four state-of-the-art Code LLMs using a diverse dataset, we demonstrate the superior performance of DESEC in achieving a higher plausible rate and extracting more real secrets compared to existing baselines. Our findings highlight the effectiveness of our token-level approach in enabling an extensive assessment of the privacy leakage risks associated with Code LLMs.
연구 동기 및 목표
- 프롬프트 엔지니어링의 한계를 해결하기 위해, 코드 LLM 내에 암기된 비밀을 탐지하는 데 있어 과도한 환각과 비효율적 추출 문제를 해결한다.
- 코드 생성에서 진짜 비밀과 환각된 비밀을 구분하는 데 내재된 토큰 수준의 특성들을 규명한다.
- 이러한 특성들을 활용하여 디코딩을 이끌어내고 비밀 추출의 정확도와 다양성을 향상시키는 방법을 개발한다.
- 코드 LLM 내의 개인정보 泄露 위험에 대해 더 포괄적이고 신뢰할 수 있는 평가를 가능하게 한다.
제안 방법
- 진짜 비밀 토큰의 네 가지 특징을 식별한다: (C1) 높은 확률에서의 안정화, (C2) 전체적으로 높은 확률, (C3) 더 강한 확률 우위, (C4) 샤논 엔트로피를 통한 조기 식별 가능성.
- 프록시 코드 LLM을 사용해 훈련 데이터를 생성하고, 토큰이 진짜 비밀에 속할 가능성을 예측하는 모델을 훈련시켜 오프라인 토큰 스코어링 모델을 구축한다.
- 온라인 디코딩 중에 스코어링 모델을 적용하여 원래 LLM의 확률과 결합해 토큰의 가능성 확률을 재할당함으로써, 진짜 비밀 토큰 쪽으로 모델을 이끌어낸다.
- 기존 방법에서 조기 생성 종료를 유도하는 잘못된 토큰(예: '&')를 억제하기 위해 마스킹 개선 기법을 도입한다.
- 스코어링 모델을 통한 확률 재가중을 통해 디코딩 중에 진짜 비밀 토큰의 선택 확률을 높인다.
- 1200개의 다양한 비밀 유형을 포함한 다양성 있는 5개의 최신 코드 LLM에서 검증을 수행한다.
실험 결과
연구 질문
- RQ1코드 LLM에서 진짜 비밀과 환각된 비밀을 식별하는 데 있어 토큰 수준의 특성은 무엇인가?
- RQ2프록시 LLM에서 훈련된 토큰 수준의 스코어링 모델이 디코딩을 이끌어내어 진짜 비밀을 효과적으로 추출할 수 있는가?
- RQ3가능성 비율과 진짜 비밀 추출 측면에서 DeSec는 기존 프롬프트 기반 기준보다 어떻게 비교되는가?
- RQ4이러한 토큰 스코어링 모델은 다양한 코드 LLM 아키텍처 간에 얼마나 일반화 가능한가?
주요 결과
- DeSec는 5개의 코드 LLM에서 평균 가능성 비율(Plausible Rate, PR) 44.74%를 달성하여 HCR(10.98%)와 BS-5(23.60%)를 크게 앞서며 성능을 뛰어나게 한다.
- DeSec는 피해자 모델들로부터 총 1076개의 진짜 비밀을 성공적으로 추출했으며, HCR(230개의 진짜 비밀)와 BS-5(845개의 진짜 비밀)를 초월한다.
- StarCoder2-15B에 대해 토큰 스코어링 모델은 정밀도와 F1 스코어가 0.90 이상을 기록하여 프록시 모델에서 강력한 성능을 보였다.
- 마스킹 기법을 통해 조기 종료 문제를 효과적으로 완화했으며, 사례 연구에서 DeSec는 HCR 및 BS-5가 실패하거나 타당성 없는 출력을 생성한 반면 유효한 비밀을 생성함으로써 그 효과를 입증했다.
- DeepSeek-Coder-6.7B에서 스코어링 모델의 성능은 비밀이 아닌 예시들(예: 'AKIDz8krbsJ5yKBZQpn74WFkmLPx3EXAMPLE')을 암기한 데 기인해 제대로 분류되지 않은 경우가 있어 제한을 받았다.
- 사례 연구를 통해 DeSec는 HCR 및 BS-5가 실패하거나 타당성 없는 출력을 생성하는 상황에서 타당하고 진짜 비밀을 생성함으로써 확률 재가중과 스코어링 가이던스의 효과성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.