Skip to main content
QUICK REVIEW

[논문 리뷰] The Janus Interface: How Fine-Tuning in Large Language Models Amplifies the Privacy Risks

Xiaoyi Chen, Siyuan Tang|arXiv (Cornell University)|2023. 10. 24.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 파인튜닝을 악용하여 이전에 숨겨진 개인식별정보(PII)를 복구하고 노출하는 새로운 방법인 Janus 공격을 소개한다. 예를 들어, GPT-3.5를 단지 10개의 PII 예시로 파인튜닝함으로써, 숨겨진 이메일 주소를 복구하는 데 정밀도 69.9%를 달성한다. 이는 파인튜닝이 치명적인 잊음(catastrophic forgetting)을 역전시켜, 정합성 보호 조치에도 불구하고 비밀 정보를 드러낼 수 있음을 보여준다.

ABSTRACT

The rapid advancements of large language models (LLMs) have raised public concerns about the privacy leakage of personally identifiable information (PII) within their extensive training datasets. Recent studies have demonstrated that an adversary could extract highly sensitive privacy data from the training data of LLMs with carefully designed prompts. However, these attacks suffer from the model's tendency to hallucinate and catastrophic forgetting (CF) in the pre-training stage, rendering the veracity of divulged PIIs negligible. In our research, we propose a novel attack, Janus, which exploits the fine-tuning interface to recover forgotten PIIs from the pre-training data in LLMs. We formalize the privacy leakage problem in LLMs and explain why forgotten PIIs can be recovered through empirical analysis on open-source language models. Based upon these insights, we evaluate the performance of Janus on both open-source language models and two latest LLMs, i.e., GPT-3.5-Turbo and LLaMA-2-7b. Our experiment results show that Janus amplifies the privacy risks by over 10 times in comparison with the baseline and significantly outperforms the state-of-the-art privacy extraction attacks including prefix attacks and in-context learning (ICL). Furthermore, our analysis validates that existing fine-tuning APIs provided by OpenAI and Azure AI Studio are susceptible to our Janus attack, allowing an adversary to conduct such an attack at a low cost.

연구 동기 및 목표

  • 모델가 치명적인 잊음을 겪은 후에도 파인튜닝을 통해 이전에 잊혀진 PII를 복구하고 공개할 수 있는지 조사한다.
  • RLHF와 같은 정합성 기반 개인정보 보호 조치를 우회하는 데 있어 파인튜닝의 효과성을 평가한다.
  • 파인튜닝에 사용되는 PII 인스턴스 수가 매우 적을 때도 숨겨진 PII를 재구성할 수 있는지 탐색한다.
  • GPT-3.5와 같은 실제 LLM에서 파인튜닝 인터페이스를 통한 개인정보 泄露 위험을 평가한다.
  • 파인튜닝을 활용해 잊혀진 PII를 복구하는 새로운 공격 벡터인 Janus를 제안하며, LLM 배포 시 중요한 개인정보 유출 위협을 드러낸다.

제안 방법

  • Janus 공격는 PII 연관 작업을 구성하여, 모델을 최소한의 PII 인스턴스 데이터셋(예: 10개의 이메일 주소 쌍)으로 파인튜닝한다.
  • 공격는 사람의 이름을 특정 PII로 매핑하는 프롬프트를 사용하여, LLM이 이름과 특정 PII를 연관시키도록 훈련시킨다.
  • 파인튜닝은 모델가 치명적인 잊음을 겪은 후에 적용되어, PII 연관 작업을 효과적으로 복원한다.
  • 성능 평가에는 Enron 및 비-Enron 이메일 데이터셋에서 정밀도와 히트율 메트릭을 사용한다.
  • 기존의 잠금 해제 기법과의 비교를 통해, 파인튜닝이 잊음 현상을 역전시키는 데서 유일하게 효과적인 요소임을 분리 평가한다.
  • 실험은 GPT-3.5-Turbo 및 GPT-2 모델을 사용하며, 연속 학습을 통해 실제 다중 작업 환경을 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1소수의 PII 인스턴스로 파인튜닝을 수행할 경우, 기존에 잊혀진 개인 정보를 복구하고 노출시킬 수 있는가?
  • RQ2Janus 공격는 기존의 잠금 해제 기법에 비해 얼마나 더 효과적으로 PII를 복구하는가?
  • RQ3Janus 공격의 효과성은 Enron과 비-Enron 이메일 등 다양한 PII 유형이나 도메인 간에 달라지는가?
  • RQ4치명적인 잊음은 모델이 PII를 유지하는 능력에 어떤 영향을 미치며, 파인튜닝으로 이 손실을 복구할 수 있는가?
  • RQ5RLHF와 같은 정합성 메커니즘은 파인튜닝을 통해 우회되어 PII 공개를 가능하게 할 수 있는가?

주요 결과

  • GPT-3.5를 단지 10개의 PII 예시로 파인튜닝하여, Enron 데이터셋에서 숨겨진 이메일 주소를 복구하는 데 정밀도 69.9%를 달성했다.
  • Janus 공격는 RLHF 정합성 보호 조치를 100%의 비율로 우회하여, 개인정보 보호 조치를 완전히 회피한 것으로 확인되었다.
  • 반면, 잠금 해제 기법은 동일한 작업에서 히트율 6%와 정밀도 0%를 기록하여, 정합성 우회에는 성공했지만 PII 복구 성능은 열악한 것으로 나타났다.
  • 더 복잡한 비-Enron 데이터셋에서는 100개의 예시로도 정밀도 1.9%를 기록하여, 이름과 도메인 추출에 도메인 특화된 과제가 있음을 시사했다.
  • 최소한의 파인튜닝 데이터로도 공격가 효과를 유지하여, 낮은 비용의 간섭으로도 잊혀진 PII를 복구할 수 있음을 보여주었다.
  • 결과는 치명적인 잊음이 모델 성능에 해로운 영향을 미치지만, 파인튜닝을 통해 이를 활용하여 민감한 PII를 복원하고 노출시킬 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.