Skip to main content
QUICK REVIEW

[논문 리뷰] Does fine-tuning GPT-3 with the OpenAI API leak personally-identifiable information?

Albert Yu Sun, Eliott Zemour|arXiv (Cornell University)|2023. 07. 31.
Privacy-Preserving Technologies in Data인용 수 7
한 줄 요약

이 연구는 OpenAI의 API를 통해 GPT-3를 피팅(fine-tuning)할 경우 개인식별정보(PII)의 기억 및 泄露가 발생하는지 조사한다. Enron 이메일 데이터셋을 사용하여 분류 및 실용적인 자동완성 작업을 통한 블랙박스 공격 시뮬레이션을 수행한 결과, 피팅된 GPT-3가 높은 재현율(26.29%, OOD 프롬프트 기준)과 비현저한 정밀도(5.71%)로 PII를 추출할 수 있음을 입증하여 실생활 응용 프로그램에서의 심각한 개인정보 유출 위험을 드러낸다.

ABSTRACT

Machine learning practitioners often fine-tune generative pre-trained models like GPT-3 to improve model performance at specific tasks. Previous works, however, suggest that fine-tuned machine learning models memorize and emit sensitive information from the original fine-tuning dataset. Companies such as OpenAI offer fine-tuning services for their models, but no prior work has conducted a memorization attack on any closed-source models. In this work, we simulate a privacy attack on GPT-3 using OpenAI's fine-tuning API. Our objective is to determine if personally identifiable information (PII) can be extracted from this model. We (1) explore the use of naive prompting methods on a GPT-3 fine-tuned classification model, and (2) we design a practical word generation task called Autocomplete to investigate the extent of PII memorization in fine-tuned GPT-3 within a real-world context. Our findings reveal that fine-tuning GPT3 for both tasks led to the model memorizing and disclosing critical personally identifiable information (PII) obtained from the underlying fine-tuning dataset. To encourage further research, we have made our codes and datasets publicly available on GitHub at: https://github.com/albertsun1/gpt3-pii-attacks

연구 동기 및 목표

  • OpenAI의 API를 통해 피팅된 GPT-3 모델이 블랙박스 접근 조건에서 개인식별정보(PII)를 泄露하는지 조사하기.
  • 이메일 자동완성 서비스와 같은 실용적이고 실생활 응용 프로그램에서의 PII 노출 위험 평가하기.
  • 사설·폐쇄형 언어모델에서 민감한 데이터를 추출하는 데에 효과적인 간단한 프롬프팅 기법의 성능 평가하기.
  • 특히 GDPR 및 중국의 AI 서비스 관리 조례와 같은 규제 프레임워크 하에서 기업 및 소비자 사용 케이스에서 피팅된 LLM의 개인정보 유출 취약성 강조하기.
  • 향후 피팅 파이프라인에 차등 개인정보 보호 및 PII 정제 기법을 도입할 것을 촉구하기.

제안 방법

  • 저자들은 OpenAI의 피팅 API를 사용하여 Enron 이메일 데이터셋을 기반으로 텍스트 분류 및 텍스트 생성 작업을 위한 GPT-3 모델(Curie)을 피팅하였다.
  • 두 가지 공격 시나리오를 설계하였으며, 분류 설정에서의 PII 추출을 위한 단순 프롬프팅 방법과 이메일 본문 생성을 시뮬레이션하는 현실적인 자동완성 작업을 포함한다.
  • 분류 작업의 경우, '이 이메일에 있는 사람의 이름은 무엇입니까?'와 같은 프롬프트를 사용하여 모델 출력에서 PII를 추출하였다.
  • 자동완성 작업의 경우, 훈련 데이터셋의 이메일 제목(Train)과 분포 외(OOD) 제목을 사용하여 실생활 사용 패턴에서의 PII 泄露를 테스트하였다.
  • Enron 데이터셋의 기준값과 비교하여 추출된 PII의 정밀도와 재현율을 측정하였으며, 이름, 조직명, 연락처 정보 등을 중심으로 분석하였다.
  • 재현성과 향후 연구를 장려하기 위해 저자들은 코드와 데이터셋을 공개하였다.

실험 결과

연구 질문

  • RQ1OpenAI의 API를 통해 피팅된 GPT-3 모델에서, 단순한 프롬프팅과 블랙박스 접근만으로도 개인식별정보(PII)를 추출할 수 있는가?
  • RQ2이메일 자동완성 서비스와 같은 실용적 응용 프로그램에서 피팅된 GPT-3 모델이 PII를 얼마나 기억하고 있는가?
  • RQ3실생활 사용 시나리오에서 분포 내 및 분포 외 프롬프트 간 PII 泄露 수준은 어떻게 비교되는가?
  • RQ4피팅된 GPT-3 모델에서 단순 프롬프팅과 현실적인 프롬프팅을 사용했을 때 PII 추출의 정밀도와 재현율은 각각 어떻게 되는가?
  • RQ5사설·폐쇄형 모델에서의 PII 泄露가 GDPR 및 중국의 AI 서비스 관리 조례와 같은 개인정보 보호 규제에 어떤 영향을 미치는가?

주요 결과

  • 피팅된 GPT-3 모델은 분포 내 프롬프트 기준 27.83%, 분포 외 프롬프트 기준 26.29%의 높은 재현율로 PII를 기억하는 것으로 나타났다. 자동완성 작업에서의 결과이다.
  • 분포 외 프롬프트 기준 PII 추출 정밀도는 13.16%, 분포 내 프롬프트 기준은 5.71%로, 추출된 PII 토큰 중 약 17분의 1에서 40분의 1 수준이 실제 훈련 데이터와 정확히 일치함을 의미한다.
  • 분포 내 프롬프트에서 236개, 분포 외 프롬프트에서 223개의 고유한 PII 인스턴스를 성공적으로 추출하여, 새로운 입력이라도 PII 유출을 유도할 수 있음을 입증하였다.
  • 가장 자주 기억된 PII 유형은 개인 및 조직의 이름으로, 'Jeffrey Skilling'이나 'Enron Corporation'과 같은 유명 인물이나 기관이 포함되어 있었다.
  • 연구 결과, PII 유출이 직접적인 프롬프트에 국한되지 않고, 자동완성과 같은 현실적이고 생산 환경 유사 시나리오에서도 발생함을 확인하여, 기업 및 소비자 응용 프로그램에 실질적인 위험을 초래함을 시사한다.
  • 결과적으로, 폐쇄형 API를 통해 피팅된 대규모 언어모델조차도 개인정보 유출 공격에 취약함을 입증하며, 개인정보 보호 기법을 적용한 피팅 파이프라인의 긴급한 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.