[논문 리뷰] Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks
이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 모델 가중치를 직접 편집하여 민감한 정보를 진정으로 삭제할 수 있는지 조사하며, 공격 및 방어 프레임워크를 제안한다. ROME 및 MEMIT과 같은 최신 편집 기법에도 불구하고, 공격자는 삭제된 사실을 38–89%의 경우에서 복구할 수 있으며, 이는 은닉 상태와 질문 재구성에서 잔류하는 흔적들이 삭제의 효과성을 떨어뜨린다는 것을 보여주며, 강력하고 개인정보 보호에 적합한 모델 편집을 이루는 데의 어려움을 드러낸다.
Pretrained language models sometimes possess knowledge that we do not wish them to, including memorized personal information and knowledge that could be used to harm people. They can also output toxic or harmful text. To mitigate these safety and informational issues, we propose an attack-and-defense framework for studying the task of deleting sensitive information directly from model weights. We study direct edits to model weights because (1) this approach should guarantee that particular deleted information is never extracted by future prompt attacks, and (2) it should protect against whitebox attacks, which is necessary for making claims about safety/privacy in a setting where publicly available model weights could be used to elicit sensitive information. Our threat model assumes that an attack succeeds if the answer to a sensitive question is located among a set of B generated candidates, based on scenarios where the information would be insecure if the answer is among B candidates. Experimentally, we show that even state-of-the-art model editing methods such as ROME struggle to truly delete factual information from models like GPT-J, as our whitebox and blackbox attacks can recover "deleted" information from an edited model 38% of the time. These attacks leverage two key observations: (1) that traces of deleted information can be found in intermediate model hidden states, and (2) that applying an editing method for one question may not delete information across rephrased versions of the question. Finally, we provide new defense methods that protect against some extraction attacks, but we do not find a single universally effective defense method. Our results suggest that truly deleting sensitive information is a tractable but difficult problem, since even relatively low attack success rates have potentially severe societal implications for real-world deployment of language models.
연구 동기 및 목표
- LLM에서 개인 정보 및 해로운 지식을 포함한 민감한 정보를 신뢰할 수 있게 삭제할 수 있는 필요성을 해결하여, 개인정보 권리와 안전성을 지원한다.
- 공격이 삭제된 사실이 작은 B개의 후보 중에서 복구 가능한 경우에 성공으로 간주하는 엄격한 위협 모델을 수립하여 실제 세계의 적대적 상황을 반영한다.
- 정보를 삭제하기 위해 가중치를 직접 수정하는 직접적 모델 편집 기법이 RLHF나 데이터 수준의 간섭 조치에 비해 타당하고 안전한 대안인지 평가한다.
- 의도된 공격과 뜻밖의 추출 공격에 모두 강건한 성능을 보이는 제안된 방어 전략의 성능을 시험한다. 특히 화이트박스 탐지 공격에 대한 강건성을 평가한다.
- 심지어 최신 편집 기법이라도 정보를 완전히 지우지 못함을 입증하며, 모델의 프라이버시와 안전성에 대한 기대를 도전한다.
제안 방법
- 민감한 사실 정보를 LLM 가중치에서 삭제하는 데 있어 편집의 효과성을 테스트하기 위한 이중 공격-방어 프레임워크를 제안한다.
- 은닉 상태와 어텐션 헤드에 잔류하는 정보를 악용하는 두 가지 화이트박스 공격, 즉 헤드 프로젝션 공격 및 확률 델타 공격를 설계한다.
- 삭제된 질문의 재구성된 버전을 모델에 쿼리하여, 삭제의 일반화 능력을 테스트하는 블랙박스 공격을 제안한다.
- 사실 삭제, 빈 응답 주입, 오류 주입, 헤드 프로젝션, 최대 엔트로피 정규화, IR 기반 방어 전략을 포함한 다수의 방어 전략을 적용하여 모델 가중치의 강건성을 높인다.
- 타겟 모델로 GPT-J를 사용하고, CounterFact 및 zsRE 데이터셋에서 평가하며, 공격 성공률을 B개 후보 중 복구된 정답 비율로 측정한다.
- 성공이 작은 후보 집합 B에서 생성된 응답들 중 정답을 복구하는 것으로 정의되는 위협 모델을 적용하여 현실적인 적대적 환경를 시뮬레이션한다.
실험 결과
연구 질문
- RQ1현재의 모델 편집 기법을 사용하여 LLM 가중치에서 민감한 사실 정보를 신뢰성 있게 삭제할 수 있는가?
- RQ2화이트박스 및 블랙박스 추출 공격는 편집을 통해 삭제된 것으로 간주되는 모델에서 정보를 얼마나 성공적으로 복구하는가?
- RQ3제안된 방어 메커니즘은 의도된 공격과 뜻밖의 추출 공격 양쪽에 대해 얼마나 효과적인가?
- RQ4은닉 상태나 어텐션 헤드에 잔류하는 정보가 모델 편집을 통한 삭제 효과를 떨어뜨리는가?
- RQ5부분적인 삭제가 LLM 배포 시 프라이버시, 안전성, 데이터 소유권 권리 준수에 어떤 영향을 미치는가?
주요 결과
- 최신 편집 기법인 ROME 및 MEMIT조차도 사실 정보를 완전히 삭제하지 못하며, 특히 확률 델타 공격 하에서 최대 89.65%의 경우에 삭제된 사실을 복구할 수 있다.
- 헤드 프로젝션 공격는 IR 방어에 대해 84.80%의 성공률을 기록했고, 헤드 프로젝션 방어에 대해서는 56.83%의 성공률을 기록하여, 방어가 항상 강건하지 않음을 보여준다.
- 최대 엔트로피 방어는 화이트박스 공격의 성공률을 ROME 기준 2.42%로 낮추고 MEMIT 기준 38.11%로 줄였지만, 블랙박스 공격는 각각 CounterFact에서 28.00%, zsRE에서 19.42%의 성공률을 기록하여 여전히 취약함을 보여준다.
- 최대 엔트로피 방어를 대상으로 하지 않은 확률 델타 공격도 여전히 이 방어에 대해 2.42%의 성공률을 기록하여, 일부 방어 전략이 뜻밖의 공격에 대해 우연한 보호 기능을 제공할 수 있음을 보여준다.
- 빈 응답 주입 방어는 ROME 기반 공격에 대해 zsRE에서 99.78%의 성공률로 공격을 차단했지만, 일반화에 실패하여 MEMIT 기반 동일 공격에 대해선 88.55%의 성공률을 기록했다.
- 모든 공격에 효과적인 단일 방어 방법은 존재하지 않으며, 심지어 최고의 방어 전략조차도 상당한 복구 비율을 남기고 있어 진정한 삭제는 여전히 해결하기 어려운 문제임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.