[논문 리뷰] Language Model Inversion
이 논문은 다음 토큰 확률 분포에서 숨겨진 프롬프트를 복원하는 새로운 방법을 제안한다. 이 방법은 미세조정된 인코더-디코더 모델을 사용해 입력 텍스트를 재구성한다. Llama-2 7B에서 이 접근법은 BLEU 점수 59와 토큰 수준 F1 78%를 기록하며, 텍스트 전용 출력이나 상위-K 확률과 같은 제한된 액세스 환경에서도 정확히 27%의 프롬프트를 복원한다.
Language models produce a distribution over the next token; can we use this information to recover the prompt tokens? We consider the problem of language model inversion and show that next-token probabilities contain a surprising amount of information about the preceding text. Often we can recover the text in cases where it is hidden from the user, motivating a method for recovering unknown prompts given only the model's current distribution output. We consider a variety of model access scenarios, and show how even without predictions for every token in the vocabulary we can recover the probability vector through search. On Llama-2 7b, our inversion method reconstructs prompts with a BLEU of $59$ and token-level F1 of $78$ and recovers $27\%$ of prompts exactly. Code for reproducing all experiments is available at http://github.com/jxmorris12/vec2text.
연구 동기 및 목표
- 언어 모델의 다음 토큰 확률 분포가 원래 입력 프롬프트를 복원하는 데 충분한 정보를 泄露하는지 여부를 조사하기 위해.
- 완전한 확률에 접근할 수 없거나 간접적인 접근만 가능한 상황에서도 언어 모델 출력을 역전환하여 숨겨진 프롬프트를 복원할 수 있는 방법을 개발하기 위해.
- 완전한 확률 벡터, 상위-K 출력, 이산 텍스트 생성 등 다양한 액세스 패턴에서 프롬프트 복원의 강건성을 평가하기 위해.
- 동일한 모델 패밀리 내의 다른 언어 모델 아키텍처 간에 역전환 모델의 이식성(transferability)을 평가하기 위해.
- 프라이빗 정보(예: 이름, 날짜, 국적 등)가 프롬프트 역전환 과정 중에 얼마나 유지되거나 泄露되는지 측정하기 위해.
제안 방법
- 두 단계 역전환 프레임워크 제안: 첫째, 다음 토큰 확률 벡터를 조밀한 임베딩으로 표현하고, 둘째, 미세조정된 인코더-디코더 트랜스포머를 사용해 이 임베딩을 자연어 프롬프트로 디코딩하기.
- 재구성 손실을 사용해 원본 프롬프트와 재구성된 프롬프트 간의 차이를 최소화하도록, 합성 프롬프트-확률 쌍에 기반해 역전환 모델을 훈련하기.
- 완전한 확률 액세스, 상위-K 확률 확보, 이산 텍스트 생성 등 다양한 시나리오를 시뮬레이션하여 다양한 액세스 제약 조건 하에서도 역전환 가능하도록 하기.
- 부분적인 출력만 제공될 경우, 반복적 쿼리 기반의 확률 추정을 통해 누락된 확률 성분을 재구성하기.
- 이식 학습을 활용해 한 모델(예: Llama-2 7B)에서 훈련된 역전환 모델을 다른 모델(예: Llama-chat 7B)에 적용하기.
- 이름, 날짜, 국적 등을 포함한 합성 프롬프트에 대해 편집(fine-tuning)하여 프라이빗 속성 복원에 응용하기.
실험 결과
연구 질문
- RQ1대규모 언어 모델의 다음 토큰 확률 분포를 역전환하여 원본 입력 프롬프트를 높은 정밀도로 복원할 수 있는가?
- RQ2예를 들어 이산 텍스트 출력이나 상위-K 확률만 관찰 가능한 제한된 모델 액세스 상황에서 프롬프트 역전환이 얼마나 효과적인가?
- RQ3이 과정에서 프라이빗 정보(예: 이름, 날짜, 국적 등)는 어느 정도 유지되거나 泄露되는가?
- RQ4Llama-2와 Llama-chat처럼 동일한 아키텍처 패밀리에 속한 다른 모델들 간에 역전환 방법이 일반화되는가?
- RQ5RLHF 정합성 기법이 적용된 환경에서, 역전환 기법은 텍스트 기반 재정의 공격(Jailbreak)보다 성능가능성이 높은가?
주요 결과
- Llama-2 7B에서 이 역전환 방법은 BLEU 점수 59와 토큰 수준 F1 78%를 기록하여 입력 프롬프트의 고품질 재구성 능력을 입증한다.
- 사용자가 프롬프트를 직접 볼 수 없는 상황에서도 정확히 27%의 프롬프트를 복원할 수 있다.
- 합성 생물학 데이터셋(synthbio dataset)에서 국적과 국적 정보는 각각 87.2%와 64.5%의 정확한 매칭 정확도로 재구성된다.
- 개별 날짜와 연도의 경우 재구성 성능이 떨어져, 연도의 정확도는 synthbio 데이터셋에서 1.0%로 떨어진다.
- 이산 텍스트 출력만 제공되는 경우에도 반복적 쿼리 기반 확률 추정 덕분에 충분한 확률 추정이 가능해 역전환이 효과적으로 유지된다.
- 텍스트 기반 재정의 공격는 종종 이러한 정합성 기법에 의해 차단되는 반면, 이 역전환 방법은 RLHF 정합성 기법에 대해 강건하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.