[논문 리뷰] HuRef: HUman-REadable Fingerprint for Large Language Models
이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 기본 아키텍처를 유일하게 식별할 수 있는 인간이 읽을 수 있는 지문(HuRef)을 제안한다. 이 지문은 모델의 파라미터를 폭 드러내거나 훈련 과정에 간섭하지 않으면서도, 사전 훈련 이후 안정적인 파라미터 벡터 방향을 활용하여, StyleGAN2를 통해 자연스러운 이미지 지문(예: 개)을 생성한다. 이 지문은 피닝-튜닝, 강화학습을 통한 인간 피드백 훈련(RLHF), 계속된 사전 훈련 등 다양한 과정에서도 변화하지 않으며, 직관적인 시각적 식별과 정밀한 정량적 검증을 모두 가능하게 한다.
Protecting the copyright of large language models (LLMs) has become crucial due to their resource-intensive training and accompanying carefully designed licenses. However, identifying the original base model of an LLM is challenging due to potential parameter alterations. In this study, we introduce HuRef, a human-readable fingerprint for LLMs that uniquely identifies the base model without interfering with training or exposing model parameters to the public. We first observe that the vector direction of LLM parameters remains stable after the model has converged during pretraining, with negligible perturbations through subsequent training steps, including continued pretraining, supervised fine-tuning, and RLHF, which makes it a sufficient condition to identify the base model. The necessity is validated by continuing to train an LLM with an extra term to drive away the model parameters' direction and the model becomes damaged. However, this direction is vulnerable to simple attacks like dimension permutation or matrix rotation, which significantly change it without affecting performance. To address this, leveraging the Transformer structure, we systematically analyze potential attacks and define three invariant terms that identify an LLM's base model. Due to the potential risk of information leakage, we cannot publish invariant terms directly. Instead, we map them to a Gaussian vector using an encoder, then convert it into a natural image using StyleGAN2, and finally publish the image. In our black-box setting, all fingerprinting steps are internally conducted by the LLMs owners. To ensure the published fingerprints are honestly generated, we introduced Zero-Knowledge Proof (ZKP). Experimental results across various LLMs demonstrate the effectiveness of our method. The code is available at https://github.com/LUMIA-Group/HuRef.
연구 동기 및 목표
- 공개되지 않은 파라미터를 가진 피닝-튜닝 또는 계속된 사전 훈련된 LLM의 기반 모델을 식별하는 데 어려움을 해결하기 위해.
- 기반 모델을 인간이 직관적으로 식별할 수 있고 정밀한 정량적 검증이 가능한 방법을 개발하기 위해.
- SFT, RLHF, 다국어 계속된 사전 훈련을 포함한 다양한 훈련 절차 동안에도 지문이 안정적으로 유지되도록 보장하기 위해.
- StyleGAN2와 같은 생성 모델을 활용해 불변 항목을 자연스러운 이미지로 매핑함으로써 지문을 인간이 읽을 수 있도록 만들기 위해.
- 모델 파라미터를 공개하지 않아도 되어 모델 보안과 라이센스 무결성을 유지할 수 있는 솔루션을 제공하기 위해.
제안 방법
- 사전 훈련 수렴 후 LLM 내에서 안정적인 파라미터 벡터 방향을 식별하여, SFT 및 RLHF와 같은 후속 훈련 단계 동안에도 대부분 변화하지 않는 특성을 확보한다.
- Transformer 아키텍처의 구조적 제약을 분석함으로써, 일반적인 가중치 재배열(예: 차원 순서 변경 또는 행렬 회전)에 저항하는 세 가지 불변 항목을 정의한다.
- 이 불변 항목들을 컨volutional 인코더를 사용해 가우시안 랜덤 벡터로 매핑하여 이미지 생성을 가능하게 한다.
- 사전 훈련된 StyleGAN2 모델이 가우시안 벡터를 자연스러운 이미지 지문(예: 개)으로 변환하며, 이는 기반 모델을 시각적으로 반영한다.
- 지문은 LLM 소유자가 유일하게 모델 파라미터로부터 생성하며, 공개적 검증은 가중치가 아닌 불변 항목과 이미지만을 기반으로 한다.
- 이 방법은 다양한 훈련 제약 조건 하에서 피닝-튜닝 및 계속된 사전 훈련된 변형 모델을 포함한 여러 LLM에 대해 검증되었다.
실험 결과
연구 질문
- RQ1LLM 파라미터 벡터의 방향이 다양한 훈련 절차 동안 기반 모델을 안정적이고 신뢰할 만하게 식별하는 데 유용한가?
- RQ2차원 순서 변경이나 행렬 회전과 같은 일반적인 가중치 조작 공격에 저항할 수 있는 불변 항목을 어떻게 설계할 수 있는가?
- RQ3유일성과 안정성을 유지하면서도 지문을 얼마나 인간이 읽을 수 있도록 만들 수 있는가?
- RQ4SFT, RLHF, 새로운 언어의 어휘 확장이 포함된 계속된 사전 훈련 동안 지문이 여전히 불변하는가?
- RQ5사람 사용자가 시각적 지문만으로 기반 모델을 신뢰성 있게 식별할 수 있는가?
주요 결과
- 사전 훈련 수렴 후 LLM 파라미터의 벡터 방향은 매우 안정적이며, 체크포인트 간 코사인 유사도가 10k–60k 스텝에서 56.23%에서 310k–360k 스텝에서 94.25%로 증가하여 강한 수렴을 시사한다.
- 다른 전역 랜덤 시드로 새로 훈련한 모델들은 상당히 다른 파라미터 방향을 가지며, 불변 항목 간 코사인 유사도가 최소 2.08%까지 떨어져 고유성을 확인한다.
- 인간 주제자료 연구에서 지문을 매칭하여 기반 모델을 식별한 정확도가 94.74%에 달하여 강력한 인간 가시성과 직관적 시각적 식별 능력을 입증한다.
- SFT, RLHF, 새로운 언어 어휘로 확장된 계속된 사전 훈련 동안 지문은 변하지 않으며, 일관된 외관과 불변 항목을 유지한다.
- 피닝-튜닝 또는 적응된 모델일지라도 기반 모델의 본질을 반영하는 고유하고 시각적으로 해석 가능한 지문(예: 개 이미지)을 성공적으로 생성한다.
- 차원 순서 변경 및 행렬 회전과 같은 공격에 대해 불변 항목이 안정성을 유지함으로써 그 저항성이 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.