[논문 리뷰] Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs
이 논문은 책임감 있는 모델이 응답하지 말아야 할 939개의 위험한 지시어를 포함한, 대규모 언어 모델(LMM)의 안전장치를 평가하기 위한 최초의 오픈소스 데이터셋인 Do-Not-Answer를 소개한다. 또한 인간이 애너테이션한 응답을 기반으로 훈련된 소형 BERT 유사 분류기를 활용한 자동 안전 평가 방법을 제안하여, 낮은 비용으로 GPT-4 수준의 성능을 달성한다.
With the rapid evolution of large language models (LLMs), new and hard-to-predict harmful capabilities are emerging. This requires developers to be able to identify risks through the evaluation of "dangerous capabilities" in order to responsibly deploy LLMs. In this work, we collect the first open-source dataset to evaluate safeguards in LLMs, and deploy safer open-source LLMs at a low cost. Our dataset is curated and filtered to consist only of instructions that responsible language models should not follow. We annotate and assess the responses of six popular LLMs to these instructions. Based on our annotation, we proceed to train several BERT-like classifiers, and find that these small classifiers can achieve results that are comparable with GPT-4 on automatic safety evaluation. Warning: this paper contains example data that may be offensive, harmful, or biased.
연구 동기 및 목표
- 대규모 언어 모델(LMM)에서 나타나는 잠재적인 해로운 능력의 증가 위험을 해결하기 위해, 특히 강력한 안전 메커니즘이 없는 오픈소스 모델의 맥락에서.
- 책임감 있는 LLM이 응답을 거부해야 할 위험한 지시어의 표준화된 오픈소스 데이터셋을 구축하기 위해.
- 소형으로 최적화된 분류기를 사용해 저비용으로 자동화된 평가 방법을 개발하기 위해.
- 세분화된 위험 유형 분류 체계를 기반으로 상용 및 오픈소스 LLM의 안전성 성능을 비교 평가하기 위해.
- GPT-4와 같은 고비용 모델에 의존하지 않고도 확장 가능하고 신뢰할 수 있는 안전성 평가를 가능하게 하기 위해.
제안 방법
- 5가지의 다른 해로운 유형을 포함하는 3단계 계층적 위험 분류 체계를 제안하였으며, 각 카테고리당 최소 10개의 프롬프트를 포함해 총 939개의 위험한 지시어를 확보하였다.
- GPT-4, LLaMA-2, Vicuna, ChatGLM2 등 6개의 LLM에서 이러한 지시어에 대한 응답을 수집하고, 인간이 애너테이션한 5,000개 이상의 모델 응답을 확보하였다.
- 애너테이션된 응답을 기반으로 BERT 유사 분류기를 훈련시켜 자동으로 행동 분류 및 해로운 응답 탐지 기능을 수행하였다.
- 지시어-응답 쌍과 응답 전용 입력을 모두 사용하여, 입력의 맥락이 분류 성능에 미치는 영향을 평가하였다.
- Longformer(2048토큰 맥락)와 BERT(512토큰 맥락)의 성능을 비교하여, 맥락 길이가 복잡한 해로운 행동 탐지에 미치는 영향을 분석하였다.
- 정확도와 매크로-F1을 평가 지표로 사용하여, 소형 분류기의 성능을 인간처럼 평가하는 GPT-4와 비교 평가하였다.

실험 결과
연구 질문
- RQ1소형으로 최적화된 BERT 유사 모델이 GPT-4 수준의 성능을 달성할 수 있는가?
- RQ2지시어와 응답을 모두 입력으로 제공했을 때, 소형 모델이 해로운 응답을 얼마나 효과적으로 탐지할 수 있는가?
- RQ3더 긴 맥락 길이(예: Longformer)가 짧은 맥락 모델보다 복잡한 해로운 행동을 탐지하는 데 더 효과적인가?
- RQ4상용 및 오픈소스 LLM 간에 위험한 지시어에 대한 거부율과 응답 패턴은 어떻게 다를까?
- RQ5다중 레이블 응답 애너테이션은 단일 레이블 분류보다 안전성 평가 정확도를 얼마나 향상시키는가?
주요 결과
- 6억 개 미만의 파라미터를 가진 최적화된 BERT 유사 모델이 해로운 응답 탐지에서 98% 이상의 정확도와 80% 이상의 매크로-F1 성능을 달성하여, GPT-4 수준의 성능을 재현하였다.
- 평가된 모델들 중 LLaMA-2가 가장 높은 거부율(99.7%)을 보였고, ChatGLM2는 가장 낮은 거부율(90.9%)을 기록하였다.
- 지시어를 입력으로 포함시킴으로써, 응답만을 사용한 경우보다 분류 성능이 향상되었으며, 특히 행동 분류의 경우 두드러진 개선이 관찰되었다.
- Longformer는 복잡한 해로운 행동 탐지에서 BERT를 능가했으며, 특히 전체 응답 맥락이 필요한 카테고리(예: 카테고리 2 및 5)에서 두드러진 성능 향상을 보였다.
- GPT-4와 Longformer 기반 평가자 간의 모델 안전성 순위가 거의 동일하여, 자동 평가 방법의 타당성을 확인하였다.
- 연구는 위험 유형에 따라 구체적인 응답 패tern이 존재함을 밝혀내었으며, 이는 특정 유형의 해로운 프롬프트에 대해 모델이 예측 가능한 실패 모드를 보임을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.