[논문 리뷰] Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned
저자들은 다수의 모델 규모와 안전 개입에 걸친 수동식 레드팀을 수행하고, 대형 레드팀 공격 데이터셋을 공개하며, 확장 추세와 해를 분석해 언어 모델의 안전 실천에 정보를 제공합니다.
We describe our early efforts to red team language models in order to simultaneously discover, measure, and attempt to reduce their potentially harmful outputs. We make three main contributions. First, we investigate scaling behaviors for red teaming across 3 model sizes (2.7B, 13B, and 52B parameters) and 4 model types: a plain language model (LM); an LM prompted to be helpful, honest, and harmless; an LM with rejection sampling; and a model trained to be helpful and harmless using reinforcement learning from human feedback (RLHF). We find that the RLHF models are increasingly difficult to red team as they scale, and we find a flat trend with scale for the other model types. Second, we release our dataset of 38,961 red team attacks for others to analyze and learn from. We provide our own analysis of the data and find a variety of harmful outputs, which range from offensive language to more subtly harmful non-violent unethical outputs. Third, we exhaustively describe our instructions, processes, statistical methodologies, and uncertainty about red teaming. We hope that this transparency accelerates our ability to work together as a community in order to develop shared norms, practices, and technical standards for how to red team language models.
연구 동기 및 목표
- 모델 크기와 안전 개입에 따라 레드팀 효과성이 어떻게 확장되는지 조사한다.
- 레드팀으로 발견된 해로운 출력의 유형과 빈도를 정량화한다.
- 커뮤니티 표준을 발전시키기 위한 투명한 방법론, 데이터셋 및 지침을 제공한다.
- 언어 모델의 더 안전한 배치를 위한 한계와 정책 시사점을 고찰한다.
제안 방법
- 오픈 엔디드 및 주제 중심 대화를 통해 해로운 출력을 유도하기 위해 일반 언어 모델에 레드팀을 수행한다.
- 네 가지 모델 유형을 비교한다: 일반 LM(Plain LM), HHH 프롬프트를 사용한 LM(HHH-prompted LM), 거절 샘플링(Rejection Sampling, RS), RLHF 기반 HH 모델.
- 무해성 선호 모델을 학습시키기 위해 더 해로운 응답과 덜 해로운 응답의 쌍을 수집한다.
- 레드팀 자체 평가와 선호 모델의 해로움 점수를 통해 공격 성공을 측정한다.
- 최소 무해성 점수를 사용해 피해를 집계하고 모델 유형과 크기에 따른 분포를 분석한다.
- 38,961건의 레드팀 공격 데이터셋을 공개하고 동반 문서를 제공한다.
실험 결과
연구 질문
- RQ1레이드팀의 난이도는 모델 크기와 다른 안전 개입(Plain LM, HHH 프롬프트, RS, RLHF)에 따라 어떻게 달라지는가?
- RQ2발견된 해로운 유형의 일반적인 종류는 무엇이며, 모델 유형과 크기에 따라 어떻게 클러스터링되는가?
- RQ3무해성 선호 모델이 안전 개입을 안내하고 해로운 출력을 줄이는 데 얼마나 효과적인가?
- RQ4대규모 크라우드워커를 포함한 레드팀에서의 한계 및 윤리적 고려사항은 무엇인가?
주요 결과
- RLHF 모델은 모델 크기가 커질수록 레드팀 활동이 점점 더 어려워진다.
- Plain LM, HH 프롬프트 LM, RS 모델은 레드팀 취약성에서 크기에 따라 일정한(완만한) 확장 추세를 보인다.
- RS 모델은 어떤 규모에서도 레드팀화가 가장 어려우나 회피적으로 해롭지 않은 경향이 있다.
- RLHF 및 RS 개입은 평균 해로운 정도를 감소시키나 해로운 출력의 완전한 제거에는 이르지 못한다(분포 꼬리에서 확인).
- 38,961건의 레드팀 공격 데이터셋을 공개하여 더 넓은 분석과 도구 개발을 가능하게 한다.
- 해로운 유형에는 비방적 언어, 차별, 괴롭힘, 허위정보 및 PII 관련 콘텐츠가 포함되며, 클러스터링은 의미적으로 관련된 공격 범주를 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.