Skip to main content
QUICK REVIEW

[논문 리뷰] HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Mantas Mazeika, Long Phan|arXiv (Cornell University)|2024. 02. 06.
Complex Systems and Decision Making인용 수 20
한 줄 요약

HarmBench은 LLM의 자동 레드팀 작성을 위한 표준화된 대규모 벤치마크를 제공하고, 강력한 거부를 개선하기 위한 효율적인 적대적 학습 방법(R2D2)을 도입합니다.

ABSTRACT

Automated red teaming holds substantial promise for uncovering and mitigating the risks associated with the malicious use of large language models (LLMs), yet the field lacks a standardized evaluation framework to rigorously assess new methods. To address this issue, we introduce HarmBench, a standardized evaluation framework for automated red teaming. We identify several desirable properties previously unaccounted for in red teaming evaluations and systematically design HarmBench to meet these criteria. Using HarmBench, we conduct a large-scale comparison of 18 red teaming methods and 33 target LLMs and defenses, yielding novel insights. We also introduce a highly efficient adversarial training method that greatly enhances LLM robustness across a wide range of attacks, demonstrating how HarmBench enables codevelopment of attacks and defenses. We open source HarmBench at https://github.com/centerforaisafety/HarmBench.

연구 동기 및 목표

  • LLM에 대해 자동 레드팀을 평가하기 위한 표준화되고 확장 가능한 프레임워크의 필요성을 동기화한다.
  • 레드팀 평가에서 폭넓음, 비교가능성, 강건한 지표를 달성하기 위해 HarmBench를 설계한다.
  • 다양한 행동, 모델, 방어책에 걸쳐 대규모이고 재현 가능한 평가를 제공한다.
  • 효율적인 적대적 학습 방법을 통해 공격과 방어의 공동 개발을 시연한다.

제안 방법

  • 공격 성공률(ASR)을 레드팀 작동효과의 주요 지표로 정의한다.
  • 텍스트 및 다중모달 모달리티 전반에 걸친 510개의 유해 행동으로 HarmBench를 선별하고 검증 세트와 테스트 세트로 나눈다.
  • 평가 파이프라인을 표준화한다: 테스트 케이스를 생성하고, 그리디 디코딩으로 모델 결과를 산출하며, 강건한 분류기로 평가한다.
  • 저작권 행위에 대한 해시 기반 분류기와 기타 해에 대한 미세 조정된 비저작권 분류기를 개발하여 ASR을 계산한다.
  • Persistent한 테스트 풀을 사용하여 테스트 케이스를 업데이트하고 모델 거절을 최적화하는 적대적 학습 프레임워크인 Robust Refusal Dynamic Defense (R2D2)를 도입한다.
  • 지속적인 테스트 케이스를 갖춘 GCG 기반 적대자를 활용하여 효율적인 적대적 학습을 가능하게 하고 강건성을 극대화한다.

실험 결과

연구 질문

  • RQ1방법과 모델 간의 공정하고 대규모 비교를 가능하게 하도록 자동 레드팀 평가를 어떻게 표준화할 수 있는가?
  • RQ2모델 크기, 학습 절차 및 방어 전략이 자동 레드팀에 대한 강건성에 어떤 영향을 미치는가?
  • RQ3자동 레드팀(R2D2)과 함께하는 적대적 학습이 일반적 능력을 손상시키지 않으면서 모델 거절을 개선할 수 있는가?
  • RQ4맥락적 및 다중모달 해로운 행동이 표준 텍스트 전용 해악에 비해 ASR 및 방어 효율성에 어떤 영향을 미치는가?
  • RQ5다른 모델 계열에서 강건성이 모델 크기에 독립적이라는 증거가 있는가?

주요 결과

  • 하나의 공격이나 방어책도 모든 모델과 행동에 균일하게 효과적이지 않다.
  • 강건성은 주로 모델 크기에 독립적이지만 모델 계열과 학습 방식에 따라 크게 달라진다.
  • 맥락적 및 다중모달 해로운 행동은 평균적으로 일부 비맥락적 해에 비해 더 높은 ASR를 보이며, 저작권 해악은 더 엄격한 해시 기반 저작권 탐지로 인해 ASR이 더 낮다.
  • R2D2는 실험에서 모델 레벨 방어 중 GCG 공격에 대해 최첨단 강건성을 달성한다.
  • 자동 레드팀과 함께하는 적대적 학습은 다양한 공격에서 ASR를 실질적으로 줄이면서 MT-Bench 일반 지식 성능에는 크게 해를 주지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.