[논문 리뷰] Adversarial Training for High-Stakes Reliability
이 논문은 언어 모델에서 해로운 텍스트 완성 항목을 걸러내는 데 있어 고위험 상황에서의 신뢰성을 향상시키기 위해 인간이 개입하는 공격을 통한 적대적 훈련을 제안한다. 도구 지원 인간 공격자를 사용함으로써, 적대적 예제를 생성하는 데 소요되는 시간이 도구 사용 시 13분에서 26분으로, 도구 미사용 시 20분에서 44분으로 각각 두 배로 증가하여 강건성이 향상되었으며, 분포 내 성능 유지는 유지하면서 최소한의 품질 손실로 보수적인 분류기 임계값 설정이 가능해졌다.
In the future, powerful AI systems may be deployed in high-stakes settings, where a single failure could be catastrophic. One technique for improving AI safety in high-stakes settings is adversarial training, which uses an adversary to generate examples to train on in order to achieve better worst-case performance. In this work, we used a safe language generation task (``avoid injuries'') as a testbed for achieving high reliability through adversarial training. We created a series of adversarial training techniques -- including a tool that assists human adversaries -- to find and eliminate failures in a classifier that filters text completions suggested by a generator. In our task, we determined that we can set very conservative classifier thresholds without significantly impacting the quality of the filtered outputs. We found that adversarial training increased robustness to the adversarial attacks that we trained on -- doubling the time for our contractors to find adversarial examples both with our tool (from 13 to 26 minutes) and without (from 20 to 44 minutes) -- without affecting in-distribution performance. We hope to see further work in the high-stakes reliability setting, including more powerful tools for enhancing human adversaries and better ways to measure high levels of reliability, until we can confidently rule out the possibility of catastrophic deployment-time failures of powerful models.
연구 동기 및 목표
- 단 한 번의 실패라도 용납되지 않는 고위험 AI 구현에서 치명적인 실패 문제를 해결하기 위해.
- 언어 모델의 최악의 경우 신뢰성을 향상시키기 위한 적대적 훈련의 방법성을 평가하기 위해.
- 적대적 예제를 더 효과적으로 발견할 수 있도록 도구 지원 인간 공격자를 개발하고 테스트하기 위해.
- 보수적인 분류기 임계값이 평균적인 출력 품질에 거의 영향을 주지 않으면서도 높은 최악의 경우 신뢰성을 유지할 수 있는지 조사하기 위해.
- 실제 AI 시스템에서 고위험 신뢰성을 측정하고 향상시키는 데 실용적인 기법을 탐색하기 위해.
제안 방법
- 스토리 이어쓰기 작업에서 해로운 텍스트 완성 항목을 탐지하기 위해 분류기를 훈련시었다.
- 적대적 예제는 세 가지 방법으로 생성되었다: 보완되지 않은 인간 공격, 이전 적대적 예제의 어색한 표현 변경, 도구 지원 인간 재작성.
- 반복 루프를 통해 세 공격 유형의 적대적 예제를 기반으로 분류기를 재훈련하여 강건성을 향상시켰다.
- 더 효과적인 적대적 예제를 생성하기 위해 인간 공격자가 프롬프트와 완성 항목을 재작성할 수 있도록 지원하는 신규 도구를 개발했다.
- 최악의 경우 안전성을 우선시하기 위해 분류기 임계값을 보수적으로 설정하였으며, 분포 내 데이터에서 성능을 모니터링했다.
- 강건성은 계약자들이 훈련 전후로 적대적 예제를 생성하는 데 소요된 시간을 측정하여 평가했다.
실험 결과
연구 질문
- RQ1인간이 개입하는 공격을 통한 적대적 훈련이 해로운 텍스트 완성 항목에 대한 분류기의 강건성을 상당히 향상시킬 수 있는가?
- RQ2비적대적 출력 품질에 영향을 주지 않으면서 보수적인 분류기 임계값을 얼마나 적용할 수 있는가?
- RQ3도구 지원 인간 공격자가 무보조 인간 공격자에 비해 더 다양한 및 더 효과적인 적대적 예제를 얼마나 효과적으로 생성하는가?
- RQ4적대적 훈련이 분포 내 성능을 저하시키지 않으면서도 최악의 경우 신뢰성을 향상시킬 수 있는가?
- RQ5적대적 훈련이 잔류하는 실패의 심각도와 성격에 어떤 영향을 미치는가?
주요 결과
- 도구 지원 공격 방법을 사용할 경우, 적대적 예제 생성 시간이 13분에서 26분으로 두 배로 증가하여 강건성이 향상되었다.
- 도구 미사용 시에도 적대적 예제 생성 시간이 20분에서 44분으로 두 배로 증가하여 일반적인 강건성이 향상됨을 시사했다.
- 적대적 훈련 이후 분포 내 성능은 변화하지 않았으며, 표준 예제에서의 성능 저하가 없음을 나타냈다.
- 적대적 훈련을 거친 모델의 잔류 실패는 더 덜 심각했으며, 상처에 직접적인 언급이 포함될 가능성이 낮았다.
- 보수적인 분류기 임계값을 적용해도 생성기 출력 품질에 크게 영향을 주지 않아 최악의 경우 신뢰성을 높일 수 있었다.
- 도구 지원 인간 공격 방법은 적대적 예제의 다양성과 난이도를 높여 훈련 과정을 더욱 효과적으로 만들었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.