Skip to main content
QUICK REVIEW

[논문 리뷰] NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails

Traian Rebedea, Razvan Dinu|arXiv (Cornell University)|2023. 10. 16.
Natural Language Processing Techniques인용 수 7
한 줄 요약

NeMo Guardrails는 도메인 특화 언어(Colang)를 사용하여 사용자가 정의한 해석 가능한 가드레일을 LLM 애플리케이션에 구현할 수 있도록 해주는 오픈소스 런타임 툴킷입니다. 이는 추론 시점에 규칙을 적용하여 안전성과 제어 가능성을 향상시키며, 유해 콘텐츠 차단, 환각 탐지, 사실성 유지 등의 기능을 수행합니다. text-davinci-003를 사용할 경우 최대 99%의 유해 입력 차단과 70%의 답변 불가 질문 탐지 성능을 기록합니다.

ABSTRACT

NeMo Guardrails is an open-source toolkit for easily adding programmable guardrails to LLM-based conversational systems. Guardrails (or rails for short) are a specific way of controlling the output of an LLM, such as not talking about topics considered harmful, following a predefined dialogue path, using a particular language style, and more. There are several mechanisms that allow LLM providers and developers to add guardrails that are embedded into a specific model at training, e.g. using model alignment. Differently, using a runtime inspired from dialogue management, NeMo Guardrails allows developers to add programmable rails to LLM applications - these are user-defined, independent of the underlying LLM, and interpretable. Our initial results show that the proposed approach can be used with several LLM providers to develop controllable and safe LLM applications using programmable rails.

연구 동기 및 목표

  • LLM 애플리케이션에서 런타임, 사용자 설정이 가능한 안전성 및 제어 메커니즘이 부족한 문제를 해결하기 위해.
  • 모델 정렬에 의존하지 않으며 다양한 LLM 제공업체와 호환되는 솔루션을 제공하기 위해.
  • 개발자가 인간이 읽을 수 있는 모델링 언어를 사용하여 추론 시점에 맞춤형 행동 제약 조건을 정의하고 적용할 수 있도록 하기 위해.
  • 환각, 프롬프트 인젝션, 유해 출력 등의 위험을 완화함으로써 생산 환경의 LLM 시스템에 대한 신뢰성을 향상시키기 위해.
  • 런타임 시점에서 LLM 행동을 제어하기 위한 해석 가능하고 모듈화되며 확장 가능한 프레임워크를 제공하기 위해.

제안 방법

  • 사용자와 LLM 사이의 대화를 관리하는 런타임 프oxy 엔진을 사용하여 사용자가 정의한 가드레일을 적용합니다.
  • Colang라는 도메인 특화 언어를 사용하여 조건과 동작을 포함한 구조화된 대화 흐름으로 가드레일 규칙를 표현합니다.
  • 문맥 내 학습과 사고 체인 프롬프팅을 적용하여 정의된 가드레일에 기반해 LLM이 준수 가능한 응답을 생성하도록 이끕니다.
  • 다양한 레일 유형을 구현합니다: 입력 모니터링(탈출 탐지), 출력 모니터링(유해 응답 필터링), 사실 확인, 환각 탐지.
  • 모델 미세조정이나 재학습 없이도 다양한 LLM 제공업체(예: text-davinci-003, gpt-3.5-turbo)와 통합됩니다.
  • 성능 평가를 위해 Anthropic Red-Teaming, Helpful, MSMARCO 등의 평가 데이터셋을 사용하여 레일 성능을 정량적으로 검증합니다.

실험 결과

연구 질문

  • RQ1추론 시점에 프로그래머블이고 사용자가 정의한 가드레일이 LLM 기반 대화 시스템의 안전성과 제어 가능성에 효과적으로 기여할 수 있는가?
  • RQ2런타임 시점에서 가드레일을 적용하는 방식이, 모델 정렬이나 프롬프트 엔지니어링 대비 유해 출력과 환각을 차단하는 데 어떻게 비교되는가?
  • RQ3다양한 LLM에서 모니터링 및 사실 확인 작업의 거짓 경고(false positive)와 거짓 부정(false negative)를 런타임 레일이 얼마나 줄일 수 있는가?
  • RQ4모듈화되고 언어 기반의 레일 사양(Colang)이 LLM 행동에 대한 해석 가능하고 유지보수 용이한 제어를 가능하게 하는가?
  • RQ5입력 및 출력 모니터링 레일을 병행 적용할 경우 단일 레일 대비 프롬프트 인젝션 공격을 얼마나 효과적으로 완화할 수 있는가?

주요 결과

  • 입력 및 출력 모니터링 레일을 모두 사용할 경우, text-davinci-003에서는 97%의 유해 차단률, gpt-3.5-turbo에서는 99%의 유해 차단률을 기록했으며, 각각 5%와 2%의 거짓 긍정률을 보였습니다.
  • 사실 확인 레일은 MSMARCO 데이터셋에서 80%의 정확도를 달성했으며, gpt-3.5-turbo가 text-davinci-003보다 부정(근거 없는) 응답을 탐지하는 데 더 뛰어났습니다.
  • 환각 레일은 text-davinci-003에서 답변 불가 프롬프트의 70%를 차단했으며, gpt-3.5-turbo와 같은 강력한 모델에서도 환각 응답 탐지율을 25% 향상시켰습니다.
  • 입력 모니터링 레일만으로도 text-davinci-003에서 87%의 유해 프롬프트를 차단했고, 유용한 프롬프트의 3%는 잘못 차단했으며, 이는 기준 모델 대비 뚜렷한 향상입니다.
  • 이 툴킷은 강력한 모델 간 호환성을 보였으며, 모델 재학습 없이도 OpenAI 및 기타 LLM 제공업체와 모두 효과적으로 작동했습니다.
  • Colang 기반 사양은 복잡한 가드레일 논리를 명확하고 해석 가능하며 유지보수 용이하게 정의할 수 있었으며, 행동의 모듈식 확장을 지원했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.