Skip to main content
QUICK REVIEW

[论文解读] NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails

Traian Rebedea, Razvan Dinu|arXiv (Cornell University)|Oct 16, 2023
Natural Language Processing Techniques被引用 7
一句话总结

NeMo Guardrails 是一个开源的运行时工具包,允许开发人员使用领域特定语言(Colang)实现用户定义的、可解释的护栏机制,以增强大语言模型(LLM)应用的安全性和可控性。该工具通过在推理时强制执行规则(如阻止有害内容、检测幻觉并确保事实一致性)来实现这一目标,对有害输入的阻断率最高可达 99%,对无法回答问题的拦截率可达 70%,适用于 text-davinci-003 模型。

ABSTRACT

NeMo Guardrails is an open-source toolkit for easily adding programmable guardrails to LLM-based conversational systems. Guardrails (or rails for short) are a specific way of controlling the output of an LLM, such as not talking about topics considered harmful, following a predefined dialogue path, using a particular language style, and more. There are several mechanisms that allow LLM providers and developers to add guardrails that are embedded into a specific model at training, e.g. using model alignment. Differently, using a runtime inspired from dialogue management, NeMo Guardrails allows developers to add programmable rails to LLM applications - these are user-defined, independent of the underlying LLM, and interpretable. Our initial results show that the proposed approach can be used with several LLM providers to develop controllable and safe LLM applications using programmable rails.

研究动机与目标

  • 解决大语言模型应用中缺乏运行时、用户可配置的安全与控制机制的问题。
  • 提供一种与模型对齐无关、可跨多个大语言模型提供商使用的解决方案。
  • 使开发人员能够使用人类可读的建模语言,在推理时定义并强制执行自定义的行为约束。
  • 通过减轻幻觉、提示注入和有害输出等风险,提升生产环境中大语言模型系统的可信度。
  • 提供一种可解释、模块化且可扩展的框架,用于对话系统中大语言模型行为的运行时控制。

提出的方法

  • 使用运行时代理引擎作为用户与大语言模型之间的对话管理器,强制执行用户定义的护栏规则。
  • 采用 Colang(一种领域特定语言)将护栏规则表达为带有条件和动作的结构化对话流程。
  • 应用上下文学习和思维链提示技术,引导大语言模型基于已定义的护栏生成合规响应。
  • 实现多种护栏类型:输入审核(如逃逸检测)、输出审核(有害响应过滤)、事实核查和幻觉检测。
  • 与多种大语言模型提供商(如 text-davinci-003、gpt-3.5-turbo)集成,无需模型微调或重新训练。
  • 使用 Anthropic 红队测试、Helpful 和 MSMARCO 等评估数据集,对护栏性能进行定量验证。

实验结果

研究问题

  • RQ1在推理时使用可编程、用户定义的护栏是否能有效提升基于大语言模型的对话系统安全性与可控性?
  • RQ2与模型对齐或提示工程相比,运行时护栏的强制执行在阻止有害输出和幻觉方面表现如何?
  • RQ3在不同大语言模型上,运行时护栏在审核和事实核查任务中能将误报和漏报减少到何种程度?
  • RQ4基于模块化、语言驱动的护栏规范(Colang)是否能实现对大语言模型行为的可解释且可维护的控制?
  • RQ5与单一护栏方法相比,组合使用输入和输出审核护栏在缓解提示注入攻击方面效果如何?

主要发现

  • 同时使用输入和输出审核护栏后,text-davinci-003 的有害内容阻断率达到 97%,gpt-3.5-turbo 达到 99%,误报率分别为 5% 和 2%。
  • 事实核查护栏在 MSMARCO 数据集上达到 80% 的准确率,其中 gpt-3.5-turbo 在检测否定(无依据)答案方面优于 text-davinci-003。
  • 幻觉检测护栏在 text-davinci-003 上拦截了 70% 的无法回答提示,即使在 gpt-3.5-turbo 这类强模型中,也使幻觉响应的检测率提升了 25%。
  • 仅使用输入审核护栏时,text-davinci-003 成功阻断了 87% 的有害提示,同时仅误伤了 3% 的有益提示,相比基线模型有显著提升。
  • 该工具包在不同模型间表现出强大的兼容性,无需重新训练即可有效支持 OpenAI 及其他大语言模型提供商。
  • 基于 Colang 的规范使得复杂护栏逻辑的定义更加清晰、可解释且易于维护,支持行为的模块化扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。