[论文解读] Evolving Diverse Red-team Language Models in Multi-round Multi-agent Games
本文提出了红队游戏(RTG),一种博弈论框架,将多轮红队(RLM)与蓝队(BLM)交互建模为纳什均衡问题。通过游戏化红队求解器(GRTS),该方法利用元博弈分析与虚拟博弈技术,自主演化出多样化的对抗性提示,显著提升了大语言模型的安全性,并在检测隐藏漏洞方面优于启发式方法。
The primary challenge in deploying Large Language Model (LLM) is ensuring its harmlessness. Red team can identify vulnerabilities by attacking LLM to attain safety. However, current efforts heavily rely on single-round prompt designs and unilateral red team optimizations against fixed blue teams. These static approaches lead to significant reductions in generation diversity, known as the mode collapse, which makes it difficult to discover the potential risks in the increasingly complex human-LLM interactions. Here we introduce dynamic Red Team Game (RTG) to comprehensively analyze the multi-round offensive and defensive interactions between red team and blue team. Furthermore, we develop a Gamified Red Team Solver (GRTS) with diversity measures to mitigate mode collapse and theoretically guarantee the convergence of approximate Nash equilibrium which results in better strategies for both teams. Empirical results demonstrate that GRTS explore diverse and implicit attacks to adaptively exploit various LLMs, surpassing the constraints of specific modes. Insightfully, the geometrical structure we unveil of the red team task aligns with the spinning top hypothesis, confirming the necessity of constructing a diverse LLM population as a promising proxy for heterogeneous human expert red-teamers. This paves the way for scalable toxicity detection and safe alignment for LLMs.
研究动机与目标
- 解决现有红队测试方法中缺乏严谨数学建模的问题,这些方法依赖人工标注与启发式提示。
- 通过具备收敛性保证的博弈论框架,实现自动化、多样化且可扩展的大语言模型红队测试。
- 通过在词元与句子层级建模对抗性交互为双层优化问题,提升语言模型的安全性与对齐性。
- 利用元博弈分析与纳什均衡求解,开发可扩展的大型语言模型对齐监督机制。
提出的方法
- 将多轮红队与蓝队交互建模为扩展式对抗团队博弈,收益函数基于微调后的成本模型评估有害性。
- 将句子生成建模为马尔可夫决策过程(MDP),以优化RLM与BLM在词元层级的生成。
- 采用元博弈分析结合虚拟博弈与纳什求解器,在语义空间中探索多样化的攻击策略。
- 使用基于PPO的在线学习方法,配备独立的评论家(Critic-red/blue),并通过LoRA微调实现策略在游戏过程中的自适应。
- 在元博弈中引入多样性感知奖励机制,以降低可利用性并逼近纳什均衡。
- 为奖励模型与成本模型统一使用同一主干网络(Beaver-7B),并在Alpaca、BAD、HH与SafeRLHF-test数据集上进行训练。
实验结果
研究问题
- RQ1具备纳什均衡收敛性的博弈论框架能否为大语言模型安全中的启发式红队测试提供理论基础更扎实的替代方案?
- RQ2在多轮红队测试中,如何系统性地衡量并优化对抗性提示的多样性?
- RQ3通过元博弈分析,自动化红队在多大程度上能发现此前未见的隐藏攻击策略?
- RQ4所提出的框架是否能在不依赖人工标注或预定义有毒提示模板的前提下,提升大语言模型的安全性?
主要发现
- GRTS成功发现了一系列多样化的隐藏攻击策略,可绕过标准安全过滤机制,包括涉及教育与宗教的间接及迂回提示。
- 经过基于GRTS的训练后,BLM能持续拒绝有害请求,即使这些请求以间接方式提出,如涉及甲基苯丙胺制作或投毒攻击。
- 与启发式红队测试方法相比,该框架在安全性表现上实现显著提升,展现出在多种攻击向量下更优的漏洞检测能力。
- 结合虚拟博弈的元博弈分析显著降低了可利用性,并在对抗性游戏中实现向稳定纳什均衡的收敛。
- 在30万条安全样本上微调的成本模型能有效评估有害性,从而在RTG框架中实现可靠的收益计算。
- 实证结果表明,由GRTS驱动的红队测试使大语言模型更具鲁棒性与安全性,即使在复杂多轮对抗探测下,BLM仍能保持对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。