Skip to main content
QUICK REVIEW

[论文解读] Learning from data in the mixed adversarial non-adversarial case: Finding the helpers and ignoring the trolls

Da Young Ju, Jing Xu|arXiv (Cornell University)|Aug 5, 2022
Adversarial Robustness in Machine Learning被引用 9
一句话总结

本文提出用户级鲁棒学习方法,以在混合对抗性与非对抗性设置下提升基于人类反馈的模型训练效果,其中攻击者(trolls)会提供有毒或误导性输入。通过聚合用户行为识别重复攻击者,基于用户的方法(如 Soft PURR)在新基准(SafetyMix)和真实部署数据上均优于基于样本的方法,展现出更优的鲁棒性与攻击者检测能力。

ABSTRACT

The promise of interaction between intelligent conversational agents and humans is that models can learn from such feedback in order to improve. Unfortunately, such exchanges in the wild will not always involve human utterances that are benign or of high quality, and will include a mixture of engaged (helpers) and unengaged or even malicious users (trolls). In this work we study how to perform robust learning in such an environment. We introduce a benchmark evaluation, SafetyMix, which can evaluate methods that learn safe vs. toxic language in a variety of adversarial settings to test their robustness. We propose and analyze several mitigating learning algorithms that identify trolls either at the example or at the user level. Our main finding is that user-based methods, that take into account that troll users will exhibit adversarial behavior across multiple examples, work best in a variety of settings on our benchmark. We then test these methods in a further real-life setting of conversations collected during deployment, with similar results.

研究动机与目标

  • 解决对话式人工智能中基于真实世界人类反馈的训练挑战,其中高质量协助者与恶意或低质量的攻击者共存。
  • 识别并缓解在持续学习过程中系统性降低模型性能的对抗性用户行为的影响。
  • 构建一个基准 SafetyMix,以系统性评估在多种对抗性用户模式(如主控攻击者、安全/非安全标注者、洗脑攻击者)下的鲁棒学习方法。
  • 评估用户级信任建模(即综合考虑多个交互行为)是否相比样本级方法能提升鲁棒性。
  • 通过 BlenderBot 3 的真实部署数据验证研究发现,确保其在真实场景中的实用性,而不仅限于合成基准。

提出的方法

  • 提出 SafetyMix,一个使用真实输入数据但人工注入对抗性噪声模式的合成基准,以模拟多样化的攻击者行为(如主控攻击者、洗脑攻击者)。
  • 设计三种基于用户的检测方法:基于用户的移除、基于用户与样本的联合移除,以及软性基于用户的鲁棒移除(Soft PURR),后者联合评估用户在多个样本上的行为。
  • 实现并对比这些基于用户的学方法与标准的基于样本的鲁棒学习技术(如样本级移除和鲁棒损失函数)。
  • 应用 Soft PURR,一种可微分的软阈值方法,基于聚合的样本级预测结果为每个用户分配信任分数,支持端到端训练。
  • 利用 BlenderBot 3 部署中的真实世界对话数据,验证基于用户的学方法在接近生产环境条件下的性能表现。
  • 通过众包工作者开展人工评估,验证模型性能与攻击者检测准确率在真实场景中的表现。

实验结果

研究问题

  • RQ1在混合人类反馈设置中,基于用户的学方法与基于样本的方法相比,在检测和缓解对抗性反馈方面表现如何?
  • RQ2哪些类型的攻击者行为(如洗脑、持续毒性)最难以被现有鲁棒学习方法检测?
  • RQ3用户级信任模型在合成数据与真实世界数据上,能在多大程度上提升模型鲁棒性与学习效率?
  • RQ4基于用户的学方法能否泛化到真实部署环境,如大规模对话式智能体系统?
  • RQ5当面对如洗脑攻击者等复杂对抗性模式时,当前鲁棒学习算法的失效模式是什么?

主要发现

  • 基于用户的学方法,特别是 Soft PURR,在 SafetyMix 基准的所有测试设置中均持续优于基于样本的方法。
  • 随着对抗性噪声水平的提高,尤其是面对如洗脑攻击者等复杂攻击者类型时,基于用户与基于样本的方法之间的性能差距进一步扩大。
  • 在 BlenderBot 3 的真实部署数据上,基于用户的学方法表现出更高的攻击者检测准确率,经众包工作者评估验证。
  • Soft PURR 通过联合利用用户行为,实现了卓越的鲁棒性,其性能接近理想化的基于用户的移除方法。
  • 基于样本的方法未能检测出在多个交互中持续表现出毒性行为的攻击者,凸显了用户级建模的必要性。
  • 基准 SafetyMix 有效暴露了现有方法的局限性,特别是在洗脑攻击与标签翻转攻击模式下,表明未来仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。