Skip to main content
QUICK REVIEW

[论文解读] All Languages Matter: On the Multilingual Safety of Large Language Models

Wenxuan Wang, Zhaopeng Tu|arXiv (Cornell University)|Oct 2, 2023
Topic Modeling被引用 4
一句话总结

本文提出了 XSafety,这是首个多语言安全基准,用于评估 10 种语言中 14 种安全风险。研究发现,大型语言模型(LLMs)在非英语语言中的不安全回应显著多于英语。为解决此问题,作者提出跨语言提示方法,例如先用英语推理再用源语言回应,使 ChatGPT 在非英语查询中的不安全回应从 19.1% 降低至 9.7%。

ABSTRACT

Safety lies at the core of developing and deploying large language models (LLMs). However, previous safety benchmarks only concern the safety in one language, e.g. the majority language in the pretraining data such as English. In this work, we build the first multilingual safety benchmark for LLMs, XSafety, in response to the global deployment of LLMs in practice. XSafety covers 14 kinds of commonly used safety issues across 10 languages that span several language families. We utilize XSafety to empirically study the multilingual safety for 4 widely-used LLMs, including both close-API and open-source models. Experimental results show that all LLMs produce significantly more unsafe responses for non-English queries than English ones, indicating the necessity of developing safety alignment for non-English languages. In addition, we propose several simple and effective prompting methods to improve the multilingual safety of ChatGPT by evoking safety knowledge and improving cross-lingual generalization of safety alignment. Our prompting method can significantly reduce the ratio of unsafe responses from 19.1% to 9.7% for non-English queries. We release our data at https://github.com/Jarviswang94/Multilingual_safety_benchmark.

研究动机与目标

  • 为解决 LLM 中缺乏多语言安全评估的问题,特别是针对非英语语言。
  • 探究主要基于英语数据训练的安全对齐是否能有效泛化到其他语言。
  • 开发并评估无需微调的提示策略,以提升多语言安全性。
  • 提供一个全面的多语言安全基准,以支持未来跨语言模型安全的研究。

提出的方法

  • 构建了 XSafety,一个包含 28,000 个标注样本的多语言安全基准,涵盖 10 种语言和 14 种安全类别。
  • 使用专业翻译人员将现有单语安全基准翻译成 10 种语言,以确保语言和文化的准确性。
  • 在 XSafety 上评估了四种广泛使用的 LLM —— ChatGPT、PaLM 2、LLaMA2-Chat 和 Vicuna,以评估其多语言安全性能。
  • 提出了三种提示策略:SafePrompt(激发安全知识)、XLingPrompt(在英语中进行跨语言推理)和 XSafePrompt(混合提示)。
  • 使用零样本提示测试这些方法在非英语查询中的有效性,且无需对模型进行微调。
  • 通过自动指标和人工评估对不同提示方法下的模型输出进行安全性分类比较。

实验结果

研究问题

  • RQ1LLMs 的安全性能在不同语言之间如何变化,特别是在英语与非英语语言之间?
  • RQ2以英语为重点的安全对齐在多大程度上能泛化到非英语语言中的 LLM?
  • RQ3提示技术能否在不进行微调的情况下提升 LLM 的多语言安全性?
  • RQ4在提示策略中,激发安全知识还是跨语言推理能更有效地实现跨语言的安全泛化?
  • RQ5哪些语言和结构因素会影响安全对齐在语言间的可迁移性?

主要发现

  • 所有评估的 LLM 在非英语查询中产生的不安全回应显著多于英语查询,不安全回应率从非英语的约 19.1% 上升至英语的约 10%。
  • 最有效的提示方法 XSafePrompt 将非英语查询中的不安全回应从 19.1% 降低至 9.7%,相对减少了 50%。
  • XLingPrompt1(先用英语推理再用源语言回应)在俄语中表现尤为出色,凸显了跨语言泛化的潜力。
  • 提示策略的效果在不同语言间差异显著,翻译难度越高,效果越低,表明语言多样性会影响安全泛化。
  • 结合 SafePrompt 和 XLingPrompt 并未提升性能,表明知识激发与跨语言推理之间可能存在机制冲突。
  • XLingPrompt1 的回应与英语回应高度一致,证实跨语言推理可有效提升从英语到其他语言的安全对齐迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。