Skip to main content
QUICK REVIEW

[논문 리뷰] All Languages Matter: On the Multilingual Safety of Large Language Models

Wenxuan Wang, Zhaopeng Tu|arXiv (Cornell University)|2023. 10. 02.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 10개 언어와 14개 안전 위험 요소를 대상으로 평가하는 다국어 안전 기준 XSafety를 소개하며, 대규모 언어 모델(Large Language Models, LLMs)이 영어 이외의 언어에서 영어에 비해 훨씬 더 많은 부적절한 응답을 생성한다는 점을 입증한다. 이를 해결하기 위해 저자들은 모델이 원본 언어로 응답하기 전에 영어로 추론하도록 지시하는 등 다국어 프롬프팅 기법을 제안하였으며, 이는 ChatGPT의 비영어 질의에서의 부적절한 응답 비율을 19.1%에서 9.7%로 감소시켰다.

ABSTRACT

Safety lies at the core of developing and deploying large language models (LLMs). However, previous safety benchmarks only concern the safety in one language, e.g. the majority language in the pretraining data such as English. In this work, we build the first multilingual safety benchmark for LLMs, XSafety, in response to the global deployment of LLMs in practice. XSafety covers 14 kinds of commonly used safety issues across 10 languages that span several language families. We utilize XSafety to empirically study the multilingual safety for 4 widely-used LLMs, including both close-API and open-source models. Experimental results show that all LLMs produce significantly more unsafe responses for non-English queries than English ones, indicating the necessity of developing safety alignment for non-English languages. In addition, we propose several simple and effective prompting methods to improve the multilingual safety of ChatGPT by evoking safety knowledge and improving cross-lingual generalization of safety alignment. Our prompting method can significantly reduce the ratio of unsafe responses from 19.1% to 9.7% for non-English queries. We release our data at https://github.com/Jarviswang94/Multilingual_safety_benchmark.

연구 동기 및 목표

  • LLM에서의 다국어 안전 평가 부족, 특히 비영어 언어에 대한 평가 부족을 해결하기 위해.
  • 영어 데이터로 주로 안전성 정렬을 학습한 모델이 다른 언어로도 효과적으로 일반화되는지 조사하기 위해.
  • 피팅 조정 없이도 다국어 안전성을 향상시키는 프롬프팅 전략을 개발하고 평가하기 위해.
  • 향후 다국어 모델 안전성 연구를 지원하기 위한 종합적인 다국어 안전 기준을 제공하기 위해.

제안 방법

  • 10개 언어와 14개 안전 범주를 포함하는 총 28,000개의 주석이 부여된 다국어 안전 기준 XSafety를 구축하였다.
  • 전문 번역가를 통해 기존의 단일 언어 안전 기준을 10개 언어로 번역하여 언어적 및 문화적 정확성을 확보하였다.
  • XSafety에서 다국어 안전 성능을 평가하기 위해 널리 사용되는 4개의 LLM—ChatGPT, PaLM 2, LLaMA2-Chat, Vicuna—을 평가하였다.
  • 세 가지 프롬프팅 전략을 제안: SafePrompt(안전 지식 유도), XLingPrompt(영어로 다국어 추론), XSafePrompt(하이브리드 프롬프팅).
  • 모델의 피팅 조정 없이도 비영어 질의에 대해 이러한 방법의 효과를 테스트하기 위해 제로샷 프롬프팅을 사용하였다.
  • 자동 평가 지표와 인간 평가를 병행하여 프롬프팅 방법 간의 안전 분류 성능을 비교하였다.

실험 결과

연구 질문

  • RQ1LLM의 안전성 성능은 영어와 비영어 언어 간에 어떻게 다를까? 특히 영어와 비영어 언어 간의 성능 격차는 어떻게 되는가?
  • RQ2영어 중심의 안전성 정렬 전략이 비영어 언어로의 일반화에 얼마나 효과적으로 적용되는가?
  • RQ3피팅 조정 없이도 프롬프팅 기법이 LLM의 다국어 안전성을 향상시킬 수 있는가?
  • RQ4안전 지식 유도와 다국어 추론 중 어느 프롬프팅 전략이 다국어 간 안전성 일반화에 더 효과적인가?
  • RQ5언어적 및 구조적 요소 중 안전성 정렬의 이식성에 영향을 미치는 요소는 무엇인가?

주요 결과

  • 모든 평가된 LLM이 비영어 질의에서 영어 질의보다 훨씬 더 많은 부적절한 응답을 생성하며, 비영어 언어에서의 부적절한 응답 비율은 약 19.1%에서 영어에서는 약 10%로 감소한다.
  • 가장 효과적인 프롬프팅 전략인 XSafePrompt는 비영어 질의에서의 부적절한 응답 비율을 19.1%에서 9.7%로 감소시켜 상대적 50% 감소를 이뤘다.
  • 영어로 추론을 유도한 후 원본 언어로 응답하도록 지시하는 XLingPrompt1은 러시아어에서 특히 효과적이었으며, 다국어 일반화 잠재력이 높다는 점을 시사한다.
  • 프롬프팅 전략의 성능은 언어 간에 상당한 차이를 보였으며, 번역 난이도가 높을수록 성능이 낮아져 언어 다양성이 안전성 일반화에 영향을 준다는 점을 시사한다.
  • SafePrompt와 XLingPrompt를 병합해도 성능 향상이 없었으며, 이는 지식 유도와 다국어 추론 간의 메커니즘이 상충될 수 있음을 시사한다.
  • XLingPrompt1의 응답은 영어 응답과 매우 유사했으며, 이는 다국어 추론이 영어에서 유래한 안전성 정렬의 이식성을 향상시킨다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.