Skip to main content
QUICK REVIEW

[논문 리뷰] Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks

Zonghao Ying, Aishan Liu|arXiv (Cornell University)|2024. 06. 10.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 연구는 텍스트, 시각, 청각 모odalities를 아우르는 다중모달 해킹 공격을 통해 GPT-4o의 안전성에 대한 최초의 종합적인 실증 평가를 제시한다. GPT-4V 대비 텍스트 기반 해킹 공격에 대해 개선된 저항성을 보이지만, 청각 모달리티의 도입으로 새로운 공격 벡터가 발생하며, 기존의 블랙박스 다중모달 해킹 공격 방법은 GPT-4o에 대해 대부분 효과가 없음을 확인한다. 이는 다중모달 수준에서의 위험 증가와도 연결된다.

ABSTRACT

The recent release of GPT-4o has garnered widespread attention due to its powerful general capabilities. While its impressive performance is widely acknowledged, its safety aspects have not been sufficiently explored. Given the potential societal impact of risky content generated by advanced generative AI such as GPT-4o, it is crucial to rigorously evaluate its safety. In response to this question, this paper for the first time conducts a rigorous evaluation of GPT-4o against jailbreak attacks. Specifically, this paper adopts a series of multi-modal and uni-modal jailbreak attacks on 4 commonly used benchmarks encompassing three modalities (ie, text, speech, and image), which involves the optimization of over 4,000 initial text queries and the analysis and statistical evaluation of nearly 8,000+ response on GPT-4o. Our extensive experiments reveal several novel observations: (1) In contrast to the previous version (such as GPT-4V), GPT-4o has enhanced safety in the context of text modality jailbreak; (2) The newly introduced audio modality opens up new attack vectors for jailbreak attacks on GPT-4o; (3) Existing black-box multimodal jailbreak attack methods are largely ineffective against GPT-4o and GPT-4V. These findings provide critical insights into the safety implications of GPT-4o and underscore the need for robust alignment guardrails in large models. Our code is available at \url{https://github.com/NY1024/Jailbreak_GPT4o}.

연구 동기 및 목표

  • GPT-4o, 새로운 세대의 다중모달 대규모 언어 모델에 대해 해킹 공격에 대한 안전성을 철저히 평가하기 위해.
  • 텍스트, 이미지, 청각 모달리티에서 GPT-4o에 대한 단일모달 및 다중모달 해킹 공격 방법의 효과성을 조사하기 위해.
  • GPT-4V와 같은 이전 모델들과 비교해 GPT-4o의 해킹 프롬프트 이행성과 정렬 가드레일의 강건성을 평가하기 위해.
  • GPT-4o의 다중모달 기능이 새로운 공격 표면을 어떻게 도입하는지, 특히 청각 모달리티에서의 영향을 규명하기 위해.
  • 향후 다중모달 LLM의 정렬 가드레일을 향상시키기 위한 실질적인 통찰을 제공하기 위해.

제안 방법

  • 연구는 4,000개 이상 최적화된 초기 텍스트 쿼리를 사용해 자동화된 해킹 공격을 수행하며, 2,000개의 단일모달 텍스트 쿼리와 2,180개의 다중모달 쿼리를 네 가지 벤치마크 데이터셋에 적용한다.
  • OpenAI API를 통해 GPT-4o에 대해 7개의 최신 해킹 공격 방법(템플릿 기반: GCG, AutoDAN, PAP, 다중모달 방법: FigStep, Liu et al., BAP)을 평가한다.
  • 청각 모달리티의 경우, GPT-4o 모바일 앱을 활용해 수동으로 해킹 공격을 수행하며, 기존의 텍스트 기반 공격 프롬프트를 음성 형태로 변환한다.
  • 안전성 평가에는 13개의 공격 시나리오와 3개의 모달리티에서 작동하는 네 가지 판단 함수(J1–J4)를 사용하며, SafeBench 및 MM-SafetyBench와 같은 벤치마크에서 해킹 성공률(ASR)을 측정한다.
  • 거의 8,000개의 모델 응답에 대해 통계적 평가를 수행해 연구 결과의 강건성과 신뢰성을 확보한다.
  • GPT-4V와의 성능 비교를 통해 각 모달리티에서의 안전성 향상 및 후퇴 여부를 분석한다.
(a) Results of $\mathcal{J}_{1}$ .
(a) Results of $\mathcal{J}_{1}$ .

실험 결과

연구 질문

  • RQ1GPT-4o의 해킹 공격에 대한 안전성은 텍스트 모달리티에서 GPT-4V와 비교해 어떻게 다를까?
  • RQ2GPT-4o의 청각 모달리티는 어떤 새로운 공격 표면을 도입하며, 청각 기반 해킹 공격의 효과성은 어떠한가?
  • RQ3기존의 블랙박스 다중모달 해킹 공격 방법은 GPT-4o와 GPT-4V에 대해 어느 정도 효과가 있는가?
  • RQ4텍스트 기반 해킹 프롬프트의 이행성은 GPT-4o와 같은 다중모달 모델에 어떻게 영향을 미치는가?
  • RQ5왜 일부 공격 방법은 GPT-4o에서 공격 조건 하에서 기준 조건보다 낮은 성공률을 보이는가?

주요 결과

  • GPT-4o는 대부분의 텍스트 모달 시나리오에서 GPT-4V 대비 텍스트 기반 해킹 공격에 대해 향상된 안전성을 보이며, 해킹 성공률이 낮게 나타난다.
  • 청각 모달리티는 새로운 효과적인 공격 표면을 도입하며, 청각으로 변환된 공격적 프롬프트가 GPT-4o를 성공적으로 해킹하는 데 기여한다.
  • 기존의 블랙박스 다중모달 해킹 공격 방법은 GPT-4o와 GPT-4V에 대해 대부분 효과가 없으며, 이는 공격 조건에서의 ASR가 기준 조건보다 낮다는 점에서 확인된다.
  • GPT-4o는 다중모달 수준에서 GPT-4V보다 덜 안전하며, 대부분의 시나리오에서 MM-SafetyBench에서 더 높은 해킹 성공률을 보이며, 특히 정치 로비 72.8%와 법적 의견 98.1%에서 높은 비율을 기록한다.
  • 템플릿 기반 해킹 공격 방법은 효과가 감소하며, 이는 OpenAI가 알려진 해킹 패tern을 사전에 차단했음을 시사한다.
  • 공격 조건에서의 성공률이 기준 조건보다 낮은 이례적인 패턴은, OpenAI가 이미지 기반 의미 공격에 대비한 방어 조치를 구현했을 가능성을 시사한다.
(b) Results of $\mathcal{J}_{2}$ .
(b) Results of $\mathcal{J}_{2}$ .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.