Skip to main content
QUICK REVIEW

[논문 리뷰] Mass-Producing Failures of Multimodal Systems with Language Models

Shengbang Tong, Erik Jones|arXiv (Cornell University)|2023. 06. 21.
Software Engineering Research인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델을 사용하여 멀티모odal AI 시스템에서의 체계적인 실패를 자동으로 탐지하는 MultiMon 시스템을 소개한다. 이는 CLIP 임베딩에서 오류 있는 일치를 식별함으로써 실패를 발견한다. 이 시스템은 양자화어나 否정을 忽시하는 것과 같은 자연어 실패 패턴 14가지를 발견하였으며, 이는 DALL-E, Midjourney 5.1, Stable Diffusion 등의 최신 모델들 사이에서 전이 가능하며, 생성된 테스트 쌍의 80%에서 오류를 유발한다.

ABSTRACT

Deployed multimodal systems can fail in ways that evaluators did not anticipate. In order to find these failures before deployment, we introduce MultiMon, a system that automatically identifies systematic failures -- generalizable, natural-language descriptions of patterns of model failures. To uncover systematic failures, MultiMon scrapes a corpus for examples of erroneous agreement: inputs that produce the same output, but should not. It then prompts a language model (e.g., GPT-4) to find systematic patterns of failure and describe them in natural language. We use MultiMon to find 14 systematic failures (e.g., "ignores quantifiers") of the CLIP text-encoder, each comprising hundreds of distinct inputs (e.g., "a shelf with a few/many books"). Because CLIP is the backbone for most state-of-the-art multimodal systems, these inputs produce failures in Midjourney 5.1, DALL-E, VideoFusion, and others. MultiMon can also steer towards failures relevant to specific use cases, such as self-driving cars. We see MultiMon as a step towards evaluation that autonomously explores the long tail of potential system failures. Code for MULTIMON is available at https://github.com/tsb0601/MultiMon.

연구 동기 및 목표

  • 배포 이전에 뜻하지 않은 체계적 실패를 식별함으로써 멀티모달 시스템 평가의 격차를 해소하기 위해.
  • 수동 레이블링이나 실패 유형에 대한 사전 가정에 의존하지 않는 자율적이고 확장 가능한 평가 방법을 개발하기 위해.
  • 시스템 설계자에게 유용하고 특정 용도에 맞게 조정 가능한 인간 친화적이고 자연어 기반의 실패 패턴 기술을 생성하기 위해.
  • 텍스트-이미지, 텍스트-비디오, 텍스트-3D 시스템을 포함한 다양한 멀티모달 모델 간 실패의 전이 가능성을 보장하기 위해.
  • 이러한 실패들이 상용 안전 필터를 회피하는 데 얼마나 효과적인지 평가하여 실제 세계의 위험을 드러내기 위해.

제안 방법

  • MultiMon은 '오류 있는 일치'를 통해 개별 실패를 식별한다. 즉, 의미가 다른 입력이 동일한 CLIP 임베딩을 가지며, 이는 모델의 비일치를 시사한다.
  • 비용이 많이 들지 않는 생성 단계를 피하기 위해, 대규모 코퍼스에서 이러한 실패 쌍을 효율적으로 스캔하기 위해 CLIP 유사도를 경량 프록시로 사용한다.
  • 대규모 언어 모델(예: GPT-4)을 사용하여 스크래핑한 실패 쌍을 분석하고 일반화 가능한 자연어 기반의 실패 패턴 기술을 생성한다.
  • 하류 응용 프로그램에 관련된 특정 속성(예: '자율주행 차량에 중요한')에 초점을 맞추기 위해 LLM을 조정할 수 있다.
  • 생성된 실패 인스턴스는 CLIP 유사도를 통해 검증되며, 하류 멀티모달 모델에서 오류율을 측정하기 위해 테스트된다.
  • 파이프라인은 수동 평가 및 안전 필터 회피 테스트를 통해 평가되어 전이 가능성과 실제 영향을 입증한다.
Figure 1 : Examples failures that MultiMon generates on state-of-the-art text-to-image systems.
Figure 1 : Examples failures that MultiMon generates on state-of-the-art text-to-image systems.

실험 결과

연구 질문

  • RQ1사전에 실패 유형에 대한 가정 없이, 체계적인 실패 패턴을 자동으로 식별할 수 있는가?
  • RQ2언어 모델이 원시 실패 쌍에서 고품질의 자연어 기반 실패 패턴 기술을 생성하는 데 얼마나 효과적인가?
  • RQ3발견된 실패 패턴이 DALL-E, Midjourney, Stable Diffusion와 같은 다양한 멀티모달 모델 간에 얼마나 일반화되는가?
  • RQ4시스템이 상용 안전 필터를 회피할 수 있는 실패를 생성할 수 있으며, 이는 모델의 강건성에 대해 어떤 함의를 갖는가?
  • RQ5이 실패 패턴은 다양한 모odal(이미지, 비디오, 3D)과 용도에 대해 얼마나 확장 가능하고 전이 가능한가?

주요 결과

  • MultiMon은 CLIP 텍스트 인코더에서 양자화어 忽시, 否정, 공간적 관계, 수치적 차이 등을 포함한 14개의 체계적 실패 패턴을 발견하였다.
  • 14개의 체계적 실패 중 12개는 최소 50%의 확률로 CLIP 유사 쌍을 생성하며, 7개는 최소 75%의 확률로 생성하여 높은 수준의 일반화를 보였다.
  • 시스템은 1,000개 이상의 새로운 개별 실패 인스턴스를 생성하였으며, 이는 다섯 개의 주요 텍스트-이미지 모델에서 테스트 케이스의 80%에서 오류를 유발하였다.
  • 반면 기준 시스템은 동일한 입력에서 오직 20%의 오류율을 기록하여, MultiMon의 실패 탐지 효과를 입증하였다.
  • MultiMon은 Midjourney 5.1의 안전 필터를 회피할 수 있는 입력을 성공적으로 생성하였으며, 특히 부정 및 공간적 관계 실패에서 두드러졌다.
  • 실패 패턴은 텍스트-비디오(VideoFusion) 및 텍스트-3D(Shap-From) 모델로도 전이되었으며, 광범위한 적용 가능성을 확인하였다.
Figure 2 : The MultiMon pipeline. Left. MultiMon starts with a corpus of sentences (dots), then identifies individual failures : pairs that have similar CLIP embeddings but should not (circled red dots). Center. MultiMon takes the individual failures, then categorizes them into systematic failures u
Figure 2 : The MultiMon pipeline. Left. MultiMon starts with a corpus of sentences (dots), then identifies individual failures : pairs that have similar CLIP embeddings but should not (circled red dots). Center. MultiMon takes the individual failures, then categorizes them into systematic failures u

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.