[논문 리뷰] Robustness Analysis of Video-Language Models Against Visual and Language Perturbations
이 논문은 텍스트-비디오 검색에서 실제 세계의 시각적 및 언어적 교란에 대해 비디오-언어 모델의 강건성에 대한 최초의 종합적 분석을 제시한다. MSRVTT-P와 YouCook2-P라는 두 개의 대규모 벤치마크를 사용하여 90종의 시각적 교란과 35종의 텍스트 교란을 적용한 연구에서, 모델은 비디오 모odal의 교란에 더 취약하며, 사전 훈련을 통해 크게 이점을 얻고, 운동보다는 물체와 환경에 더 집중하며, 목표 데이터셋으로의 미세조정을 통해 성별 편향이 발생하거나 악화됨을 밝혀냈다.
Joint visual and language modeling on large-scale datasets has recently shown good progress in multi-modal tasks when compared to single modal learning. However, robustness of these approaches against real-world perturbations has not been studied. In this work, we perform the first extensive robustness study of video-language models against various real-world perturbations. We focus on text-to-video retrieval and propose two large-scale benchmark datasets, MSRVTT-P and YouCook2-P, which utilize 90 different visual and 35 different text perturbations. The study reveals some interesting initial findings from the studied models: 1) models are generally more susceptible when only video is perturbed as opposed to when only text is perturbed, 2) models that are pre-trained are more robust than those trained from scratch, 3) models attend more to scene and objects rather than motion and action. We hope this study will serve as a benchmark and guide future research in robust video-language learning. The benchmark introduced in this study along with the code and datasets is available at https://bit.ly/3CNOly4.
연구 동기 및 목표
- 비디오-언어 모델의 실세계의 분포 이탈(시각적 및 텍스트적 모odal 모두)에 대한 강건성을 조사하기 위해.
- 사전 훈련이 사전 훈련 없이 훈련하는 것보다 비디오-언어 모델의 강건성에 기여하는지 확인하기 위해.
- 모델의 주의 메커니즘을 분석하여 정적 콘텐츠(물체, 환경)보다는 동적 콘텐츠(운동, 동작)에 더 집중하는지 여부를 규명하기 위해.
- 목표 데이터셋으로의 미세조정이 비디오-언어 모델에 성별 편향을 도입하거나 악화시키는지 평가하기 위해.
- 향후 강건한 다중모odal 비디오-언어 학습 연구를 위한 기준을 설정하기 위해.
제안 방법
- 원본 MSRVTT 및 YouCook2 데이터셋에 90종의 시각적 교란과 35종의 텍스트 교란을 적용하여 대규모 벤치마크 데이터셋인 MSRVTT-P와 YouCook2-P를 구축하였다.
- 실제 세계의 분포 이탈을 시뮬레이션하기 위해 이미지 흐림, 카메라 진동, 디지털 압축, 철자 실수, 동의어 교체, 위치 이동 등의 다양한 교란을 적용하였다.
- 비디오-언어 모델 여러 종류(VideoCLIP, UniVL, FIT 등)를 다양한 훈련 방식(초기화 훈련, 제로샷(사전 훈련 가중치 사용), 목표 데이터셋으로의 미세조정)에서 평가하였다.
- 다양한 교란 유형과 모달 간의 상대적 및 절대적 강건성 점수를 측정하여 강건성 수준을 평가하였다.
- 교란 상황에서 모델이 어떤 시각적 및 언어적 구성 요소에 주의를 기울이는지 분석하기 위해 주의 시각화를 실시하였다.
- 텍스트의 성별 어휘와 해당 비디오 콘텐츠 간의 모델 예측을 분석하여 편향 평가를 수행하였다.
실험 결과
연구 질문
- RQ1텍스트-비디오 검색에서 비디오-언어 모델은 실제 세계의 시각적 및 언어적 교란 상황에서 어떻게 성능을 발휘하는가?
- RQ2사전 훈련이 초기화 훈련보다 강건성 향상에 기여하는가?
- RQ3교란 상황에서 모델은 정적 요소(물체, 환경)보다는 동적 요소(운동, 동작)에 더 집중하는가?
- RQ4목표 데이터셋으로의 미세조정이 비디오-언어 모델에 성별 편향을 도입하거나 악화시키는가?
- RQ5자연적, 기계 생성, 합성 교란 유형에 따라 모델의 강건성은 어떻게 변화하는가?
주요 결과
- 비디오 모달만 손상된 경우 모델이 더 심각하게 취약함을 확인하여, 시각적 처리의 취약성이 텍스트 교란보다 더 높음을 시사한다.
- 사전 훈련된 모델는 강건성과 성능 모두에서 초기화 훈련 모델보다 뚜렷이 뛰어나며, 대규모 사전 훈련의 가치를 입증한다.
- 비디오-언어 모델의 주의 메커니즘은 운동 및 동작 신호보다 정적 시각적 요소(물체, 환경)에 더 집중하는 경향이 있으며, 운동 신호에 대한 주의는 미미하다.
- 목표 데이터셋으로의 미세조정을 통해 훈련된 모델는 사전 훈련 가중치를 사용한 모델보다 더 강한 성별 편향을 보이며, 이는 목표 데이터가 기존 편향을 악화시킬 수 있음을 시사한다.
- 특히 UniVL과 VideoCLIP와 같은 제로샷 모델은 합성 및 기계 생성 교란 상황에서도 상대적으로 높은 강건성을 보이며, 모든 교란 유형에서 뛰어난 성능을 발휘한다.
- MSRVTT-P에서의 평균 절대 강건성 점수는 합성 교란(Synthetic, DropText/Positional)의 경우 0.82 ± 0.14였으며, 가장 뛰어난 성능을 보인 모델(uniVL-zs)은 0.92 ± 0.05의 점수를 기록하여 도전적인 조건에서도 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.