[논문 리뷰] Zelda: Video Analytics using Vision-Language Models
Zelda는 고도로 표현력 있고 관련성 있으며 다양성이 높은 자연어 질의를 가능하게 하는 비디오 분석 시스템이다. 이 시스템은 사전 훈련된 시각-언어 모델(Vision-Language Models, VLMs)을 활용하여 대규모 비디오 데이터셋에 대한 자연어 질의를 지원한다. 자동으로 프롬프트 품질을 향상시키고, 저품질 프레임을 필터링하며, 의미적 임베딩을 사용해 중복 결과를 제거함으로써 기존 최고 수준의 시스템 대비 평균 정밀도 평균(MAP)은 최대 1.15배 향상되고 검색 속도는 7.5배 빨라진다.
Advances in ML have motivated the design of video analytics systems that allow for structured queries over video datasets. However, existing systems limit query expressivity, require users to specify an ML model per predicate, rely on complex optimizations that trade off accuracy for performance, and return large amounts of redundant and low-quality results. This paper focuses on the recently developed Vision-Language Models (VLMs) that allow users to query images using natural language like "cars during daytime at traffic intersections." Through an in-depth analysis, we show VLMs address three limitations of current video analytics systems: general expressivity, a single general purpose model to query many predicates, and are both simple and fast. However, VLMs still return large numbers of redundant and low-quality results that can overwhelm and burden users. In addition, VLMs often require manual prompt engineering to improve result relevance. We present Zelda: a video analytics system that uses VLMs to return both relevant and semantically diverse results for top-K queries on large video datasets. Zelda prompts the VLM with the user's query in natural language. Zelda then automatically adds discriminator and synonym terms to boost accuracy, and terms to identify low-quality frames. To improve result diversity, Zelda uses semantic-rich VLM embeddings in an algorithm that prunes similar frames while considering their relevance to the query and the number of top-K results requested. We evaluate Zelda across five datasets and 19 queries and quantitatively show it achieves higher mean average precision (up to 1.15x) and improves average pairwise similarity (up to 1.16x) compared to using VLMs out-of-the-box. We also compare Zelda to a state-of-the-art video analytics engine and show that Zelda retrieves results 7.5x (up to 10.4x) faster for the same accuracy and frame diversity.
연구 동기 및 목표
- 현재 비디오 분석 시스템의 제한된 표현력 문제를 해결한다. 이는 질의를 사전 정의된 모델 클래스에 국한시킨다.
- 사용자가 질의 조건마다 별도의 머신러닝 모델을 수동으로 선택하고 훈련해야 하는 문제를 해결한다.
- 기존 비디오 분석 파이프라인에 내재된 시스템 복잡성과 성능/정확도 트레이드오��� 문제를 완화한다.
- 상위-K 비디오 검색에서 중복되고 저품질인 결과 문제를 개선함으로써 결과의 다양성과 품질을 향상시킨다.
- 질의 전용 훈련이나 애너테이션 없이도 단일 일반 목적의 VLM을 사용해 빠르고 정확하며 사용자 友好的한 비디오 분석을 가능하게 한다.
제안 방법
- 사용자가 입력한 자연어 질의를 사전 훈련된 시각-언어 모델(VLM)을 통해 인코딩하고, 질의와 비디오 프레임 간의 의미적 유사도를 계산한다.
- 검색 정확도와 내성 강도를 향상시키기 위해 질의를 디스크리미네이터어휘(예: 'not', 'except')와 동의어어휘로 자동으로 보강한다.
- 흐릿함, 노이즈 또는 관련 없는 콘텐츠를 탐지하는 VLM 기반 임베딩을 사용해 저품질 프레임을 식별하고 필터링한다.
- 의미적 다양성에 민감한 제거 알고리즘을 적용하여, VLM가 생성한 임베딩을 기반으로 관련성은 높이고 상호 유사도는 낮은 상위-K 프레임을 순서대로 정렬하고 선별한다.
- VLM의 제로샷 능력을 활용해 재훈련이나 모델 특화 없이도 복잡한 다중 조건 질의를 지원한다.
- 질의 전용 모델 훈련을 피하고 모든 질의에 공통으로 사용 가능한 빠른 VLM 추론에 의존함으로써 효율성을 최적화한다.

실험 결과
연구 질문
- RQ1시각-언어 모델(VLMs)은 비디오 분석 시스템에서 특화된 머신러닝 모델의 일반 목적, 제로샷 대체 수 Mitt이 될 수 있는가?
- RQ2동의어와 디스크리미네이터어휘를 사용한 자동 프롬프트 엔지니어링이 VLM 기반 비디오 검색 정확도에 얼마나 기여하는가?
- RQ3의미적 임베딩 기반의 다양성 제거 기법은 관련성을 유지하면서도 중복 결과를 얼마나 효과적으로 줄일 수 있는가?
- RQ4기본 VLM 추론 대비 VLM 기반 시스템이 더 높은 평균 정밀도 평균(MAP)과 낮은 결과 유사도를 달성할 수 있는가?
- RQ5Zelda의 종단 간 성능은 기존 최고 수준의 비디오 분석 시스템 대비 속도, 정확도, 결과 다양성 측면에서 어떻게 비교되는가?
주요 결과
- Zelda는 VLM를 즉시 사용하는 것에 비해 평균 정밀도 평균(MAP)을 최대 1.15배 향상시켜 검색 정확도 향상의 명확한 증거를 보여준다.
- Zelda는 상위-K 결과 간 평균 상호 유사도를 최대 1.16배 감소시켜 검색된 프레임의 의미적 다양성이 향상됨을 시사한다.
- Zelda는 최고 수준의 비디오 분석 시스템(BlazeIt) 대비 최대 10.4배 빠른 검색 속도를 기록하면서도 동일한 정확도를 유지한다.
- 평균적으로 Zelda는 최고 성능을 보인 베이스라인 시스템 대비 7.5배 더 빠르며, 다양한 데이터셋에 걸쳐 뛰어난 성능 확장성을 보여준다.
- 수동 애너테이션이나 추가 훈련 없이도 VLM 기반 품질 점수 기반으로 저품질 프레임을 효과적으로 제거한다.
- 의미적 유사도 기반의 다양성 제거 기법은 시각적 유사도 방법보다 우수하며, MAP를 1.06배 향상시키면서도 더 적은 초모수 조정이 필요하다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.