[논문 리뷰] Towards Robust Text-Prompted Semantic Criterion for In-the-Wild Video Quality Assessment
이 논문은 인간의 레이블이 없는 점수를 기반으로 영상 품질을 평가하기 위해 CLIP 기반 텍스트 프롬프트를 활용한 의미적 유사도를 활용하는 제로샷 영상 품질 평가 모델 BVQI 및 BVQI-Local를 제안한다. CLIP에서 유도된 의미적 유사도와 저수준 지표를 융합하고, 텍스트 프롬프트와 융합 가중치를 효율적으로 미세조정함으로써, 기존의 제로샷 지표보다 모든 데이터셋에서 최소 24% 이상 뛰어난 최신 기술 수준의 성능을 달성한다.
The proliferation of videos collected during in-the-wild natural settings has pushed the development of effective Video Quality Assessment (VQA) methodologies. Contemporary supervised opinion-driven VQA strategies predominantly hinge on training from expensive human annotations for quality scores, which limited the scale and distribution of VQA datasets and consequently led to unsatisfactory generalization capacity of methods driven by these data. On the other hand, although several handcrafted zero-shot quality indices do not require training from human opinions, they are unable to account for the semantics of videos, rendering them ineffective in comprehending complex authentic distortions (e.g., white balance, exposure) and assessing the quality of semantic content within videos. To address these challenges, we introduce the text-prompted Semantic Affinity Quality Index (SAQI) and its localized version (SAQI-Local) using Contrastive Language-Image Pre-training (CLIP) to ascertain the affinity between textual prompts and visual features, facilitating a comprehensive examination of semantic quality concerns without the reliance on human quality annotations. By amalgamating SAQI with existing low-level metrics, we propose the unified Blind Video Quality Index (BVQI) and its improved version, BVQI-Local, which demonstrates unprecedented performance, surpassing existing zero-shot indices by at least 24\% on all datasets. Moreover, we devise an efficient fine-tuning scheme for BVQI-Local that jointly optimizes text prompts and final fusion weights, resulting in state-of-the-art performance and superior generalization ability in comparison to prevalent opinion-driven VQA methods. We conduct comprehensive analyses to investigate different quality concerns of distinct indices, demonstrating the effectiveness and rationality of our design.
연구 동기 및 목표
- 비용이 많이 드는 인간의 레이블이 부여된 품질 점수로 인해 의견 기반 VQA 방법의 일반화 능력이 제한되는 문제를 해결하기 위해.
- 실제 왜곡에서 의미적 내용을 忽略하는 수작업 제로샷 지표의 한계를 극복하기 위해.
- 실세계 영상 품질 평가를 위한 강력하고 레이블이 없는 의미적 인지 기반 품질 기준을 개발하기 위해.
- 성능 향상과 일반화 능력을 향상시키기 위해 텍스트 프롬프트와 융합 가중치를 효과적으로 미세조정할 수 있도록 하기 위해.
- 의미적 및 저수준 품질 평가를 하나의 효율적이고 확장 가능한 프레임워크로 통합하기 위해.
제안 방법
- 영상 특징와 짝지어진 양/음성 품질 프롬프트 간 CLIP의 시각-텍스트 유사도를 측정함으로써 영상 품질을 평가하는 의미적 유사도 품질 지수(SAQI)를 제안한다.
- 국소 왜곡에 더 민감하게 반응하기 위해 영상의 패치 수준에서 품질을 평가하는 SAQI의 국소화된 변종인 SAQI-Local를 도입한다.
- SAQI를 기존의 저수준 지표(공간적 및 시간적 자연스러움)와 융합하여 통합된 블라인드 영상 품질 지수인 BVQI를 구성한다.
- BVQI-Local에 대해 문맥 프롬프트와 융합 가중치를 동시에 최적화하는 파라미터 효율적인 미세조정 기법을 개발한다.
- 반대어 쌍(예: 선명한 vs. 흐린)을 사용한 다중 프롬프트 집계 기법을 도입하여 다양한 데이터셋에서의 강건성과 성능을 향상시킨다.
- 언어적 구조를 유지하면서 성능을 향상시키기 위해 단일층 MLP를 활용한 학습 가능한 프롬프트 헤드를 사용하여 암묵적인 프롬프트 최적화를 수행한다.
실험 결과
연구 질문
- RQ1인간의 레이블이 없는 점수 없이 CLIP 기반 의미적 유사도 기준이 실외 환경에서 영상 품질을 효과적으로 평가할 수 있는가?
- RQ2의미적 요소와 저수준 지표를 융합함으로써 제로샷 VQA 성능이 어떻게 향상되는가?
- RQ3텍스트 프롬프트와 융합 가중치를 동시에 최적화하는 미세조정 기법이 기존의 의견 기반 VQA 방법을 초월할 수 있는가?
- RQ4프롬프트 설계(예: 반대어 쌍, 길이)가 모델의 강건성과 일반화 능력에 미치는 영향은 무엇인가?
- RQ5다양한 데이터셋에서 다른 품질 인식(예: 왜곡 vs. 콘텐츠 매력도)은 어떻게 달라지며, 모델은 이러한 차이를 포착할 수 있는가?
주요 결과
- BVQI-Local는 모든 벤치마크 데이터셋에서 기존의 제로샷 VQA 지표보다 PLCC 기준 최소 24% 이상 뛰어난 사상 최고의 성능을 기록한다.
- 반대어 쌍을 사용한 다중 프롬프트 집계 전략은 성능 향상과 일반화 능력 향상에 뚜렷한 기여를 하며, 다양한 데이터셋에서 일관된 성과를 기록한다.
- 문맥 프롬프트와 융합 가중치를 미세조정함으로써 제로샷 기준보다 뚜렷한 성능 향상이 이루어졌으며, 제안된 최적화 기법의 효과성을 입증한다.
- 텍스트 임베딩을 직접 최적화하는 것보다 문맥 프롬프트를 최적화하는 것이 더 우수한 결과를 도출함으로써, 프롬프트 설계에서 언어적 구조의 중요성을 확인한다.
- 단일 토큰의 문맥 프롬프트만으로도 최적의 성능을 달성할 수 있음을 확인하였으며, 이는 고수준 비전 작업에 비해 VQA 작업에서 빠른 문맥 포화가 일어남을 시사한다.
- 청결한 vs. 노이지, 손실 없는 vs. 손실 있는 등의 구체적인 프롬프트 쌍은 CVD2014와 같이 왜곡 중심의 데이터셋에서 인간의 평가와 높은 상관관계를 보이며, LIVE-VQC 및 KoNViD-1k와 같이 사용자 생성 콘텐츠 데이터셋에서는 쾌적한 vs. 짜증나는 프롬프트가 더 관련성이 높다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.