Skip to main content
QUICK REVIEW

[論文レビュー] Towards Robust Text-Prompted Semantic Criterion for In-the-Wild Video Quality Assessment

Haoning Wu, Liang Liao|arXiv (Cornell University)|Apr 28, 2023
Image and Video Quality Assessment被引用数 5
ひとこと要約

本稿では、人間によるスコアラベルなしで動画品質を評価するため、CLIPベースのテキストプロンプトによる意味的類似度を活用するゼロショット動画品質評価モデルであるBVQIおよびBVQI-Localを提案する。CLIPから得られる意味的類似度と低レベル指標を統合し、テキストプロンプトと統合重みを効率的にファインチューニングすることで、既存のゼロショット指標を最低24%以上上回る最先端の性能を達成した。

ABSTRACT

The proliferation of videos collected during in-the-wild natural settings has pushed the development of effective Video Quality Assessment (VQA) methodologies. Contemporary supervised opinion-driven VQA strategies predominantly hinge on training from expensive human annotations for quality scores, which limited the scale and distribution of VQA datasets and consequently led to unsatisfactory generalization capacity of methods driven by these data. On the other hand, although several handcrafted zero-shot quality indices do not require training from human opinions, they are unable to account for the semantics of videos, rendering them ineffective in comprehending complex authentic distortions (e.g., white balance, exposure) and assessing the quality of semantic content within videos. To address these challenges, we introduce the text-prompted Semantic Affinity Quality Index (SAQI) and its localized version (SAQI-Local) using Contrastive Language-Image Pre-training (CLIP) to ascertain the affinity between textual prompts and visual features, facilitating a comprehensive examination of semantic quality concerns without the reliance on human quality annotations. By amalgamating SAQI with existing low-level metrics, we propose the unified Blind Video Quality Index (BVQI) and its improved version, BVQI-Local, which demonstrates unprecedented performance, surpassing existing zero-shot indices by at least 24\% on all datasets. Moreover, we devise an efficient fine-tuning scheme for BVQI-Local that jointly optimizes text prompts and final fusion weights, resulting in state-of-the-art performance and superior generalization ability in comparison to prevalent opinion-driven VQA methods. We conduct comprehensive analyses to investigate different quality concerns of distinct indices, demonstrating the effectiveness and rationality of our design.

研究の動機と目的

  • 高価な人間による品質スコアのラベル付けに起因する意見主導型VQA手法の一般化能力の制限を解消すること。
  • 本物の歪みにおいて意味的コンテンツを無視する手作業によるゼロショット指標の限界を克服すること。
  • 実世界の動画品質評価に適した、アノテーションフリーで意味的認識を持つ堅牢な品質基準を構築すること。
  • 性能と一般化能力の向上を図るため、テキストプロンプトと統合重みの効果的なファインチューニングを可能にすること。
  • 意味的品質評価と低レベル品質評価を統合した、単一で効率的かつスケーラブルなフレームワークを統一すること。

提案手法

  • 動画特徴と対応する肯定的・否定的品質プロンプトとの間のCLIPの視覚的・言語的類似度を測定することで、動画品質を評価する意味的類似度品質指標(SAQI)を提案する。
  • 局所的歪みへの感受性を高めるために、SAQIの局所化されたバージョンであるSAQI-Localを導入する。
  • SAQIを従来の低レベル指標(空間的・時間的自然さ)と統合し、統合的ブラインド動画品質指標であるBVQIを構築する。
  • BVQI-Localのためのパラメータ効率の良いファインチューニング方式を開発し、文脈的プロンプトと統合重みを同時に最適化する。
  • 反意語ペア(例:シャープ vs. ぼやけた)を用いたマルチプロンプト集約を採用し、さまざまなデータセットにおける耐性と性能を向上させる。
  • 単一層のMLPを用いた学習可能なプロンプトヘッドを採用し、文脈的プロンプトを暗黙的に最適化することで、言語的構造を保持するとともに性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1人間によるスコアラベルなしで、CLIPベースの意味的類似度基準がウェルドイン・ワイルドな状況下で動画品質を効果的に評価できるか?
  • RQ2意味的指標と低レベル指標を統合することで、ゼロショットVQA性能がどのように向上するか?
  • RQ3文脈的プロンプトと統合重みを同時に最適化するファインチューニング方式が、既存の意見主導型VQA手法を上回る性能を発揮できるか?
  • RQ4プロンプト設計(例:反意語ペア、長さ)がモデルの耐性と一般化能力に与える影響は何か?
  • RQ5さまざまなデータセットにおける異なる品質認識(例:歪み vs. コンテンツの魅力)の違いは何か?また、モデルはこれらの違いを捉えることができるか?

主な発見

  • BVQI-Localは、すべてのベンチマークデータセットで既存のゼロショットVQA指標を最低24%以上上回る、前例のない性能を達成した。
  • 反意語ペアを用いたマルチプロンプト集約戦略は、多様なデータセットにわたり一貫した向上をもたらし、性能と一般化能力を顕著に向上させた。
  • 文脈的プロンプトと統合重みのファインチューニングは、ゼロショットベースラインに対して顕著な性能向上をもたらし、提案された最適化方式の有効性を示した。
  • テキスト埋め込みを直接最適化するのではなく、文脈的プロンプトを最適化することでより良い結果が得られたことから、プロンプト設計における言語的構造の重要性が示された。
  • シングルトークンの文脈的プロンプトで十分に最適な性能が達成されることから、高レベルのビジョンタスクと比較して、VQAタスクにおける文脈の飽和が迅速であることが示された。
  • クリア vs. ノイジー、ロスレス vs. ロスリーなどの具体的なプロンプトペアは、CVD2014のような歪み中心のデータセットで人間の評価と高い相関を示したが、LIVE-VQC や KoNViD-1k のユーザーゲンレーテッドコンテンツデータセットでは、快適 vs. 不快なプロンプトがより関連性が高かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。