[论文解读] Exploring Video Quality Assessment on User Generated Contents from Aesthetic and Technical Perspectives
本文提出了 DOVER 和 DOVER++,这是首个针对用户生成内容(UGC)视频的客观视频质量评估模型,能够显式地将美学质量与技术质量的感知分离。通过利用一个包含 450K 个多重视角质量评价意见的新大规模数据集(DIVIDE-3k),DOVER 采用双分支架构,结合视角特定的归纳偏置与主观启发式融合策略,在实现最先进性能的同时,实现了对美学与技术质量的解耦、可靠评估,显著优于先前方法。
The rapid increase in user-generated-content (UGC) videos calls for the development of effective video quality assessment (VQA) algorithms. However, the objective of the UGC-VQA problem is still ambiguous and can be viewed from two perspectives: the technical perspective, measuring the perception of distortions; and the aesthetic perspective, which relates to preference and recommendation on contents. To understand how these two perspectives affect overall subjective opinions in UGC-VQA, we conduct a large-scale subjective study to collect human quality opinions on overall quality of videos as well as perceptions from aesthetic and technical perspectives. The collected Disentangled Video Quality Database (DIVIDE-3k) confirms that human quality opinions on UGC videos are universally and inevitably affected by both aesthetic and technical perspectives. In light of this, we propose the Disentangled Objective Video Quality Evaluator (DOVER) to learn the quality of UGC videos based on the two perspectives. The DOVER proves state-of-the-art performance in UGC-VQA under very high efficiency. With perspective opinions in DIVIDE-3k, we further propose DOVER++, the first approach to provide reliable clear-cut quality evaluations from a single aesthetic or technical perspective. Code at https://github.com/VQAssessment/DOVER.
研究动机与目标
- 探究美学与技术视角如何共同影响用户生成内容(UGC)视频中的人类质量感知。
- 开发一种客观视频质量评估(VQA)方法,同时考虑美学与技术视角,而非将整体质量视为单一评分。
- 创建一个全新的基准数据集 DIVIDE-3k,包含来自两种视角的 450K 项主观质量评价,以支持解耦 VQA 研究。
- 通过建模个体在质量判断中对美学与技术因素相对权重的差异,实现个性化质量评估。
- 提供首个可靠、单重视角的质量评估框架(DOVER++),适用于需要独立美学或技术指标的实际应用场景。
提出的方法
- 提出视图分解策略,通过设计视角特定的输入、正则化与预训练策略,从视频中分离美学与技术信息。
- 设计双分支网络架构:一个分支专注于美学质量(如内容、构图),另一个分支专注于技术质量(如模糊、伪影),每个分支均具备定制化的归纳偏置。
- 基于 DIVIDE-3k 数据集中观察到的人类加权模式,对两个分支的预测进行主观启发式融合,生成最终的整体质量评分。
- 采用多任务监督训练 DOVER:使用现有 UGC-VQA 数据集中的整体质量评分,以及 DIVIDE-3k 中的解耦美学/技术评分。
- 引入 DOVER++ 作为扩展,通过允许自适应融合权重,实现单重视角质量评估,支持个性化质量预测。
- 引入一种新型损失项 $\mathcal{L}_{\mathrm{DS}}$,即使在缺乏美学或技术评分直接 MOS 标注的情况下,也能对解耦质量预测进行监督。
实验结果
研究问题
- RQ1美学与技术视角在多大程度上共同影响用户生成视频中的人类整体质量评分?
- RQ2深度学习模型能否有效解耦美学与技术质量感知,从而提升整体 VQA 性能?
- RQ3美学与技术因素的相对影响在不同个体之间如何变化?能否通过建模实现个性化质量评估?
- RQ4显式地对模型进行解耦美学与技术意见的监督,是否能比仅使用端到端监督获得更优的整体质量预测?
- RQ5一个单一模型能否提供可靠、隔离的美学或技术质量评估,从而支持在特定应用场景中的使用?
主要发现
- 基于 DIVIDE-3k 数据集中 450K 项主观评价,确认人类对 UGC 视频的质量感知普遍且不可避免地受到美学与技术视角的双重影响。
- DOVER 在标准 UGC-VQA 基准上达到最先进性能,在 LSVQ 测试集上 SROCC 为 0.888,在 LSVQ 1080p 上为 0.795,在 KoNViD-1k 上为 0.884,在 LIVE-VQC 上为 0.832。
- 消融研究证实视图分解至关重要,若移除该策略,LSVQ 测试集上的 SROCC 降至 0.859,性能下降 2.9%。
- 通过引入解耦监督($\mathcal{L}_{\mathrm{DS}}$),DOVER++ 在无需美学/技术评分直接 MOS 标注的情况下,相比基线方法实现了 1% 的性能提升。
- DOVER 中的主观启发式融合策略显著优于简单求和融合或单分支预测,验证了模型与人类感知机制的一致性。
- DOVER++ 通过自适应融合权重实现个性化质量评估,实证表明不同人群在美学与技术因素上的重要性权重存在差异,该发现得到推理研究的支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。