[论文解读] FAST-VQA: Efficient End-to-end Video Quality Assessment with Fragment Sampling
本文提出 FAST-VQA,一种高效的端到端视频质量评估框架,采用网格小块采样(GMS)从高分辨率视频中提取保留质量的片段,实现高精度且计算量极低的推理。通过利用片段注意力网络(FANet)处理这些片段,FAST-VQA 在 1080P 视频上相比最先进方法实现 10% 的精度提升,同时减少 99.5% 的 FLOPs。
Current deep video quality assessment (VQA) methods are usually with high computational costs when evaluating high-resolution videos. This cost hinders them from learning better video-quality-related representations via end-to-end training. Existing approaches typically consider naive sampling to reduce the computational cost, such as resizing and cropping. However, they obviously corrupt quality-related information in videos and are thus not optimal for learning good representations for VQA. Therefore, there is an eager need to design a new quality-retained sampling scheme for VQA. In this paper, we propose Grid Mini-patch Sampling (GMS), which allows consideration of local quality by sampling patches at their raw resolution and covers global quality with contextual relations via mini-patches sampled in uniform grids. These mini-patches are spliced and aligned temporally, named as fragments. We further build the Fragment Attention Network (FANet) specially designed to accommodate fragments as inputs. Consisting of fragments and FANet, the proposed FrAgment Sample Transformer for VQA (FAST-VQA) enables efficient end-to-end deep VQA and learns effective video-quality-related representations. It improves state-of-the-art accuracy by around 10% while reducing 99.5% FLOPs on 1080P high-resolution videos. The newly learned video-quality-related representations can also be transferred into smaller VQA datasets, boosting performance in these scenarios. Extensive experiments show that FAST-VQA has good performance on inputs of various resolutions while retaining high efficiency. We publish our code at https://github.com/timothyhtimothy/FAST-VQA.
研究动机与目标
- 解决高分辨率视频上深度视频质量评估(VQA)计算成本过高的问题,该问题限制了端到端训练与模型精度。
- 克服传统采样方法(如缩放与裁剪)导致的局部纹理与全局质量关系失真的局限性。
- 设计一种采样方案,以保留局部(空间)与时间质量信息,提升 VQA 表征学习效果。
- 开发一种高效、端到端的深度 VQA 模型,在保持高精度的同时显著降低 FLOPs,并适用于多种视频分辨率。
- 实现从高分辨率片段中学习的表征在小规模、低分辨率 VQA 数据集上的迁移能力,以提升低数据场景下的性能。
提出的方法
- 提出网格小块采样(GMS),将视频划分为均匀的空间网格,以原始分辨率在每个网格中采样一个小型块,并将它们拼接为时间对齐的片段。
- 确保跨帧的小块在时间上对齐,以保留运动模糊或相机抖动等帧间失真。
- 引入片段注意力网络(FANet),一种基于 Transformer 的架构,专为处理片段并提取与质量相关的特征而设计。
- 采用逐块独立回归的 IP-NLR 头生成局部质量图,提升可解释性并增强对纹理级失真的敏感度。
- 端到端训练整个系统,以片段作为输入,实现采样与表征学习的联合优化。
- 利用片段的稀疏性与结构特性,相比全分辨率基线,将 FLOPs 减少 99.5%,同时保持高精度。
实验结果
研究问题
- RQ1与缩放或裁剪等传统方法相比,该采样策略是否能更有效地保留关键质量相关信息,尤其是局部纹理与帧间失真?
- RQ2基于片段的采样在不牺牲高分辨率视频上精度的前提下,能否有效支持深度 VQA 模型的端到端训练?
- RQ3与标准视频 Transformer 相比,所提出的片段注意力网络(FANet)在从碎片化输入中学习与质量相关表征方面的有效性如何?
- RQ4从高分辨率片段中学到的表征是否能有效迁移到低分辨率或小规模 VQA 数据集?
- RQ5基于单个片段的预测是否稳定可靠?其低推理开销是否支持实际部署?
主要发现
- FAST-VQA 在 1080P 视频上相比最先进方法 PVQ 实现 10% 的 PLCC 提升(0.806),同时 FLOPs 减少 99.5%。
- 在 LSVQ_1080P 测试集上,单次采样预测的归一化标准偏差仅为 0.0079,表明预测具有高度稳定性。
- 在 LSVQ_1080P 数据集上,单次采样相对 6 次集成的精度达到 99.40%,证明其在极低计算量下仍具高度可靠性。
- FAST-VQA 在 LIVE-VQC 所有分辨率组(包括 1080P、720P 和 ≤540P 视频)中均保持优异性能(SRCC ≥ 0.80,PLCC ≥ 0.82)。
- 定性分析显示,局部质量图能有效检测模糊纹理,并准确区分动作区域与背景,表明对局部与全局质量均具有敏感性。
- 消融实验表明,FANet 中的 GRPB 模块对性能有显著贡献,完整 FAST-VQA 模型在所有基准测试中均优于不包含该模块的变体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。