[论文解读] Viewport Adaptation-Based Immersive Video Streaming: Perceptual Modeling and Applications
该论文提出了一种用于视口自适应沉浸式视频流的感知质量模型,联合建模量化步长和空间分辨率对质量退化的影响。通过使用两个闭式指数函数的乘积,该模型以高精度预测平均意见得分(MOS)(皮尔逊相关系数和斯皮尔曼等级相关系数≈0.98),并实现率失真优化,在带宽受限条件下相比启发式方法实现9.36%的BD-Rate增益。
Immersive video offers the freedom to navigate inside virtualized environment. Instead of streaming the bulky immersive videos entirely, a viewport (also referred to as field of view, FoV) adaptive streaming is preferred. We often stream the high-quality content within current viewport, while reducing the quality of representation elsewhere to save the network bandwidth consumption. Consider that we could refine the quality when focusing on a new FoV, in this paper, we model the perceptual impact of the quality variations (through adapting the quantization stepsize and spatial resolution) with respect to the refinement duration, and yield a product of two closed-form exponential functions that well explain the joint quantization and resolution induced quality impact. Analytical model is cross-validated using another set of data, where both Pearson and Spearman's rank correlation coefficients are close to 0.98. Our work is devised to optimize the adaptive FoV streaming of the immersive video under limited network resource. Numerical results show that our proposed model significantly improves the quality of experience of users, with about 9.36\% BD-Rate (Bjontegaard Delta Rate) improvement on average as compared to other representative methods, particularly under the limited bandwidth.
研究动机与目标
- 建模在沉浸式视频流视口精炼过程中,量化步长和空间分辨率对感知质量影响的联合效应。
- 开发一种闭式解析模型,基于精炼时长τ准确预测主观质量(MOS)。
- 通过最大化感知质量,利用所提模型在比特率约束下实现自适应流媒体优化。
- 通过独立的主观评估进行交叉验证,验证模型的准确性。
- 与启发式自适应策略相比,展示在质量体验(QoE)方面的实际性能提升。
提出的方法
- 将感知质量影响建模为两个指数函数的乘积,分别表征量化步长(q)和空间分辨率(s)对MOS随精炼时长τ的变化影响。
- 推导出依赖于q和s的固定闭式函数形式的模型参数,实现无需再训练的解析优化。
- 使用独立数据集验证模型,计算预测MOS与实测MOS之间的皮尔逊相关系数和斯皮尔曼等级相关系数。
- 将模型应用于求解率约束下的优化问题,在给定比特率预算B下最大化估计的感知质量(Q̂)。
- 对量化步长(q)和归一化空间分辨率(ŝ)的离散组合进行暴力搜索,为每个B找到最优设置。
- 采用BD-Rate指标对基于模型的自适应方法与启发式规则方法进行定量比较。
实验结果
研究问题
- RQ1量化步长和空间分辨率的变化如何共同影响视口精炼过程中的感知视频质量?
- RQ2闭式感知模型能否在不同精炼时长下准确预测视口自适应沉浸式视频流的MOS?
- RQ3在带宽受限条件下,与启发式自适应策略相比,所提模型在多大程度上提升了质量体验?
- RQ4使用该模型联合优化量化与分辨率,如何影响沉浸式视频流的率失真效率?
- RQ5在不同网络条件下,离散分辨率与量化等级对最优自适应策略有何影响?
主要发现
- 所提感知模型在交叉验证中,预测MOS与实测MOS之间的皮尔逊相关系数为0.98,斯皮尔曼等级相关系数为0.98。
- 该模型实现了视口自适应的解析优化,可为任意给定的比特率约束选择最优量化步长和空间分辨率。
- 基于模型的自适应方法相比一种基于固定比特率阈值分配空间分辨率的启发式方法,平均实现9.36%的BD-Rate增益。
- 由于存在离散的空间分辨率等级,最优量化步长不会随比特率增加而单调递减,导致q出现非单调跳变。
- 当空间分辨率固定在较低水平时,质量随量化步长减小而提升更快,表明在低分辨率下质量增益对q更敏感。
- 该模型的准确性在所有测试视频中均保持稳定,所有参数固定,无需针对每段视频重新训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。