Skip to main content
QUICK REVIEW

[论文解读] GRACE: Loss-Resilient Real-Time Video through Neural Codecs

Yihua Cheng, Ziyi Zhang|arXiv (Cornell University)|May 21, 2023
Image and Video Quality Assessment被引用 6
一句话总结

Grace 提出了一种神经视频编码器,通过在模拟分组丢失条件下联合训练编码器和解码器,实现了在实时视频通信中更高的抗丢包能力。通过在多种丢包条件下进行训练,并使用可逆随机映射和随机置零实现可微分的丢包模拟,Grace 在高丢包率下仍能保持高质量视频,与 FEC 相比,不可解码帧减少 95%,卡顿时长减少 90%,用户研究中 MOS 提高 38%。

ABSTRACT

In real-time video communication, retransmitting lost packets over high-latency networks is not viable due to strict latency requirements. To counter packet losses without retransmission, two primary strategies are employed -- encoder-based forward error correction (FEC) and decoder-based error concealment. The former encodes data with redundancy before transmission, yet determining the optimal redundancy level in advance proves challenging. The latter reconstructs video from partially received frames, but dividing a frame into independently coded partitions inherently compromises compression efficiency, and the lost information cannot be effectively recovered by the decoder without adapting the encoder. We present a loss-resilient real-time video system called GRACE, which preserves the user's quality of experience (QoE) across a wide range of packet losses through a new neural video codec. Central to GRACE's enhanced loss resilience is its joint training of the neural encoder and decoder under a spectrum of simulated packet losses. In lossless scenarios, GRACE achieves video quality on par with conventional codecs (e.g., H.265). As the loss rate escalates, GRACE exhibits a more graceful, less pronounced decline in quality, consistently outperforming other loss-resilient schemes. Through extensive evaluation on various videos and real network traces, we demonstrate that GRACE reduces undecodable frames by 95% and stall duration by 90% compared with FEC, while markedly boosting video quality over error concealment methods. In a user study with 240 crowdsourced participants and 960 subjective ratings, GRACE registers a 38% higher mean opinion score (MOS) than other baselines.

研究动机与目标

  • 解决在低延迟网络中因重传不可行而难以在高丢包率下维持高质量实时视频的挑战。
  • 克服传统前向纠错(FEC)在冗余阈值达到后出现质量急剧下降的局限性,以及错误隐藏技术降低压缩效率且缺乏编码器感知优化的问题。
  • 设计一种系统,在无需预先知晓丢包条件的情况下,可在广泛丢包率范围内保持一致的视频质量。
  • 实现编码器与解码器的联合优化,使信息在分组间分布更合理,从而在发生丢包时仍能实现鲁棒重建。
  • 在现代 GPU 上实现实时性能,同时保持与现有视频分发流水线的兼容性。

提出的方法

  • 采用神经视频编码器(NVC)将神经网络集成到视频编码与解码中,支持端到端可微训练。
  • 通过在编码器输出张量上随机置零而非实际丢包来模拟分组丢失,从而实现对丢失过程的反向传播。
  • 在帧分块过程中应用可逆随机映射,以保持与 NVC 的兼容性并减少分块开销。
  • 在从 0% 到 50% 的一系列模拟丢包率下联合训练编码器与解码器,使模型能泛化于多种网络条件。
  • 提出一种新型重同步协议,使编码器与解码器可在不重传或更新关键帧的情况下重新对齐状态,保持解码连续性。
  • 通过模型蒸馏(Grace-Lite)和硬件感知编译(OpenVINO)优化实时性能,实现在移动设备与 CPU 平台上的部署。

实验结果

研究问题

  • RQ1在多种模拟分组丢失条件下联合训练神经编码器与解码器,是否能显著提升高丢包率下的视频质量,相比传统 FEC 或错误隐藏方法?
  • RQ2与非可微或启发式丢包建模相比,采用随机置零实现可微分丢包模拟的端到端训练,对重建质量与抗丢包能力有何影响?
  • RQ3NVC 输出中采用可逆随机映射与分布正则化,在多大程度上能减少分块开销并提升压缩效率?
  • RQ4一种抗丢包的神经编码器是否能在消费级硬件(如 iPhone 14 Pro)上实现实时性能,同时在主观与客观指标上优于现有基线?
  • RQ5与仅训练解码器或仅训练编码器的方案相比,编码器与解码器的联合训练在重建保真度与鲁棒性方面表现如何?

主要发现

  • 在真实网络轨迹与多样化视频内容下,Grace 相较于前向纠错(FEC)将不可解码帧减少了 95%,卡顿时长减少了 90%。
  • 在包含 240 名参与者与 960 次评分的众包用户研究中,Grace 的平均意见得分(MOS)比竞争基线高出 38%,证明其用户感知质量更优。
  • 在无损条件下,Grace 的视频质量与 H.265 相当,且在丢包率上升时表现出更平滑、渐进的退化,优于 FEC 与错误隐藏方法。
  • 在 NVIDIA A40 GPU 上,Grace 以 33 fps(每帧 29.7 ms)编码 720p 视频,以 51.2 fps(每帧 19.5 ms)解码,重同步仅增加 6 ms 的编码延迟。
  • Grace-Lite 在 iPhone 14 Pro 上实现了实时编码与解码,编码延迟为 38.1 ms,解码延迟为 14.4 ms,分别较原始延迟降低 85%以上,同时保持了强大的抗丢包能力。
  • 消融实验证实,编码器与解码器的联合训练至关重要:仅在丢包条件下训练编码器的 Grace-P 与仅微调解码器的 Grace-D 在抗丢包能力上均显著劣于完整版 Grace。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。