[论文解读] MobileCodec: Neural Inter-frame Video Compression on Mobile Devices
MobileCodec 首次在移动设备上实现了实时神经帧内视频解码,利用高通 AI 引擎在低比特率下实现 720p 高清视频的 31 FPS 解码,同时保持高视觉质量。该系统采用高效、非对称的架构,结合感知量化训练与并行熵编码,实现了在功耗受限的移动硬件上的神经视频压缩实用化部署。
Realizing the potential of neural video codecs on mobile devices is a big technological challenge due to the computational complexity of deep networks and the power-constrained mobile hardware. We demonstrate practical feasibility by leveraging Qualcomm's technology and innovation, bridging the gap from neural network-based codec simulations running on wall-powered workstations, to real-time operation on a mobile device powered by Snapdragon technology. We show the first-ever inter-frame neural video decoder running on a commercial mobile phone, decoding high-definition videos in real-time while maintaining a low bitrate and high visual quality.
研究动机与目标
- 证明在商业移动硬件上实现实时神经视频解码的可行性,克服计算与功耗限制。
- 设计一种高效、非对称的神经视频编解码器架构,专为移动部署优化,具备低延迟与高能效特性。
- 开发一种与神经熵模型兼容的并行熵编码算法,实现高效码流生成。
- 实现端到端学习型视频压缩在移动平台上的实用化部署,弥合仿真与实际应用之间的差距。
- 在使用高通 AI 引擎优化推理的前提下,实现与现有编解码标准相当的率失真性能,同时保持移动设备上的实时解码速度。
提出的方法
- 设计一种非对称神经视频编解码器,采用独立且轻量的编码器与解码器网络,降低接收端的计算负载。
- 在特征空间中联合实现运动补偿与残差编码,提升压缩效率并减少冗余。
- 应用感知量化训练,将全精度神经网络转换为 8 位定点推理,实现移动 AI 加速器上的高效执行。
- 开发一种并行熵编码算法,高效编码神经熵模型的输出,降低编码延迟并提升吞吐量。
- 通过减少高分辨率下的滤波器数量,并在接收端使用更小的模型,优化网络架构以最小化乘加操作(MAC)次数。
- 利用高通 AI 引擎实现硬件加速推理,确保在商用移动设备上实现实时性能。
实验结果
研究问题
- RQ1神经帧内视频编解码器是否能在功耗与延迟受限的商用移动设备上实现实时解码?
- RQ2如何在不牺牲率失真性能或视觉质量的前提下,优化神经视频压缩以适应移动设备部署?
- RQ3为使神经编解码器在计算资源受限的移动硬件上实用化,需要哪些架构与算法上的改进?
- RQ4并行熵编码能否有效集成到神经熵模型中,以提升移动平台上的编码效率?
- RQ5在面向移动优化的神经视频编解码器中,比特率、视觉质量与解码速度之间的可实现权衡关系如何?
主要发现
- MobileCodec 在商用移动设备上实现了 31 帧每秒(FPS)的实时解码,首次公开展示了移动硬件上的实时神经帧内视频解码器。
- 系统在 Pexels 数据集的多样化视频序列上,对 720p 高清视频实现平均 PSNR 为 40.18 dB,平均 MSSSIM 为 0.9890。
- 接收端计算量最高可比发送端降低两倍,单个 P 帧解码每像素需 390.1 KMACs。
- 与 ffmpeg 中快速 H.264 和 H.265 编码相比,该模型在低比特率下表现出具有竞争力的性能,且在相同比特率下视觉质量更优。
- 解码器总参数量为 1158.9 万,每像素 390.1 KMACs,表明其在移动部署中具备极强的效率。
- 该系统表明,通过模型量化、架构优化与硬件感知设计,神经视频编解码器可成功部署于移动平台。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。