[论文解读] Real-Time Video Highlights for Yahoo Esports
本文提出一种基于CNN的视觉分类器的实时级联深度学习方法,用于检测电子竞技视频精彩瞬间。通过先过滤非对局场景,再在对局帧中检测精彩瞬间,该系统在单个CPU上实现了18 FPS的处理速度,并在《风暴之英雄》、《英雄联盟》和《Dota 2》三款热门游戏中实现了83.18%的平均精度,证明其在Yahoo Esports平台上的生产可用性。
Esports has gained global popularity in recent years and several companies have started offering live streaming videos of esports games and events. This creates opportunities to develop large scale video understanding systems for new product features and services. We present a technique for detecting highlights from live streaming videos of esports game matches. Most video games use pronounced visual effects to emphasize highlight moments; we use CNNs to learn convolution filters of those visual effects for detecting highlights. We propose a cascaded prediction approach that allows us to deal with several challenges arise in a production environment. We demonstrate our technique on our new dataset of three popular game titles, Heroes of the Storm, League of Legends, and Dota 2. Our technique achieves 18 FPS on a single CPU with an average precision of up to 83.18%. Part of our technique is currently deployed in production on Yahoo Esports.
研究动机与目标
- 开发一种满足生产性能要求的实时电子竞技直播流视频精彩瞬间检测系统。
- 应对电子竞技视频内容中高度多变的挑战,包括采访和广告等非对局场景。
- 通过在精彩瞬间分类前过滤非对局帧,提升精彩瞬间检测的准确性。
- 利用基于帧的CNN模型而非序列模型,构建可扩展、高效且可部署的系统。
- 建立一个大规模、基于帧的标注数据集,总时长超过300小时,用于训练和评估电子竞技精彩瞬间检测。
提出的方法
- 采用级联预测框架,使用两个基于CNN的分类器:场景类型分类器和精彩瞬间检测器。
- 场景类型分类器将帧分类为对局、回放、英雄选择或“其他”(非对局)场景。
- 仅将被分类为对局的帧传递给精彩瞬间分类器,后者输出0到1之间的归一化置信度分数。
- 系统为提升速度每5帧处理一次,然后通过线性插值将结果恢复至原始帧率,以保持实时性能。
- 基础CNN架构采用带批量归一化的AlexNet,使用ADAM优化器在CaffeOnSpark上从零开始训练。
- 采用两阶段标注方案,高效收集了超过300小时的基于帧的标注视频数据,用于训练和评估。
实验结果
研究问题
- RQ1与单模型基线相比,级联深度学习方法是否能在多样化的电子竞技直播流视频中提升精彩瞬间检测的准确性?
- RQ2预先过滤非对局场景在减少误报和提升精彩瞬间检测性能方面有多有效?
- RQ3基于帧的处理结合插值,在实现CPU上的实时推理时,能在多大程度上保持准确性?
- RQ4分类方式(二分类与回归)的选择如何影响精彩瞬间检测性能,尤其是在类别严重不平衡的情况下?
- RQ5在某一游戏类型上训练的单一模型,能否在同类型的不同电子竞技游戏中实现泛化(例如,MOBA游戏之间)?
主要发现
- 所提出的级联二分类方法在《风暴之英雄》数据集上实现了83.18%的平均精度和86.29%的召回率,优于所有基线模型。
- 级联设计相比单模型方法将平均精度提升了超过20个百分点,证明了场景过滤的价值。
- 该系统在单个CPU上实现了18 FPS,满足了直播视频实时处理的性能要求。
- 基于回归的精彩瞬间检测器表现不佳,尤其在召回率方面,原因在于非精彩帧与精彩帧的比例超过100:1,存在严重类别不平衡。
- 场景类型分类器实现了超过99%的平均精度和召回率,证实区分对局与非对局场景是一个相对简单但至关重要的预处理步骤。
- 超过300小时的基于帧标注的电子竞技视频数据集,为未来迁移学习和多模态视频分析研究提供了宝贵的基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。