[论文解读] Multi-shot Temporal Event Localization: a Benchmark
本文提出多帧时序事件定位(MOTEL)作为一项新的基准任务,构建了MUSES数据集——包含716小时专业剪辑的剧集视频,共31,477个事件实例,平均每事件包含19个镜头切分。当前最先进动作定位方法在IoU=0.5时仅达到13.1% mAP,凸显了事件内部差异带来的挑战;简单基线方法将mAP提升至18.9%,表明需针对多帧事件设计专用方法。
Current developments in temporal event or action localization usually target actions captured by a single camera. However, extensive events or actions in the wild may be captured as a sequence of shots by multiple cameras at different positions. In this paper, we propose a new and challenging task called multi-shot temporal event localization, and accordingly, collect a large scale dataset called MUlti-Shot EventS (MUSES). MUSES has 31,477 event instances for a total of 716 video hours. The core nature of MUSES is the frequent shot cuts, for an average of 19 shots per instance and 176 shots per video, which induces large intrainstance variations. Our comprehensive evaluations show that the state-of-the-art method in temporal action localization only achieves an mAP of 13.1% at IoU=0.5. As a minor contribution, we present a simple baseline approach for handling the intra-instance variations, which reports an mAP of 18.9% on MUSES and 56.9% on THUMOS14 at IoU=0.5. To facilitate research in this direction, we release the dataset and the project code at https://songbai.site/muses/ .
研究动机与目标
- 为解决在专业剪辑的电视剧和电影中定位事件的实际挑战,其中动作因频繁剪辑而跨越多个镜头。
- 提出一项新的基准任务——多帧时序事件定位,区别于单镜头或用户生成视频场景。
- 收集并发布一个大规模、高质量的数据集(MUSES),包含大量镜头切分与多帧事件实例,以支持该领域研究。
- 在新基准上评估当前最先进方法,揭示其在应对镜头切分导致的事件内部差异时的局限性。
- 提供一种简单基线方法,提升MUSES上的性能,展示未来方法改进的潜力。
提出的方法
- MUSES数据集源自专业剪辑的剧集视频,事件实例被标注为跨越多个镜头,平均每个事件包含19个镜头。
- 事件实例被定义为跨越多个镜头的连贯动作或事件,镜头边界被明确标注。
- 提出一种基线方法,使用长度可变的滑动窗口提议(10–190秒),通过1D CNN-based二分类器进行排序,随后采用IoU阈值为0.8的非极大值抑制(NMS)。
- 提议区域特征通过将提议边界扩展50%后使用RoI池化提取,以捕获上下文信息。
- 采用多尺度时序聚合模块,包含四个分支(卷积核大小{1×3, 3×3, 3×3, 3×3},感受野单位大小{3, 3, 6, 9}),以建模长程依赖关系。
- 模型使用加权损失函数,结合交叉熵损失(分类)、合页损失(完整性)与Smooth L1损失(边界回归),权重分别为1、0.5和0.5。

实验结果
研究问题
- RQ1当前最先进时序动作定位方法在频繁镜头切分的多帧事件上泛化能力如何?
- RQ2由视角变化、景深变化及遮挡引起的事件内部差异对事件定位性能有何影响?
- RQ3简单基线方法能否有效应对多帧事件定位的挑战,特别是跨镜头的长程时序依赖建模?
- RQ4MUSES基准在多大程度上暴露了现有模型在真实世界专业剪辑视频内容中的局限性?
- RQ5在用户生成视频基准(如THUMOS14)上训练的模型,在MUSES这种更复杂、多帧的设置下性能迁移能力如何?
主要发现
- 最先进方法P-GCN在MUSES数据集上IoU=0.5时mAP仅为13.1%,表明频繁镜头切分引发的事件内部差异导致性能显著下降。
- 所提基线方法在IoU=0.5时将mAP提升至18.9%,证明对多帧结构的专门建模可有效提升性能。
- 在THUMOS14基准上,同一基线方法在IoU=0.5时达到56.9% mAP,表明其在现有基准上具有强大泛化能力。
- MUSES数据集包含716小时视频中的31,477个事件实例,平均每个事件19个镜头,每部视频约176个镜头,反映极高的镜头切分频率。
- 现有方法在多帧场景下的边界检测表现不佳,提案生成中召回率低下,凸显需要新方法。
- MUSES数据集与代码已发布于https://songbai.site/muses/,为多帧时序事件定位的未来研究奠定基础。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。