[论文解读] Actor-Action Semantic Segmentation with Grouping Process Models
本文提出一种动态分组过程模型(GPM),通过将分层超像素分解与基于局部CRF的标注相结合,提升动作-主体语义分割性能。通过在分段级标注与多尺度超像素分组之间实现双向信息流动,该方法在A2D数据集上相比最先进方法实现了60%的相对性能提升,证明了在视频理解中采用自适应、高阶分组的有效性。
Actor-action semantic segmentation made an important step toward advanced video understanding problems: what action is happening; who is performing the action; and where is the action in space-time. Current models for this problem are local, based on layered CRFs, and are unable to capture long-ranging interaction of video parts. We propose a new model that combines these local labeling CRFs with a hierarchical supervoxel decomposition. The supervoxels provide cues for possible groupings of nodes, at various scales, in the CRFs to encourage adaptive, high-order groups for more effective labeling. Our model is dynamic and continuously exchanges information during inference: the local CRFs influence what supervoxels in the hierarchy are active, and these active nodes influence the connectivity in the CRF; we hence call it a grouping process model. The experimental results on a recent large-scale video dataset show a large margin of 60% relative improvement over the state of the art, which demonstrates the effectiveness of the dynamic, bidirectional flow between labeling and grouping.
研究动机与目标
- 解决局部、分层CRF模型在捕捉动作-主体语义分割中长程时空交互方面的局限性。
- 通过在不同抽象层次上建模动作(时空)与主体(空间)的标注,克服两者在空间与时间粒度上的不匹配问题。
- 通过多标签代价与分层超像素分组过程,将视频级识别信号整合到分段级标注中。
- 开发一种双向推理机制,通过CRF与超像素层次结构之间的迭代反馈,持续优化标注与分组过程。
提出的方法
- 构建视频的分层超像素分解,为标注变量的潜在分组提供多分辨率时空线索。
- 在分段级别使用局部CRF对动作-主体对进行初始像素级标注,其势函数基于视频级识别分数进行条件化。
- 根据CRF输出动态激活层次结构中的超像素节点,形成反映合理动作-主体结构的自适应、高阶分组。
- 通过激活的超像素节点优化CRF连接性,使分组过程能够通过强制跨分段的结构一致性来影响标注。
- 采用图割算法进行标注、二元线性规划进行分组,实现双向推理循环,使优化过程中持续交换信息。
- 利用两种超像素层次结构——TSP(时空划分)与GBH(贪婪自底向上层次)——以评估模型的鲁棒性与性能增益。
实验结果
研究问题
- RQ1分段级标注与分层分组之间的动态、双向交互是否能超越局部CRF模型,在动作-主体语义分割中实现性能提升?
- RQ2通过多标签代价整合视频级识别信号,能否提升复杂多主体视频中像素级标注的准确性?
- RQ3多尺度超像素分组在建模具有不同空间与时间取向的动作-主体对的时空结构方面,能带来多大程度的改进?
- RQ4所提出的分组过程模型是否在大规模、真实世界视频数据集上,对复杂多标签场景的最先进方法具有超越性?
- RQ5不同的超像素层次结构构建方法(TSP与GBH)对最终分割性能与鲁棒性有何影响?
主要发现
- 所提出的GPM-GBH模型在A2D基准上相比次优方法(三层次模型)实现了60%的相对性能提升,展现出显著的性能增益。
- 在完整测试集上,GPM-GBH的平均每类像素准确率高出17%,全局像素准确率高出10%以上,相比三层次模型。
- 性能提升在单标签动作-主体视频中最为显著,平均每类准确率大幅提升,归因于更优的结构建模能力。
- 分组过程在除“狗爬行”外的所有动作-主体类别中均一致提升性能,证实其在多样化动作类型中的普适有效性。
- 基于GBH的层次结构相比TSP层次结构略优,可能归因于互补的合并策略,提升了分割一致性。
- 可视化对比显示,该方法能正确分割复杂动作如“球滚动”与“成人爬行”,在模糊或重叠场景中也优于基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。