[论文解读] On Evaluating Weakly Supervised Action Segmentation Methods
本文研究了在使用语音转录本进行弱监督动作分割时的性能差异与特征敏感性。结果表明,多次训练运行之间的标准差显著(1–2.51%),且出人意料的是,在Breakfast数据集上,高级别的I3D特征在性能上反而不如低级别的IDT特征,这挑战了弱监督学习中关于特征质量的既有假设。
Action segmentation is the task of temporally segmenting every frame of an untrimmed video. Weakly supervised approaches to action segmentation, especially from transcripts have been of considerable interest to the computer vision community. In this work, we focus on two aspects of the use and evaluation of weakly supervised action segmentation approaches that are often overlooked: the performance variance over multiple training runs and the impact of selecting feature extractors for this task. To tackle the first problem, we train each method on the Breakfast dataset 5 times and provide average and standard deviation of the results. Our experiments show that the standard deviation over these repetitions is between 1 and 2.5% and significantly affects the comparison between different approaches. Furthermore, our investigation on feature extraction shows that, for the studied weakly-supervised action segmentation methods, higher-level I3D features perform worse than classical IDT features.
研究动机与目标
- 调查弱监督动作分割方法在使用不同随机种子的多次训练运行中的性能波动情况。
- 评估不同特征提取器(特别是IDT与I3D)对弱监督动作分割模型性能的影响。
- 评估针对IDT特征设计的最先进方法是否能在未经过适应的情况下有效泛化至I3D特征。
- 通过报告多次运行的均值与标准差,而非单次运行,提供更可靠的评估协议。
- 识别尽管I3D特征具有更高级的表征能力且在大规模视频数据上进行了预训练,但其性能表现不佳的潜在原因。
提出的方法
- 在Breakfast数据集上,使用不同随机种子对四个公开可用的弱监督动作分割模型(NNV、ISBA、CDFL和MuCon)各训练五次,以评估性能波动。
- 报告五次运行中平均帧数(MoF)的均值与标准差,以量化模型的稳定性和变异性。
- 从Breakfast数据集的视频中提取每帧2048维的I3D(RGB与Flow)特征,并使用这些特征评估模型性能。
- 通过主成分分析(PCA)将I3D特征的维度从2048降低至64,以匹配原始模型所使用的输入维度,生成PCA-I3D特征。
- 修改NNV模型中GRU输入的时序感受野(特征窗口大小),以测试在使用PCA-I3D特征时对局部时序上下文的敏感性。
- 在Breakfast数据集的分割1上,使用MoF作为评估指标,比较所有模型在IDT、I3D和PCA-I3D特征上的性能表现。
实验结果
研究问题
- RQ1在使用不同随机种子的多次训练运行中,弱监督动作分割模型的性能波动程度如何?
- RQ2在Breakfast数据集上,高级别的I3D特征是否能提升弱监督动作分割的性能,优于传统的IDT特征?
- RQ3现有在IDT特征上训练的弱监督动作分割模型是否能直接应用于I3D特征而不会导致性能下降?
- RQ4通过PCA降低I3D特征维度是否能提升在Breakfast数据集上的模型性能?
- RQ5在使用PCA-I3D特征时,时序上下文窗口大小如何影响模型性能?
主要发现
- 五次训练运行之间的性能标准差在1.0%至2.51%之间,表明存在显著的波动,因此建议报告均值与标准差,而非单次运行结果。
- 使用I3D特征导致性能急剧下降——NNV的MoF从IDT的40.6%降至I3D的11.4%,表明模型对这类特征的泛化能力极差。
- 经过PCA降维的I3D特征(PCA-I3D)虽提升了性能,但仍逊于IDT特征,CDFL在PCA-I3D上达到38.0%的MoF,而IDT上为48.9%。
- MuCon在IDT特征上表现欠佳(MoF为40.2%),但在I3D(48.3%)和PCA-I3D(47.7%)上显著提升,表明其对特征类型的敏感性具有模型特异性。
- 在NNV模型中,使用PCA-I3D特征时,更小的时序窗口大小(如1帧)提升了性能,表明在使用I3D特征时,局部时序上下文更为关键。
- 结果表明,当前的弱监督模型对特征分布偏移并不鲁棒,且I3D特征在未进行网络架构或超参数调整的情况下,可能并不适用于Breakfast数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。