[论文解读] An Active Learning Based Approach For Effective Video Annotation And Retrieval
本文提出 CRMActive,一种将不确定性、密度和多样性度量整合到基于聚类的样本选择策略中的主动学习框架,用于视频注释与检索。通过结合 NormCRM 生成模型,CRMActive 在 TRECVID 和 SmartBody 数据集上均优于随机基线和最先进基线方法,展现出更快的收敛速度和在极少标注成本下的持续性能提升。
Conventional multimedia annotation/retrieval systems such as Normalized Continuous Relevance Model (NormCRM) [16] require a fully labeled training data for a good performance. Active Learning, by determining an order for labeling the training data, allows for a good performance even before the training data is fully annotated. In this work we propose an active learning algorithm, which combines a novel measure of sample uncertainty with a novel clustering-based approach for determining sample density and diversity and integrate it with NormCRM. The clusters are also iteratively refined to ensure both feature and label-level agreement among samples. We show that our approach outperforms multiple baselines both on a recent, open character animation dataset and on the popular TRECVID corpus at both the tasks of annotation and text-based retrieval of videos.
研究动机与目标
- 通过减少对完全标注训练数据的需求,解决多媒体系统中高昂的人工标注成本问题。
- 通过在主动学习设置中选择最具信息量的样本进行标注,提升视频注释与检索性能。
- 将不确定性、密度与多样性度量整合到统一的样本选择策略中,以提升模型学习效率。
- 在真实世界视频数据集(包括 TRECVID 和角色动画数据集)上评估所提方法的有效性。
- 证明通过 NormCRM 联合建模特征与标签,再结合主动学习,可获得优于独立分类器训练的性能表现。
提出的方法
- 提出一种基于最高k个与第(k+1)个最相关标签概率之间差距的新颖不确定性度量:$\text{unct}(\mathbf{x}) = \frac{1}{P(w_1|\mathbf{x}) - P(w_{k+1}|\mathbf{x})}$。
- 引入一种聚类优化方法,用于估计样本的密度与多样性,确保所选样本具有代表性且彼此不同。
- 采用迭代聚类方法,提升样本间特征与标签的一致性,增强主动学习过程中模型的鲁棒性。
- 将样本选择引擎与 NormCRM(一种联合建模特征与标签的生成模型)集成,以提升注释与检索性能。
- 采用批量主动学习策略,每轮迭代基于综合信息量得分选择最前K个最具信息量的样本。
- 在每个批次中,从标注数据重新估计密度加权参数 $\gamma_d$,并为不确定性、密度与多样性分量分配相等权重($\lambda_i = \frac{1}{3}$)。
实验结果
研究问题
- RQ1一种结合不确定性、密度与多样性的新颖主动学习策略,是否能以极少标注成本显著提升视频注释与检索性能?
- RQ2所提出的 CRMActive 框架在注释与检索准确率方面,相较于随机标注与最先进主动学习基线方法,表现如何?
- RQ3通过 NormCRM 联合建模特征与标签,相较于为每个概念独立训练分类器,性能提升程度如何?
- RQ4聚类的迭代优化是否能提升标签与特征的一致性,从而在主动学习过程中实现更稳健的模型更新?
- RQ5CRMActive 是否能在完全标注完成前即实现高性能表现,特别是在标注的早期轮次中?
主要发现
- 在 TRECVID 2007 和 SmartBody 数据集上,CRMActive 的注释性能均优于随机基线和 Zha 等人提出的最先进方法。
- 使用 CRMActive 进行注释的平均精度(AP)得分在各轮次中呈现单调非递减趋势,表明每轮标注后性能均稳定且持续提升。
- 在 SmartBody 数据集上,CRMActive 在第7轮即能为样本正确预测前6个标签,即使在完全标注完成前也已实现快速模型收敛。
- 针对 SmartBody 数据集中各个独立概念,CRMActive 在所有概念上均保持或超过其他所有模型的性能表现,包括正样本数量极少的概念。
- 基于 NormCRM 的模型(包括 CRMActive 和随机基线)显著优于 Zha 等人提出的方法,后者为每个概念独立训练分类器,原因在于前者对标签相关性的建模更优。
- 对于复杂概念(如“Dance”),性能提升尤为显著,表明联合特征-标签建模能捕捉比孤立分类器更丰富的语义模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。