[论文解读] Commonly Uncommon: Semantic Sparsity in Situation Recognition
本文通过引入一种新型张量组合函数的组合CRF模型,解决了情境识别中的语义稀疏性问题,该函数在名词-角色组合间共享表示,并提出了一种基于网页搜索查询的语义数据增强技术,以提升罕见输出的预测性能。联合方法在top-5动词和名词-角色准确率上分别实现了6.23%和9.57%的相对提升,显著优于最先进基线模型在罕见和未见配置下的表现。
Semantic sparsity is a common challenge in structured visual classification problems; when the output space is complex, the vast majority of the possible predictions are rarely, if ever, seen in the training set. This paper studies semantic sparsity in situation recognition, the task of producing structured summaries of what is happening in images, including activities, objects and the roles objects play within the activity. For this problem, we find empirically that most object-role combinations are rare, and current state-of-the-art models significantly underperform in this sparse data regime. We avoid many such errors by (1) introducing a novel tensor composition function that learns to share examples across role-noun combinations and (2) semantically augmenting our training data with automatically gathered examples of rarely observed outputs using web data. When integrated within a complete CRF-based structured prediction model, the tensor-based approach outperforms existing state of the art by a relative improvement of 2.11% and 4.40% on top-5 verb and noun-role accuracy, respectively. Adding 5 million images with our semantic augmentation techniques gives further relative improvements of 6.23% and 9.57% on top-5 verb and noun-role accuracy.
研究动机与目标
- 解决情境识别中的语义稀疏性问题,即大多数名词-角色组合在训练数据中极为罕见或未见。
- 提升结构化视觉分类中对罕见和未登录词预测的性能。
- 开发一种组合CRF模型,通过低维嵌入在名词-角色组合间共享表示。
- 提出一种基于网页搜索查询的语义数据增强策略,用于为罕见输出生成合成训练样本。
- 证明将组合建模与基于网页的数据增强相结合,可在罕见预测上带来显著性能提升。
提出的方法
- 提出一种新型张量组合函数,将名词和角色的低维嵌入组合为CRF因子的共享全局参数化得分。
- 使用深度神经网络预测图像级特征,再通过张量函数同时对所有名词-角色组合进行组合评分。
- 通过生成简短搜索查询(如“man carrying baby”)从网页检索图像,实现语义数据增强,用于罕见名词-角色对。
- 通过边缘似然优化将检索到的图像整合到预训练中,实现对未标注语义方面的软聚类。
- 采用自训练策略,利用模型预测结果筛选并重新训练高置信度的网页衍生样本。
- 将组合CRF与语义增强方法整合到一个完整的结构化预测流程中,采用条件随机场(CRF)建模。
实验结果
研究问题
- RQ1一种在名词-角色组合间共享表示的组合CRF模型,能否提升罕见情境识别输出的性能?
- RQ2基于网页的语义数据增强在多大程度上能提升对未见或低资源名词-角色组合的泛化能力?
- RQ3所提出的组件——组合建模与语义增强——如何相互作用以减少罕见预测的性能下降?
- RQ4张量组合与基于网页的数据增强相结合,是否能在不同频率区间的训练数据中均带来一致的性能提升?
- RQ5该模型能否在训练过程中未见过的零样本或少样本名词-角色组合上实现有效泛化?
主要发现
- 所提出的组合CRF结合张量组合方法,在imSitu开发集上相较基线CRF模型,将top-5动词准确率提升2.11%,名词-角色准确率提升4.40%。
- 利用500万张网页图像进行语义数据增强,使top-5动词准确率相对提升6.23%,top-5名词-角色准确率相对提升9.57%。
- 联合模型在罕见预测(训练样本少于10个)的平均指标上实现了8.76%的相对提升。
- 性能提升最大的部分出现在需要5至35个训练样本的预测上,表明对低频但非极端罕见情况具有显著优势。
- 该模型在罕见配置下显著优于基线模型,最高提升出现在5–35个样本区间,表明对低资源输出具有良好的泛化能力。
- 在完整的imSitu测试集上,最终模型保持了强劲性能,所有评估指标均实现一致提升,尤其在罕见和未见名词-角色对上表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。