[论文解读] Structured Label Inference for Visual Understanding
本文提出一种基于图的结构化推理框架,采用双向结构化推理神经网络(BINN/SINN),用于建模视觉理解任务中层次化和相关的标签关系。通过利用LSTM扩展整合标签空间依赖关系和时序动态,该方法在多标签图像与视频分类及动作检测任务中取得显著性能提升,THUMOS数据集上mAP最高达43.9%,MultiTHUMOS数据集上达31.5%,优于强基线模型。
Visual data such as images and videos contain a rich source of structured semantic labels as well as a wide range of interacting components. Visual content could be assigned with fine-grained labels describing major components, coarse-grained labels depicting high level abstractions, or a set of labels revealing attributes. Such categorization over different, interacting layers of labels evinces the potential for a graph-based encoding of label information. In this paper, we exploit this rich structure for performing graph-based inference in label space for a number of tasks: multi-label image and video classification and action detection in untrimmed videos. We consider the use of the Bidirectional Inference Neural Network (BINN) and Structured Inference Neural Network (SINN) for performing graph-based inference in label space and propose a Long Short-Term Memory (LSTM) based extension for exploiting activity progression on untrimmed videos. The methods were evaluated on (i) the Animal with Attributes (AwA), Scene Understanding (SUN) and NUS-WIDE datasets for multi-label image classification, (ii) the first two releases of the YouTube-8M large scale dataset for multi-label video classification, and (iii) the THUMOS'14 and MultiTHUMOS video datasets for action detection. Our results demonstrate the effectiveness of structured label inference in these challenging tasks, achieving significant improvements against baselines.
研究动机与目标
- 通过建模超越独立标签假设的复杂层次化标签关系,提升多标签图像与视频分类性能。
- 通过利用结构化标签依赖关系,解决部分观测标签的挑战,实现缺失标签的准确推理。
- 通过引入LSTM增强的结构化推理框架,将静态标签推理扩展至未修剪视频,建模动作的时序演进过程。
- 在AwA、SUN、NUS-WIDE、YouTube-8M、THUMOS和MultiTHUMOS等多样化基准上,展示一致的性能提升。
提出的方法
- 构建标签关系图,其中节点表示语义标签,边编码层次关系与共现关系,实现标签之间的双向信息流动。
- 采用结构化推理神经网络(SINN)在标签节点间传播激活,通过从粗粒度到细粒度标签的堆叠式分层连接,优化预测结果。
- 引入基于LSTM的扩展(siLSTM),将结构化标签信息融入隐藏状态,建模未修剪视频中动作的时序演进。
- 应用双向推理(biLSTM)以捕捉标签序列中的前向与后向时序依赖,提升动作检测性能。
- 利用WordNet自动构建标签图,无需人工设计,支持零样本或少样本标签推理。
- 采用阈值预测(0.5)进行时间线可视化与评估,与标准动作检测指标保持一致。
实验结果
研究问题
- RQ1基于图神经网络的结构化标签推理能否在超越独立标签假设的前提下,提升多标签图像分类性能?
- RQ2在大型视频数据集(如YouTube-8M)中,结构化标签推理在部分观测标签场景下的有效性如何?
- RQ3通过LSTM增强的结构化推理进行时序建模,能否在未修剪视频中实现比标准RNN基线更优的密集动作检测性能?
- RQ4同时引入层次化标签依赖与时序动态,对视觉理解任务性能的提升程度如何?
主要发现
- 单帧SINN模型在THUMOS上达到38.2% mAP,在MultiTHUMOS上达到27.0%,较单帧CNN基线分别提升2.7%与2.4%。
- 基于LSTM的模型在THUMOS上mAP提升至41.8%,在MultiTHUMOS上达30.5%,较CNN基线分别提升6.3%与5.9%。
- siLSTM模型在THUMOS上达到43.9% mAP,在MultiTHUMOS上达31.5%,较LSTM基线分别提升2.1%与1.0%。
- siLSTM模型相较于LSTM基线,在THUMOS与MultiTHUMOS上分别实现2.1%与1.0%的相对增益,性能与MultiLSTM相当。
- 该方法在部分观测标签设置下表现出强鲁棒性,能更自信地预测缺失标签,优于基线模型。
- 图7的时间线可视化结果表明,siLSTM生成的标签预测比单帧或标准LSTM基线更准确且时序上更一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。