[论文解读] Exploiting Long-Term Dependencies for Generating Dynamic Scene Graphs
本文提出 DSG-DETR,一种动态场景图检测 Transformer 模型,通过基于物体级别的轨迹片段(tracklets)和两个专用 Transformer 模型,分别建模物体一致性与关系动态,以捕捉长期时间依赖性。该方法在 Action Genome 数据集上实现了最先进(SOTA)的性能,显著优于先前方法,且接近使用真实物体轨迹估计的性能上限。
Dynamic scene graph generation from a video is challenging due to the temporal dynamics of the scene and the inherent temporal fluctuations of predictions. We hypothesize that capturing long-term temporal dependencies is the key to effective generation of dynamic scene graphs. We propose to learn the long-term dependencies in a video by capturing the object-level consistency and inter-object relationship dynamics over object-level long-term tracklets using transformers. Experimental results demonstrate that our Dynamic Scene Graph Detection Transformer (DSG-DETR) outperforms state-of-the-art methods by a significant margin on the benchmark dataset Action Genome. Our ablation studies validate the effectiveness of each component of the proposed approach. The source code is available at https://github.com/Shengyu-Feng/DSG-DETR.
研究动机与目标
- 探究捕捉长期时间依赖性是否能显著提升从视频中生成动态场景图的性能。
- 量化利用真实物体轨迹作为性能上限时,长期一致性带来的性能增益。
- 开发一种方法,在不依赖真实轨迹的情况下,通过利用预测的物体轨迹片段,实现接近最优的性能。
- 证明在长序列上同时建模物体一致性和关系动态演变,可提升场景图预测的准确性。
提出的方法
- 通过在帧间预测检测结果上使用匈牙利匹配算法,实时构建基于物体的轨迹片段,以确保时间一致性。
- 采用带有正弦位置编码的 Transformer 编码器,对轨迹片段中物体表征的长期依赖性进行建模。
- 使用独立的 Transformer 编码器对主语-宾语关系类别随时间的演变进行建模,将 STTran 中的时间解码器替换为时间编码器。
- 将时间位置嵌入引入物体 Transformer 中,以增强对序列中物体身份的建模能力。
- 联合利用物体与关系 Transformer,通过长程时间上下文共同优化预测结果。
- 在 Action Genome 数据集上端到端训练,采用联合检测与场景图生成损失函数。
实验结果
研究问题
- RQ1在物体与关系序列中建模长期时间依赖性,是否能显著提升动态场景图生成性能?
- RQ2通过使用真实物体轨迹作为上限,可实现多大程度的性能增益?
- RQ3在仅使用预测轨迹片段的条件下,模型能否实现接近该上限的性能?
- RQ4在长序列上同时捕捉物体一致性与关系动态演变,是否能带来优于短期建模的泛化能力?
主要发现
- DSG-DETR 在 Action Genome 基准测试中实现了最先进性能,在 SGCls 与 SGDet 两种评估设置下,显著优于现有方法。
- 假设使用真实物体轨迹的最优情况,性能相比当前方法有显著提升,验证了长期依赖性的重要性。
- DSG-DETR 接近该性能上限,表明长期依赖性是提升动态场景图生成性能的关键因素。
- 消融实验表明,加入位置编码的物体 Transformer 在约束条件下将 R@K 提升 0.2 个百分点,而具有长期建模能力的关系 Transformer 相比 STTran 提升 0.3 个百分点。
- 与基线相比,长期时间上下文使 SGG 性能提升 3–6 个百分点,而短期上下文仅提升 3–4 个百分点,凸显长程建模的关键作用。
- 定性结果表明,DSG-DETR 能够正确恢复误分类的物体(例如将 'dish' 识别为 'food'),并在遮挡和运动情况下保持预测一致性,而 STTran 和 Faster R-CNN 则无法做到。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。