[论文解读] SFU-HW-Tracks-v1: Object Tracking Dataset on Raw Video Sequences
本论文提出了 SFU-HW-Tracks-v1,一个基于未压缩 HEVC Common Test Condition 视频序列的新视频目标跟踪数据集,为 13 个序列提供了每帧的标注,并为每个目标分配了唯一对象 ID。该数据集通过结合归一化互相关与人工验证的半自动方法,扩展了 SFU-HW-Objects-v1,实现了身份保持的标注,从而支持视频目标跟踪模型的训练与评估。
We present a dataset that contains object annotations with unique object identities (IDs) for the High Efficiency Video Coding (HEVC) v1 Common Test Conditions (CTC) sequences. Ground-truth annotations for 13 sequences were prepared and released as the dataset called SFU-HW-Tracks-v1. For each video frame, ground truth annotations include object class ID, object ID, and bounding box location and its dimensions. The dataset can be used to evaluate object tracking performance on uncompressed video sequences and study the relationship between video compression and object tracking.
研究动机与目标
- 为解决在未压缩视频序列上缺乏公开可用、高质量的具有身份分辨标注的视频目标跟踪数据集的问题。
- 通过为现有 SFU-HW-Objects-v1 数据集添加唯一对象标识符(ID),实现视频目标跟踪模型的训练与评估。
- 通过在原始视频序列上提供真实标注,研究视频压缩对目标跟踪性能的影响。
- 通过提供面向特定任务、高保真度的数据集,支持视频编码用于机器(VCM)的标准化工作。
- 建立可复现的半自动流程,利用外观相似性与人工验证,在帧之间保持一致的对象身份分配。
提出的方法
- 该数据集通过在 SFU-HW-Objects-v1(提供类别标签和边界框)的基础上,为每帧中的每个对象添加唯一对象 ID 而构建。
- 通过使用归一化互相关(NCC)来测量连续帧中边界框之间的相似性,实现帧间对象 ID 的分配。
- 对于第 n 帧中的每个对象,基于最高 NCC 分数从第 n+1 帧中选择最佳匹配对象,使用 0.6 的阈值(可调范围为 0.55 至 0.75)判断匹配是否有效。
- 若 NCC 分数低于阈值,则通过 Yolo_mark 进行标注可视化后,人工为该对象分配新 ID。
- 首次出现或在遮挡后重新出现的对象被分配新 ID,此类情况下的 NCC 分数设为 -1,以表示无先前匹配。
- 标注过程遵循逐帧的半自动工作流程,确保在序列中保持一致的对象身份追踪。
实验结果
研究问题
- RQ1如何在具有身份分辨标注的原始未压缩视频序列上评估目标跟踪性能?
- RQ2视频压缩在多大程度上影响目标跟踪精度?如何利用原始视频上的真实标注数据集来研究这一问题?
- RQ3结合外观相似性与人工验证的半自动方法,能否在视频帧之间产生可靠且一致的对象 ID 分配?
- RQ4对象外观变化与遮挡对跟踪性能的影响是什么?如何在基准数据集中对这些因素进行建模?
- RQ5与仅包含类别标签的数据集相比,包含唯一对象 ID 的数据集在训练和测试视频目标跟踪模型方面有何改进?
主要发现
- SFU-HW-Tracks-v1 数据集包含 13 个 HEVC CTC 视频序列的真实标注,每帧包含对象类别 ID、唯一对象 ID 以及归一化边界框坐标(x, y, w, h)。
- 该数据集支持视频目标跟踪模型的训练与评估,而此前由于缺乏对象身份信息,SFU-HW-Objects-v1 数据集无法实现此功能。
- 半自动标注流程通过基于 NCC 的匹配(阈值为 0.6)与人工校正相结合,实现了稳定一致的对象 ID 分配,确保了帧间身份的连续性。
- 当外观相似度较高时,对象 ID 在帧间得以保持;当对象首次进入场景或在遮挡后重新出现时,则分配新 ID。
- 该数据集可在 https://doi.org/10.17632/d5cc83ks6c 公开获取,支持可复现研究,并推动视频编码用于机器(VCM)的标准化。
- 每个序列包含 4 至 6 个对象类别,类别 ID 映射至 COCO 对象类别,支持包含运动、遮挡和尺度变化等多种跟踪场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。