[论文解读] GeneAnnotator: A Semi-automatic Annotation Tool for Visual Scene Graph
GeneAnnotator 是一种半自动、开源的 Python 工具,用于视觉场景图标注,可实现高效、可定制且交互式的图像中对象、关系、属性、区域和聚类的标注。它通过基于规则的关系推荐机制减少标注工作量,并被用于构建 Traffic Genome 数据集,该数据集为高密度的 1,000 张图像的交通场景图数据集,在属性覆盖度和关系密度方面优于 Visual Genome 和 VG150。
In this manuscript, we introduce a semi-automatic scene graph annotation tool for images, the GeneAnnotator. This software allows human annotators to describe the existing relationships between participators in the visual scene in the form of directed graphs, hence enabling the learning and reasoning on visual relationships, e.g., image captioning, VQA and scene graph generation, etc. The annotations for certain image datasets could either be merged in a single VG150 data-format file to support most existing models for scene graph learning or transformed into a separated annotation file for each single image to build customized datasets. Moreover, GeneAnnotator provides a rule-based relationship recommending algorithm to reduce the heavy annotation workload. With GeneAnnotator, we propose Traffic Genome, a comprehensive scene graph dataset with 1000 diverse traffic images, which in return validates the effectiveness of the proposed software for scene graph annotation. The project source code, with usage examples and sample data is available at https://github.com/Milomilo0320/A-Semi-automatic-Annotation-Software-for-Scene-Graph, under the Apache open-source license.
研究动机与目标
- 解决视觉关系理解领域中缺乏可访问、可定制且高效的场景图标注工具的问题。
- 通过半自动关系推荐机制,减轻场景图构建中的手动标注负担。
- 使研究人员能够为特定领域(如自动驾驶)构建定制化、高质量的场景图数据集。
- 提供模块化、可扩展的软件架构,支持多种数据格式,并与现有场景图学习模型集成。
- 通过构建 Traffic Genome 数据集,证明该工具的有效性,该数据集是面向交通场景理解的全面、开源数据集。
提出的方法
- 实现一种模块化系统架构,包含三个独立组件:主标注模块、半自动标注模块和辅助功能模块。
- 支持用户自定义对象和关系类别、层级结构及属性,以实现领域特定的定制化。
- 集成基于规则的关系推荐引擎,根据对象类型和空间配置推荐合理的关系。
- 支持通过边界框标注区域,以及对邻近对象群组(聚类)进行标注,以提升标注效率和语义相关性。
- 通过 GUI 实时可视化动态演化的场景图,实现即时反馈与验证。
- 以统一的 VG150 兼容格式和每张图像独立格式导出标注结果,确保与现有场景图模型的广泛兼容性。
实验结果
研究问题
- RQ1半自动标注工具是否能显著减少构建高质量视觉场景图所需的时间与精力?
- RQ2引入感兴趣区域和聚类级别标注在多大程度上提升了标注效率和场景图质量?
- RQ3基于规则的关系推荐在准确性和相关性方面与人工标注的关系相比,能达到何种程度?
- RQ4与现有基准(如 Visual Genome 和 VG150)相比,所生成的数据集(Traffic Genome)在对象和关系密度、属性覆盖度及结构完整性方面表现如何?
- RQ5所生成的数据集是否能有效支持最先进场景图生成模型的训练与评估?
主要发现
- Traffic Genome 在 1,000 张图像中包含 29,192 个关系,平均每张图像 29.19 个关系,超过 Visual Genome(14.17)和 VG150(5.76)的平均值两倍以上。
- Traffic Genome 中每个对象的平均关系数为 3.02,显著高于 Visual Genome 的 1.36 和 VG150 的 2.02,表明其场景图结构更加密集。
- 43.85% 的关系为空间关系(如“在左侧”),42.04% 为区域关系(如“在……上行驶”),凸显其在空间推理方面的强覆盖能力。
- Traffic Genome 实现了 100% 的属性覆盖度,包含方向属性(向前、向左、向右、向后),优于 Visual Genome 的 58.65% 和 VG150 的 53.66%。
- 在 Traffic Genome 上微调的场景图模型在谓词分类任务中表现优异,VCTree 模型的 mR@100 得分为 24.85,VCTree-TDE 模型为 20.87,接近或超过在 VG150 上的结果。
- GeneAnnotator 的半自动功能与模块化设计实现了高效、可扩展且可扩展的标注流程,其有效性通过构建高质量、领域特定的数据集得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。