[论文解读] The AAU Multimodal Annotation Toolboxes: Annotating Objects in Images and Videos
本论文提出两款基于C++的开源标注工具箱——Bounding Box Annotator与Multimodal Pixel Annotator——专为图像和视频中高效、多模态(RGB与热成像)目标标注而设计。基于OpenCV与Qt构建,支持像素掩码、边界框、分类标签、唯一ID及元数据,具备GrabCut分割、多边形绘制、无需关注区域边界(don't-care borders)及批量帧标注等功能,可高效标注数万帧,适用于计算机视觉研究。
This tech report gives an introduction to two annotation toolboxes that enable the creation of pixel and polygon-based masks as well as bounding boxes around objects of interest. Both toolboxes support the annotation of sequential images in the RGB and thermal modalities. Each annotated object is assigned a classification tag, a unique ID, and one or more optional meta data tags. The toolboxes are written in C++ with the OpenCV and Qt libraries and are operated by using the visual interface and the extensive range of keyboard shortcuts. Pre-built binaries are available for Windows and MacOS and the tools can be built from source under Linux as well. So far, tens of thousands of frames have been annotated using the toolboxes.
研究动机与目标
- 为计算机视觉研究中日益增长的高质量、领域特定标注数据集需求提供解决方案。
- 提供高效、跨平台的工具,用于标注序列化RGB与热成像图像序列中的目标。
- 支持灵活的标注格式,包括像素掩码、边界框及元数据标签,适用于多样化的视觉应用。
- 通过键盘快捷键、帧保留及批量处理功能,优化长期标注工作流。
- 支持不同成像模态(可见光与热成像)之间的多模态标注,以提升视觉系统训练的鲁棒性。
提出的方法
- 工具采用C++实现,基于Qt框架构建图形用户界面,利用OpenCV进行图像处理,确保在Windows、macOS及Linux系统上的跨平台兼容性。
- Bounding Box Annotator 允许用户绘制矩形边界框,并为每个目标分配类别标签、ID及元数据标签。
- Multimodal Pixel Annotator 支持通过GrabCut、手动画笔绘制及多边形轮廓绘制实现像素级分割,以生成精确的掩码。
- 通过“加载前一帧/后一帧时保留”功能,实现帧间标注的时序一致性传播。
- 支持无需关注区域边界(灰度值170),可通过设置进行配置。
- 标注数据以单一CSV文件(含图像路径与元数据)形式存储,可选地同时保存为灰度掩码图像,支持导出至COCO与边界框格式。
实验结果
研究问题
- RQ1如何设计标注工具以高效支持图像序列中多模态(RGB与热成像)目标的标注?
- RQ2哪些功能最有效于缩短大规模数据集的标注时间并提升标注一致性?
- RQ3如何在统一且可扩展的工具框架中结合像素级分割与边界框标注?
- RQ4交互式工具(如GrabCut与手动画笔)在提升复杂目标边界分割质量方面发挥何种作用?
- RQ5元数据标签与目标追踪状态(如“已到达最后一帧”)如何增强标注数据在下游视觉任务中的实用性?
主要发现
- 该标注工具箱已在包括人类、道路使用者、动物及工业缺陷在内的多样化领域中,用于标注数万帧图像。
- 工具支持多模态标注,可在RGB与热成像图像序列间实现一致的标注,提升视觉系统鲁棒性。
- GrabCut、手动画笔与多边形工具的集成,支持灵活且精确的像素级分割,并可通过迭代方式优化。
- 通过唯一ID、分类标签及可自定义的元数据标签,实现结构化、可搜索且可重用的标注数据。
- 支持逐帧标注并具备帧保留与插值功能,显著减少视频序列中重复性工作。
- 支持导出至COCO与边界框格式,确保与主流深度学习框架及基准测试流程的兼容性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。