Skip to main content
QUICK REVIEW

[论文解读] ResearchDoom and CocoDoom: Learning Computer Vision with Games

Aravindh Mahendran, Hakan Bilen|arXiv (Cornell University)|Oct 7, 2016
Human Pose and Action Recognition参考文献 6被引用 14
一句话总结

本文介绍了ResearchDoom,一种经过修改的Doom游戏引擎,可在游戏过程中提取详细的3D元数据,如深度图、物体实例掩码和自身运动信息;以及CocoDoom,一个大规模、预先标注的50万张图像数据集,采用MS COCO格式的标注。该数据集可直接用于计算机视觉模型的训练与评估,涵盖目标检测、实例分割、深度估计和跟踪任务,无需强化学习,提供了一种可扩展、无错误的合成数据来源。

ABSTRACT

In this short note we introduce ResearchDoom, an implementation of the Doom first-person shooter that can extract detailed metadata from the game. We also introduce the CocoDoom dataset, a collection of pre-recorded data extracted from Doom gaming sessions along with annotations in the MS Coco format. ResearchDoom and CocoDoom can be used to train and evaluate a variety of computer vision methods such as object recognition, detection and segmentation at the level of instances and categories, tracking, ego-motion estimation, monocular depth estimation and scene segmentation. The code and data are available at http://www.robots.ox.ac.uk/~vgg/research/researchdoom.

研究动机与目标

  • 为计算机视觉领域日益增长的大规模、精确标注训练数据需求提供解决方案。
  • 实现无需强化学习即可直接使用视频游戏生成的合成数据对计算机视觉模型进行训练与评估。
  • 通过提供预先计算、采用COCO格式的数据集,降低研究人员的入门门槛。
  • 证明像Doom这样的视频游戏环境可作为可靠、可扩展的合成数据来源,具备丰富的监督信号。
  • 通过提供与现有COCO工具兼容的即插即用型数据集,推动合成数据在计算机视觉领域的广泛应用。

提出的方法

  • 扩展开源Chocolate Doom引擎,以在游戏过程中提取每帧的元数据,包括RGB外观、深度图、物体实例掩码和自身运动信息。
  • 使用确定性游戏会话,确保数据在不同运行之间完全可复现。
  • 从Doom II的三次完整游戏通关中生成数据,帧以PNG格式保存,元数据记录在结构化文本文件中。
  • 采用MS COCO格式对物体标注进行处理,包括实例ID、类别标签和基于多边形的边界框。
  • 创建两个数据子集:'standard'(1/5的帧,8万张图像,30万条标注)和'full'(50万张图像,140万条标注),均包含深度图和像素级分割信息。
  • 定义两种数据划分方式——'run'和'episode'——以支持多样化的评估协议,其中'episode'划分更具挑战性,因其在地图级别上分离了训练、验证和测试集。

实验结果

研究问题

  • RQ1像Doom这样的视频游戏环境能否作为具备丰富自动标注的可扩展合成数据来源?
  • RQ2带有详细元数据的预录制游戏数据在多大程度上可支持无需强化学习的视觉模型直接训练?
  • RQ3与真实世界数据集相比,CocoDoom在目标检测、实例分割、深度估计和跟踪任务中作为基准的效能如何?
  • RQ4使用像Doom这样一致且受控的游戏环境,是否能提高计算机视觉实验的可靠性与可复现性?
  • RQ5在合成数据中包含深度图和像素级分割信息,对单目深度估计与分割模型的性能有何影响?

主要发现

  • CocoDoom数据集在标准子集中包含约8万张图像和30万条物体实例标注,在完整子集中包含50万张图像和140万条标注。
  • 数据集包含详细的元数据,如深度图、物体掩码和自身运动信息,均来自确定性游戏过程,保真度高。
  • 对物体类别进行了筛选,仅保留训练集中图像数量不少于100张的类别,最终得到94种不同的物体类型。
  • 与'run'划分相比,'episode'划分通过在不同游戏地图上分离训练、验证和测试集,提供了更具挑战性的评估协议。
  • 该数据集与MS COCO格式兼容,可直接集成至现有的计算机视觉流水线与基准测试工具中。
  • 作者证明,来自视频游戏的合成数据可为训练和评估各类计算机视觉模型提供丰富、可扩展且无错误的监督信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。