Skip to main content
QUICK REVIEW

[논문 리뷰] ResearchDoom and CocoDoom: Learning Computer Vision with Games

Aravindh Mahendran, Hakan Bilen|arXiv (Cornell University)|2016. 10. 07.
Human Pose and Action Recognition참고 문헌 6인용 수 14
한 줄 요약

이 논문은 3D 메타데이터(예: 깊이 맵, 개체 인스턴스 마스크, 자가 운동 정보)를 게임 플레이 중에 추출하는 수정된 도وم 게임 엔진인 ResearchDoom과, MS COCO 형식의 애너테이션을 갖춘 50만 장의 이미지로 구성된 대규모 사전 애너테이션된 데이터셋인 CocoDoom을 소개한다. 이 데이터셋은 강화 학습 없이도 객체 검출, 세분화, 깊이 추정, 추적 등의 컴퓨터 비전 모델을 훈련하고 평가할 수 있도록 하여 확장 가능한 오류 없는 합성 데이터 소스를 제공한다.

ABSTRACT

In this short note we introduce ResearchDoom, an implementation of the Doom first-person shooter that can extract detailed metadata from the game. We also introduce the CocoDoom dataset, a collection of pre-recorded data extracted from Doom gaming sessions along with annotations in the MS Coco format. ResearchDoom and CocoDoom can be used to train and evaluate a variety of computer vision methods such as object recognition, detection and segmentation at the level of instances and categories, tracking, ego-motion estimation, monocular depth estimation and scene segmentation. The code and data are available at http://www.robots.ox.ac.uk/~vgg/research/researchdoom.

연구 동기 및 목표

  • 컴퓨터 비전 분야에서 대규모로 정확하게 애너테이션된 훈련 데이터의 증가하는 수요를 해결하기 위해.
  • 강화 학습을 초월하여 비디오 게임에서 유래한 합성 데이터를 직접 사용하여 컴퓨터 비전 모델의 훈련과 평가를 가능하게 하기 위해.
  • 세부 메타데이터를 포함한 사전 계산된 COCO 형식의 데이터셋을 제공하여 연구자들이 접근하기 쉬운 장벽을 낮추기 위해.
  • 도움과 같은 비디오 게임 환경이 풍부한 감독 신호를 제공하는 확장 가능한 신뢰할 수 있는 합성 데이터 소스로 활용될 수 있음을 입증하기 위해.
  • 기존의 COCO 기반 도구와 호환되는 즉시 사용 가능한 데이터셋을 제공하여 합성 데이터의 컴퓨터 비전 분야에서의 광범위한 채택을 촉진하기 위해.

제안 방법

  • RGB 외관, 깊이 맵, 개체 인스턴스 마스크, 자가 운동 정보 등 프레임별 메타데이터를 추출할 수 있도록 오픈소스 Chocolate Doom 엔진을 확장한다.
  • 정확한 재현 가능성을 확보하기 위해 결정론적 게임 세션을 사용한다.
  • 도움 II의 세 개의 완전한 플레이스루에서 데이터를 생성하며, 프레임은 PNG 형식으로 저장하고 메타데이터는 구조화된 텍스트 파일에 기록한다.
  • 개체 애너테이션에 MS COCO 형식을 적용하여 인스턴스 ID, 클래스 레이블, 폴리곤 기반 바운딩 박스를 포함한다.
  • 두 가지 데이터 서브셋을 생성한다: '표준'(1/5의 프레임, 8만 장의 이미지, 30만 건의 애너테이션)과 '풀'(50만 장의 이미지, 140만 건의 애너테이션)으로, 깊이 맵과 픽셀 수준의 세분화 정보를 포함한다.
  • 다양한 평가 프로토콜을 지원하기 위해 두 가지 데이터 분할 방식—'런'과 '에피소드'—을 정의하며, '에피소드' 분할은 맵 수준의 분리로 인해 더 도전적인 평가 프로토콜을 제공한다.

실험 결과

연구 질문

  • RQ1도움과 같은 비디오 게임 환경이 컴퓨터 비전을 위한 풍부한 자동 애너테이션을 갖춘 확장 가능한 합성 데이터 소스로 활용될 수 있는가?
  • RQ2세부 메타데이터가 포함된 사전 기록된 게임 데이터가 강화 학습 없이도 비전 모델의 직접 훈련을 얼마나 잘 지원할 수 있는가?
  • RQ3CocoDoom이 실제 세계 데이터셋과 비교해 객체 검출, 인스턴스 세분화, 깊이 추정, 추적 분야에서 얼마나 효과적인 벤치마크로 기능하는가?
  • RQ4도움과 같은 일관되고 제어 가능한 게임 환경의 사용이 컴퓨터 비전 실험의 신뢰성과 재현 가능성 향상에 얼마나 기여하는가?
  • RQ5합성 데이터에 깊이 맵과 픽셀 수준의 세분화 정보를 포함시키는 것이 단일 렌즈 깊이 추정 및 세분화 모델의 성능에 어떤 영향을 미치는가?

주요 결과

  • CocoDoom 데이터셋은 표준 서브셋에서 약 8만 장의 이미지와 30만 건의 개체 인스턴스 애너테이션을 포함하며, 풀 서브셋에서는 50만 장의 이미지와 140만 건의 애너테이션을 포함한다.
  • 깊이 맵, 개체 마스크, 자가 운동 정보 등 세부 메타데이터가 결정론적 게임 플레이에서 고정밀도로 추출되었다.
  • 훈련 분할에서 최소 100장의 이미지가 있는 카테고리만 유지하기 위해 개체 카테고리를 필터링하여 총 94종의 개체 유형을 확보했다.
  • 훈련, 검증, 테스트 세트가 서로 다른 게임 맵에 분리된 '에피소드' 분할은 '런' 분할보다 더 도전적인 평가 프로토콜을 제공한다.
  • 데이터셋은 MS COCO 형식과 호환되어 기존의 컴퓨터 비전 파ip라인과 벤치마크 도구에 직접 통합할 수 있다.
  • 저자들은 비디오 게임에서 유래한 합성 데이터가 다양한 컴퓨터 비전 모델의 훈련과 평가를 위한 풍부하고 확장 가능하며 오류가 없는 감독 신호를 제공할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.