Skip to main content
QUICK REVIEW

[논문 리뷰] UnrealCV: Connecting Computer Vision to Unreal Engine

Weichao Qiu, Alan Yuille|arXiv (Cornell University)|2016. 09. 05.
Advanced Image and Video Retrieval Techniques참고 문헌 20인용 수 14
한 줄 요약

UnrealCV는 Unreal Engine 4용 오픈소스 플러그인으로, 컴퓨터 비전 연구자들이 내부 게임 데이터 구조에 액세스하고 수정할 수 있게 해주며, 카메라의 프로그래밍 제어, 세부 지도 데이터(예: 깊이, 인스턴스 마스크) 추출, AI 프레임워크와의 통합을 가능하게 합니다. 이는 매우 현실적인 가상 환경에서 합성 데이터셋 생성과 딥 네트워크 평가를 가능하게 하며, Faster R-CNN 객체 검출에서 뚜렷한 시점 의존적 성능 변동을 입증합니다.

ABSTRACT

Computer graphics can not only generate synthetic images and ground truth but it also offers the possibility of constructing virtual worlds in which: (i) an agent can perceive, navigate, and take actions guided by AI algorithms, (ii) properties of the worlds can be modified (e.g., material and reflectance), (iii) physical simulations can be performed, and (iv) algorithms can be learnt and evaluated. But creating realistic virtual worlds is not easy. The game industry, however, has spent a lot of effort creating 3D worlds, which a player can interact with. So researchers can build on these resources to create virtual worlds, provided we can access and modify the internal data structures of the games. To enable this we created an open-source plugin UnrealCV (http://unrealcv.github.io) for a popular game engine Unreal Engine 4 (UE4). We show two applications: (i) a proof of concept image dataset, and (ii) linking Caffe with the virtual world to test deep network algorithms.

연구 동기 및 목표

  • 컴퓨터 비전 연구와 Unreal Engine 4 게임 엔진의 풍부한 3차원 자원 및 렌더링 기능을 연결하기 위해.
  • 기존의 게임 및 VR 콘텐츠를 활용하여 수동으로 합성 가상 세계를 구축하는 데서 오는 한계를 극복하기 위해.
  • AI 훈련 및 평가를 위한 카메라 상태, 객체 위치, 장면 기하학 등 내부 데이터 구조에 대한 프로그래밍 제어 접근을 제공하기 위해.
  • Caffe와 같은 딥 러닝 프레임워크와의 통합을 통해 가상 환경에서 엔드 투 엔드 알고리즘 테스트를 가능하게 하기 위해.
  • 깊이, 노멀, 인스턴스 세그멘테이션 마스크 등을 포함한 풍부한 애너테이션을 가진 대규모이고 다양한 합성 데이터셋의 생성을 지원하기 위해.

제안 방법

  • Unreal Engine 4의 내부 게임 엔진 데이터를 표준화된 API를 통해 노출하는 오픈소스 Unreal Engine 4 플러그인인 UnrealCV의 개발.
  • 카메라 위치, 방향 설정 및 이미지 및 지도 데이터를 추출하기 위해 UnrealCV의 명령줄 인터페이스(vset, vget 등)의 사용.
  • 실시간 추론 및 훈련을 가능하게 하기 위해 외부 AI 시스템(예: Caffe)과 가상 세계의 통합.
  • 랜덤화된 카메라 위치, 조명 및 객체 구성으로 이미지 및 애너테이션 생성을 스크립트 기반으로 자동화.
  • UnrealCV의 카메라 및 상태 제어 기능을 활용한 프로그래밍 가능한 탐색 및 인지 기능을 갖춘 가상 에이전트의 구현.
  • Unreal Engine 마켓플레이스 및 오픈소스 프로젝트에서 확보한 실제 세계 데이터셋 및 3차원 자원을 테스트 가능한 가상 환경으로 변환.

실험 결과

연구 질문

  • RQ1게임 엔진이 컴퓨터 비전 연구를 위해 내부 시나리오 데이터에 대한 프로그래밍 제어 접근을 지원하도록 확장할 수 있는가?
  • RQ2UnrealCV를 사용해 Unreal Engine 4에서 생성된 합성 데이터셋이 시각 알고리즘 훈련 및 테스트에 필요한 다양성과 현실성과 얼마나 일치하는가?
  • RQ3통제된 사진처럼 사실적인 가상 환경에서 테스트할 때, Faster R-CNN과 같은 딥 러닝 모델이 시점 변화에 얼마나 민감한가?
  • RQ4UnrealCV가 AI 프레임워크와 가상 세계 간의 원활한 통합을 가능하게 하여 엔드 투 엔드 알고리즘 평가를 가능하게 하는가?
  • RQ53차원 콘텐츠의 다양성과 물리적 현실성 측면에서 현재의 합성 데이터 생성 파이프라인의 한계는 무엇인가?

주요 결과

  • UnrealCV는 Unreal Engine 4에서 카메라 상태, 객체 위치, 장면 기하학에 대한 완전한 프로그래밍 제어 접근을 가능하게 하여 가상 세계의 인지에 정밀한 제어를 가능하게 합니다.
  • 시스템은 랜덤화된 카메라 위치와 장면 파rameter를 사용하여 동기화된 RGB, 깊이, 표면 노멀, 인스턴스 마스크를 포함한 합성 이미지 데이터셋을 성공적으로 생성했습니다.
  • Faster R-CNN의 소파 검출에 대한 평균 정밀도(AP)는 카메라 시점에 따라 0.1에서 1.0로 크게 변동하여 시점에 매우 민감함을 보여줍니다.
  • 일부 방위각/고도 각도에서 소파가 보이지 않을 경우 AP가 0.0으로 떨어져, 가시성과 가림이 검출 성능에 크게 영향을 준다는 것을 확인했습니다.
  • 조명, 재질 특성, 카메라 설정을 다양화함으로써 알고리즘의 강건성에 대한 체계적 평가가 가능했습니다.
  • Caffe와 UnrealCV의 통합은 사진처럼 사실적인 시뮬레이션 환경에서 딥 네트워크의 실시간 추론 및 테스트를 가능하게 했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.