Skip to main content
QUICK REVIEW

[논문 리뷰] Object Detection Using Sim2Real Domain Randomization for Robotic Applications

Dániel Horváth, Gábor Erdős|arXiv (Cornell University)|2022. 08. 08.
Advanced Image and Video Retrieval Techniques인용 수 9
한 줄 요약

이 논문은 로봇 기반 객체 검출을 위한 sim2real 도메인 랜덤라이제이션 방법을 제안하며, 단일 실존 이미지와 유일한 합성 데이터만을 사용하여 제로샷 및 원샷 전이 학습을 가능하게 한다. 광범위한 도메인 랜덤라이제이션 기법—예를 들어 랜덤 텍스처, 후처리, 물리 기반 시뮬레이션—을 적용함으로써, 실세계 산업 데이터셋에서 제로샷 시 86.32% mAP50, 원샷 시 97.38% mAP50의 성능을 달성하여, 최소한의 실세계 데이터 주석 처리로도 실시간이고 신뢰할 수 있는 객체 검출을 가능하게 한다. 이는 로봇의 피킹 및 플레이스 작업에 적합하다.

ABSTRACT

Robots working in unstructured environments must be capable of sensing and interpreting their surroundings. One of the main obstacles of deep-learning-based models in the field of robotics is the lack of domain-specific labeled data for different industrial applications. In this article, we propose a sim2real transfer learning method based on domain randomization for object detection with which labeled synthetic datasets of arbitrary size and object types can be automatically generated. Subsequently, a state-of-the-art convolutional neural network, YOLOv4, is trained to detect the different types of industrial objects. With the proposed domain randomization method, we could shrink the reality gap to a satisfactory level, achieving 86.32% and 97.38% mAP50 scores, respectively, in the case of zero-shot and one-shot transfers, on our manually annotated dataset containing 190 real images. Our solution fits for industrial use as the data generation process takes less than 0.5 s per image and the training lasts only around 12 h, on a GeForce RTX 2080 Ti GPU. Furthermore, it can reliably differentiate similar classes of objects by having access to only one real image for training. To our best knowledge, this is the only work thus far satisfying these constraints.

연구 동기 및 목표

  • 산업 로봇 분야에서 딥러닝 모델을 훈련시키기 위한 도메인 특화된 전문가 주석이 부여된 실세계 데이터의 부족 문제를 해결한다.
  • 최소한의 실세계 데이터 요구 조건 하에 비구조적인 산업 환경에서의 객체 검출을 위한 제로샷 및 원샷 전이 학습을 가능하게 한다.
  • 비용이 많이 들는 실세계 데이터 수집에 의존도를 줄이기 위해, 임의의 크기와 객체 유형을 가진 합성 데이터셋을 자동으로 생성할 수 있는 확장 가능한 파이프라인을 개발한다.
  • 로봇 응용 프로그램에 구현하기 위해 다양한 조명 조건과 간섭 물체 조건에서도 실시간 성능과 강건성을 확보한다.
  • 신뢰할 수 있는 로컬라이제이션과 그립 포즈 추정 기능을 갖춘 실제 로봇 피킹 및 플레이스 시스템에서의 성능을 입증한다.

제안 방법

  • 랜덤화된 객체 텍스처, 조명, 배경 변화를 포함한 시뮬레이션 프레임워크를 사용하여 대규모 합성 데이터셋을 자동으로 생성한다.
  • 도메인 랜덤라이제이션 기법을 적용하여 시뮬레이션과 실제 도메인 간 격차를 줄인다—예를 들어 랜덤 텍스처 적용, 후처리 증강(예: 블러, 노이즈), 랜덤 카메라 파라미터 설정.
  • 중력 및 랜덤 초기 객체 배치를 포함한 현실적인 물리 조건을 시뮬레이션하여 일반화 능력을 향상시킨다.
  • 혼잡한 환경에서의 탐지 강건성을 향상시키기 위해 전점 경계상자 계산 방법을 사용한다.
  • 랜덤화된 합성 데이터로 YOLOv4 기반 객체 검출기를 훈련시키며, 원샷 설정에서는 단일 실존 이미지로 미세조정한다.
  • PCA 및 카메라 캘리브레이션을 사용하여 실시간 추론과 포즈 추정을 수행하는 ROS 기반 로봇 제어 프레임워크에 훈련된 모델을 통합한다.

실험 결과

연구 질문

  • RQ1도메인 랜덤라이제이션을 통해 시뮬레이션과 실제 도메인 간 격차를 충분히 줄일 수 있을까? 이를 통해 단일 실존 이미지로 미세조정하는 것만으로도 높은 성능의 객체 검출이 가능할까?
  • RQ2제안된 도메인 랜덤라이제이션 파이프라인은 산업용 객체 검출에서 제로샷 및 원샷 전이 학습을 얼마나 효과적으로 지원하는가?
  • RQ3특정 랜덤라이제이션 구성 요소—예를 들어 텍스처, 후처리, 물리 시뮬레이션—는 모델의 일반화 능력 향상에 어느 정도 기여하는가?
  • RQ4실제 로봇 시스템에서 다양한 조명 조건과 혼잡한 환경 조건 하에서도 이 방법이 실시간 추론과 신뢰할 수 있는 검출을 달성할 수 있는가?
  • RQ5최소한의 실세계 데이터에 제한된 조건에서 기존 방법과 비교해 본다면, 제안된 방법의 mAP50 성능은 어떠한가?

주요 결과

  • 제안된 sim2real 도메인 랜덤라이제이션 방법은 제로샷 전이에서 86.32% mAP50 성능을 달성하여, 합성 데이터만으로도 강력한 일반화 능력을 입증하였다.
  • 단일 실존 이미지를 사용한 미세조정 조건에서 모델은 97.38% mAP50 성능을 달성하였으며, 유사한 데이터 제약 조건 하에서 기존 방법들을 크게 앞서는 성능을 보였다.
  • 제거 실험 결과, 후처리 도메인 랜덤라이제이션과 랜덤 텍스처 적용이 도메인 이격으로 인한 성능 저하를 줄이는 데 핵심적인 역할을 함을 확인하였다.
  • 물리 기반 시뮬레이션(중력, 랜덤 배치)과 전점 경계상자 방법의 통합은 탐지 강건성과 정확도를 크게 향상시켰다.
  • GeForce RTX 3060 GPU에서 20 FPS로 실시간 추론을 구현하여, 다양한 조명 조건과 간섭 물체가 존재하는 환경에서도 신뢰할 수 있는 객체 검출 및 로컬라이제이션을 가능하게 하였다.
  • 이 방법은 실제 로봇 피킹 및 플레이스 시스템에 성공적으로 구현되어 정확한 포즈 추정과 고신뢰도 예측을 갖춘 엔드 투 엔드 기능을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.