Skip to main content
QUICK REVIEW

[논문 리뷰] Follow Anything: Open-set detection, tracking, and following in real-time

Alaa Maalouf, Ninad Jadhav|arXiv (Cornell University)|2023. 08. 10.
Anomaly Detection Techniques and ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 텍스트, 이미지 또는 클릭 쿼리로 어떤 물체라도 감지, 추적 및 따라다니는 실시간, 오픈 뷰워드, 다중모달 로봇 시스템인 FAn을 소개한다. DINO와 SAM을 활용해 시각적 특징을 추출하고 분할 처리하며, 6–8GB GPU를 장착한 노트북에서 6–20FPS 성능을 달성하여, 재감지 메커니즘을 통해 음영 처리 이후에도 견고한 추적을 가능하게 한다.

ABSTRACT

Tracking and following objects of interest is critical to several robotics use cases, ranging from industrial automation to logistics and warehousing, to healthcare and security. In this paper, we present a robotic system to detect, track, and follow any object in real-time. Our approach, dubbed ``follow anything'' (FAn), is an open-vocabulary and multimodal model -- it is not restricted to concepts seen at training time and can be applied to novel classes at inference time using text, images, or click queries. Leveraging rich visual descriptors from large-scale pre-trained models (foundation models), FAn can detect and segment objects by matching multimodal queries (text, images, clicks) against an input image sequence. These detected and segmented objects are tracked across image frames, all while accounting for occlusion and object re-emergence. We demonstrate FAn on a real-world robotic system (a micro aerial vehicle) and report its ability to seamlessly follow the objects of interest in a real-time control loop. FAn can be deployed on a laptop with a lightweight (6-8 GB) graphics card, achieving a throughput of 6-20 frames per second. To enable rapid adoption, deployment, and extensibility, we open-source all our code on our project webpage at https://github.com/alaamaalouf/FollowAnything . We also encourage the reader to watch our 5-minutes explainer video in this https://www.youtube.com/watch?v=6Mgt3EPytrw .

연구 동기 및 목표

  • 고정된 물체 카테고리에 사전 훈련이 필요한 닫힘세트 로봇 물체 추적 시스템의 한계를 해결하기 위해.
  • 새로운 물체 클래스에 대해 재훈련이 필요 없이 텍스트, 이미지 또는 클릭을 통한 다중모달 사용자 인터랙션을 가능하게 하기 위해.
  • 자원 제약이 있는 로봇 플랫폼(예: 마이크로 항공기)에 배포 가능한 실시간, 경량 시스템을 개발하기 위해.
  • 음영 처리나 추적 실패 상황에서도 자율적인 재감지 메커니즘을 통해 내성적이고 견고한 추적을 확보하기 위해.
  • 최신 시각 기반 기초 모델과 실시간 로봇 제어 루프를 연결해 실용적인 배포를 가능하게 하기 위해.

제안 방법

  • FAn은 사용자가 텍스트, 이미지, 바운딩 박스 또는 클릭을 통해 관심 물체를 지정할 수 있는 다중모달 쿼리 인터페이스를 사용한다.
  • 입력 이미지에서 여러 후보 마스크를 생성하기 위해 Segment Anything Model(SAM)을 활용하고, 이후 DINO 기반의 시각적 특징 추출을 통해 픽셀 단위의 임베딩을 생성한다.
  • 물체 감지는 텍스트 또는 이미지에서 유도된 쿼리 임베딩과 DINO 패치 임베딩 간의 코사인 유사도를 계산하여 가장 유사한 마스크를 선택함으로써 수행된다.
  • 시스템은 프레임 간 물체 상태를 유지하는 실시간 추적 파이프라인을 통합하고, 음영 처리나 추적 실패 상황에서 복구하기 위한 재감지 메커니즘을 포함한다.
  • 통합 제어 루프를 통해 시각 기반 서보 제어를 구현하여, 마이크로 항공기에서 물체가 카메라의 시야에 항상 유지되도록 한다.
  • 추론 효율성 최적화를 통해 6–8GB GPU를 장착한 노트북에서 6–20FPS 성능을 달성하였으며, 확장성을 고려해 오픈소스로 제공된다.

실험 결과

연구 질문

  • RQ1사전에 특정 카테고리에 대해 훈련이 필요 없이 실시간으로 어떤 물체라도 감지하고 따라다닐 수 있는 로봇 시스템이 가능한가?
  • RQ2텍스트, 이미지, 클릭을 포함한 다중모달 쿼리가 높은 정확도와 낮은 지연 시간을 확보하면서 오픈세트 물체 추적을 얼마나 효과적으로 가능하게 하는가?
  • RQ3자원이 제한된 환경에서 시각적 특징 추출 및 감지에 있어 DINO-SOLO와 SAM+CLIP 간의 성능 상충 관계는 어떠한가?
  • RQ4다양하고 실생활의 동적인 환경에서 물체가 음영 처리되거나 추적 실패가 발생했을 때 시스템의 복구 능력은 얼마나 우수한가?
  • RQ5경량이며 오픈소스인 이 시스템이 랩탑이나 마이크로 항공기와 같은 엣지 디바이스에 실시간 로봇 제어를 위해 얼마나 잘 배포될 수 있는가?

주요 결과

  • FAn은 6–8GB GPU를 장착한 노트북에서 6–20FPS의 실시간 성능을 달성하여 자원 제약이 있는 로봇 플랫폼에 배포 가능하다.
  • 시스템은 훈련 중에 볼 수 없었던 새로운 카테고리의 물체라도 텍스트, 이미지 또는 클릭 쿼리를 통해 성공적으로 감지하고 추적한다.
  • DINO를 사용한 시각적 특징 추출은 특히 작은 크기나 저해상도의 물체 캐시에서 CLIP 기반 방법보다 빠르고 더 우수한 특징 품질을 제공한다.
  • DINO-SOLO는 저해상도 또는 모호한 장면에서 SAM+CLIP보다 더 견고한 감지를 제공하지만, 마스크 품질은 낮다.
  • 재감지 메커니즘이 음영 처리 이후 추적 복구에 효과적으로 기여하여 시스템의 지속성과 신뢰성을 유지한다.
  • 시스템은 드론, RC 자동차, 수동으로 움직이는 브릭 등 다양한 실생활 시나리오에서 뛰어난 일반화 능력을 보이며, 최소한의 사용자 입력으로도 효과적으로 작동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.