[論文レビュー] Follow Anything: Open-set detection, tracking, and following in real-time
本論文では、テキスト、画像、またはクリックによるクエリを使って、任意の物体を検出・追跡・追従するリアルタイムでオープンボリュームなマルチモーダルロボットシステムFAnを紹介する。DINOとSAMを用いた視覚的特徴抽出とセグメンテーションにより、6–8 GBのGPUを搭載したラップトップ上で6–20 FPSを達成し、再検出メカニズムにより遮蔽後でも頑健な追跡を実現する。
Tracking and following objects of interest is critical to several robotics use cases, ranging from industrial automation to logistics and warehousing, to healthcare and security. In this paper, we present a robotic system to detect, track, and follow any object in real-time. Our approach, dubbed ``follow anything'' (FAn), is an open-vocabulary and multimodal model -- it is not restricted to concepts seen at training time and can be applied to novel classes at inference time using text, images, or click queries. Leveraging rich visual descriptors from large-scale pre-trained models (foundation models), FAn can detect and segment objects by matching multimodal queries (text, images, clicks) against an input image sequence. These detected and segmented objects are tracked across image frames, all while accounting for occlusion and object re-emergence. We demonstrate FAn on a real-world robotic system (a micro aerial vehicle) and report its ability to seamlessly follow the objects of interest in a real-time control loop. FAn can be deployed on a laptop with a lightweight (6-8 GB) graphics card, achieving a throughput of 6-20 frames per second. To enable rapid adoption, deployment, and extensibility, we open-source all our code on our project webpage at https://github.com/alaamaalouf/FollowAnything . We also encourage the reader to watch our 5-minutes explainer video in this https://www.youtube.com/watch?v=6Mgt3EPytrw .
研究の動機と目的
- 固定された物体カテゴリに事前にトレーニングが必要なクローズドセットのロボットオブジェクト追従システムの限界を解消すること。
- 新しいオブジェクトクラスの再トレーニングを必要とせず、テキスト、画像、またはクリックによる柔軟なマルチモーダルユーザーインタラクションを可能にすること。
- リソース制約のあるロボットプラットフォーム(例:マイクロエアリアルビークル)にデプロイ可能なリアルタイムで軽量なシステムを開発すること。
- 遮蔽やトラッキング失敗時にも自律的な再検出メカニズムにより、頑健な追跡を保証すること。
- 最先端のビジョンベースのフォンダメンタルモデルとリアルタイムのロボット制御ループを統合し、実用的デプロイメントを実現すること。
提案手法
- FAnは、テキスト、画像、バウンディングボックス、またはクリックによるクエリで対象オブジェクトを指定できるマルチモーダルクエリインターフェースを採用する。
- 入力画像から複数の候補マスクを生成するために、セグメンテーションアタッチメントモデル(SAM)を用い、その後、DINOベースの視覚的特徴抽出によりピクセル単位の埋め込みを取得する。
- オブジェクト検出は、DINOのパッチ埋め込みとクエリ埋め込み(テキストまたは画像由来)とのコサイン類似度を計算し、類似度が最も高いマスクを選択することで実行する。
- システムは、フレーム間でのオブジェクト状態を維持するリアルタイムトラッキングパイプラインを統合しており、遮蔽やトラッキング失敗時にも再検出メカニズムにより回復可能である。
- 統合された制御ループにより、ビジュアルサーボイングが可能となり、マイクロエアリアルビークル上でオブジェクトがカメラの視野内に保たれるように制御される。
- 推論効率性を最適化し、6–8 GBのGPUを搭載したラップトップ上で6–20 FPSを達成しており、拡張性を考慮してオープンソース化されている。
実験結果
リサーチクエスチョン
- RQ1事前に特定のカテゴリでトレーニングを行わずに、リアルタイムで任意のオブジェクトを検出し追従できるロボットシステムは実現可能か?
- RQ2テキスト、画像、クリックによるマルチモーダルクエリは、高い正確性と低遅延を実現するオープンセットのオブジェクト追従にどの程度有効か?
- RQ3リソースが限られた環境下で、DINO-SOLOとSAM+CLIPを用いた視覚的特徴抽出および検出の性能トレードオフは何か?
- RQ4動的で現実的な環境下で、オブジェクトの遮蔽やトラッキング回復は、どのように処理されるか?
- RQ5軽量でオープンソースのシステムは、ラップトップやマイクロエアリアルビークルなどのエッジデバイスに、リアルタイムのロボット制御のためにどの程度デプロイ可能か?
主な発見
- FAnは、6–8 GBのGPUを搭載したラップトップ上で6–20 FPSのリアルタイム性能を達成し、リソース制約のあるロボットプラットフォームへのデプロイが可能である。
- 本システムは、トレーニング時に見られなかった新しいカテゴリのオブジェクトについても、テキスト、画像、またはクリッククエリによって検出・追跡に成功している。
- DINOによる視覚的特徴抽出は、特に小さなまたは低解像度のオブジェクトクロップに対して、CLIPベースの手法よりも速度と特徴品質の面で優れている。
- DINO-SOLOは、低解像度または曖昧なシーンにおいて、SAM+CLIPよりもより頑健な検出を実現するが、マスク品質は低めである。
- 再検出メカニズムは、遮蔽後のトラッキング回復を効果的に実現し、システムの継続性と信頼性を維持している。
- 本システムは、ドローンやRCカー、手動で動かされたブロックを追従するなど、多様な現実世界のシナリオにおいて優れた汎化性能を示しており、最小限のユーザー入力で動作している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。