Skip to main content
QUICK REVIEW

[논문 리뷰] RoboChop: Autonomous Framework for Fruit and Vegetable Chopping Leveraging Foundational Models

Atharva Dikshit, Alison Bartsch|arXiv (Cornell University)|2023. 07. 24.
Smart Agriculture and AI인용 수 5
한 줄 요약

RoboChop는 시각 기반 기본 모델(YOLO 및 SAM)을 결합하여 혼잡한 조리도구 위에서 다양한 과일과 채소를 자동으로 다루는 자율 로봇 프레임워크를 제안한다. 작업 계획에서 97%의 성공률, 분할에서 91%의 성공률를 기록하여 다양한 물체와 자르기 사양에 걸쳐 뛰어난 성능을 입증한다.

ABSTRACT

With the goal of developing fully autonomous cooking robots, developing robust systems that can chop a wide variety of objects is important. Existing approaches focus primarily on the low-level dynamics of the cutting action, which overlooks some of the practical real-world challenges of implementing autonomous cutting systems. In this work we propose an autonomous framework to sequence together action primitives for the purpose of chopping fruits and vegetables on a cluttered cutting board. We present a novel technique to leverage vision foundational models SAM and YOLO to accurately detect, segment, and track fruits and vegetables as they visually change through the sequences of chops, finetuning YOLO on a novel dataset of whole and chopped fruits and vegetables. In our experiments, we demonstrate that our simple pipeline is able to reliably chop a variety of fruits and vegetables ranging in size, appearance, and texture, meeting a variety of chopping specifications, including fruit type, number of slices, and types of slices.

연구 동기 및 목표

  • 혼잡한 조리도구 위에서 과일과 채소를 완전 자율적으로 다루는 시스템을 개발하여 저수준 자르기 메커니즘을 넘어서는 실제 응용 도전 과제를 해결한다.
  • 연속적인 자르기 동작 중 시각적으로 변화하는 과일과 채소를 추적하고 식별하는 데 어려움을 극복한다.
  • 저수준 동작 프리미티브를 지능적으로 시퀀싱하여 다양한 목표 지향 자르기(예: 균일한 조각, 긴 스트립)를 유연하게 구현한다.
  • 학습 및 평가를 위한 검증 자료로 사용할 수 있도록, 전체 및 자른 과일·채소의 새로운 공개 데이터셋을 구축한다.
  • 부분적인 실패나 동적 워크스페이스 조건에도 대응 가능한 종단 간 로봇 파이프라인을 구현하기 위해 시각 기반 기본 모델(YOLO 및 SAM)을 통합한다.

제안 방법

  • 새로 수집한 3종류의 식재료 데이터셋에 맞춰 미세조정된 YOLO를 활용해 전체 및 자른 과일·채소의 실시간 물체 감지를 수행한다.
  • 반복적 프롬프트 기반 정밀화 기법을 사용한 Segment Anything Model(SAM)을 적용해 자르기 중 및 이후 단계에서 물체의 정확한 인스턴스 수준 분할 마스크를 생성한다.
  • YOLO의 감지 결과를 기반으로 SAM의 제로샷 분할을 유도하여, 동적 환경에서의 정확도와 일관성을 향상시킨다.
  • 자르기, 요동 주기, 집어넣기 등의 동작 프리미티브를 포함하는 모듈식 동작 프리미티브 라이브러리를 설계해 작업 계획 및 장애 복구를 가능하게 한다.
  • 계층적 계획 파이프라인을 구현: 물체 감지 → 분할 및 추적 → 동작 시퀀스 계획 → 실시간 피드백 및 충돌 회피 기반 실행.
  • 부분적으로 자른 또는 굴러간 물체를 재배치하기 위한 요동 주기 프리미티브를 통합해 시각적 및 기계적 장애에 대한 내성을 향상시킨다.

실험 결과

연구 질문

  • RQ1혼잡한 워크스페이스에서 여러 번의 자르기 동작을 거치면서도 시각 기반 로봇 시스템이 과일과 채소를 신뢰성 있게 감지하고 분할하며 추적할 수 있는가?
  • RQ2YOLO와 SAM의 통합이 다단계 자르기 작업 중 정확한 물체 인스턴스 분할 및 추적에 얼마나 효과적인가?
  • RQ3간단하고 모듈식인 동작 프리미티브 프레임워크가 다양한 물체 유형에 걸쳐 다양한 자르기 목표(예: 균일한 조각, 긴 스트립)를 얼마나 잘 달성할 수 있는가?
  • RQ4부분적인 실패(예: 완전하지 않은 자르기, 물체 이동)에 얼마나 강건한가? 복구 메커니즘이 작업 진행을 복구할 수 있는가?
  • RQ5다양한 초기 구성 및 목표 조각 수를 가진 다중 물체 혼잡 환경에서 시스템의 성능은 어떠한가?

주요 결과

  • YOLO-SAM 융합 파이프라인을 통해 물체 인스턴스 분할 성공률가 91%에 도달했으며, 독립적으로 사용한 SAM이나 YOLO보다 유의미하게 높은 성능을 보였다.
  • 작업 계획 성공률가 97%로 나타나, 동작 시퀀스 계획기의 다양한 자르기 사양에 대한 효과성을 입증했다.
  • 단일 물체 실험에서 균일 자르기 히ュ리스틱은 사과와🥒에서 100% 성공률를 기록했고, 긴 스트립 자르기 히ュ리스틱은🥒에서 80%, 당근에서 40% 성공률를 기록하여 긴 얇은 물체에 대한 도전 과제를 확인했다.
  • 다중 물체 혼잡 환경에서 시스템은 총 10회 실험 중 7회(70%)의 작업을 성공적으로 완료했으며, 실패 분석 결과 물체 굴림과 완전하지 않은 자르기가 주요 원인으로 나타났다.
  • 실험 10에서 요동 주기 프리미티브가 부분적인 실패 후 재배치를 통해 성공적인 완료를 가능케 하여 복구 능력을 입증했다.
  • 시각 시스템 오류에 대해서도 뛰어난 내성을 보였으며, 부분적 실패를 감지하고 재계획할 수 있어 모듈식이고 복구 가능한 동작 설계의 가치를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.