Skip to main content
QUICK REVIEW

[논문 리뷰] AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation

Jiafei Duan, Wilbert Pumacay|arXiv (Cornell University)|2024. 10. 01.
Robot Manipulation and Learning인용 수 4
한 줄 요약

이 논문은 자유형 자연어 설명을 통해 로봇 조작에서의 실패를 탐지하고 추론하는 오픈소스 시각언어 모델 Aha를 소개한다. FailGen이라는 절차적 데이터 증강 파이프라인을 통해 생성된 Aha 데이터셋으로 훈련된 Aha는 평균적으로 GPT-4o보다 10.3% 높은 성능을 보이며, 강화학습, 계획, 제로샷 궤적 생성에 있어서 적응형 실패 피드백을 가능하게 함으로써 세 가지 로봇 프레임워크에서 작업 성공률을 21.4% 향상시킨다.

ABSTRACT

Robotic manipulation in open-world settings requires not only task execution but also the ability to detect and learn from failures. While recent advances in vision-language models (VLMs) and large language models (LLMs) have improved robots' spatial reasoning and problem-solving abilities, they still struggle with failure recognition, limiting their real-world applicability. We introduce AHA, an open-source VLM designed to detect and reason about failures in robotic manipulation using natural language. By framing failure detection as a free-form reasoning task, AHA identifies failures and provides detailed, adaptable explanations across different robots, tasks, and environments. We fine-tuned AHA using FailGen, a scalable framework that generates the first large-scale dataset of robotic failure trajectories, the AHA dataset. FailGen achieves this by procedurally perturbing successful demonstrations from simulation. Despite being trained solely on the AHA dataset, AHA generalizes effectively to real-world failure datasets, robotic systems, and unseen tasks. It surpasses the second-best model (GPT-4o in-context learning) by 10.3% and exceeds the average performance of six compared models including five state-of-the-art VLMs by 35.3% across multiple metrics and datasets. We integrate AHA into three manipulation frameworks that utilize LLMs/VLMs for reinforcement learning, task and motion planning, and zero-shot trajectory generation. AHA's failure feedback enhances these policies' performances by refining dense reward functions, optimizing task planning, and improving sub-task verification, boosting task success rates by an average of 21.4% across all three tasks compared to GPT-4 models.

연구 동기 및 목표

  • 로봇이 개방형 환경에서의 실패를 이진 실패 탐지 초과하여 자율적으로 탐지하고 추론할 수 있도록 하는 것.
  • 특히 실패 일반화를 위한 가용성과 다양성이 떨어지는 로봇 분야의 시각언어 모델 훈련을 위한 스케일러블하고 다양한 실패 데이터의 부족을 해결하는 것.
  • 고정된 분류 방식이 아닌 자유형 추론을 통해 미리 알 수 없는 로봇, 작업, 환경에 대해 일반화되는 기초 모델을 개발하는 것.
  • 강화학습, 작업 및 운동 계획, 제로샷 궤적 생성과 같은 후속 로봇 시스템에 실패 추론을 통합하는 것.
  • 자연어 기반의 실패 피드백이 실제 및 시뮬레이션 환경에서 정책 성능과 내구성에 크게 기여함을 입증하는 것.

제안 방법

  • 79개의 시뮬레이션 작업에서 다양한 실패 유형을 생성하기 위해 시뮬레이션에서 성공적인 시연 궤적을 변형하는 절차적 데이터 생성 파이프라인인 FailGen을 제안한다.
  • 다양한 실패 유형, 로봇 구현 방식, 환경적 변형을 포함한 49,000개 이상의 이미지-질문 쌍으로 구성된 Aha 데이터셋을 구축한다.
  • 실패 탐지를 자유형 추론 작업으로 설정하기 위해 지시 테이닝을 사용해 Aha-13B라는 시각언어 모델을 Aha 데이터셋에 맞추어 미세조정한다.
  • 세 가지 로봇 프레임워크에 Aha를 통합한다: (1) 강화학습를 위한 밀도 높은 보상 형상 조정, (2) 피드백 루프를 갖춘 작업 및 운동 계획, (3) 제로샷 궤적 생성에서의 서브작업 검증.
  • Aha에서 생성된 자연어 설명을 활용해 보상 함수를 개선하고 계획 최적화를 수행하며 서브작업 검증을 향상시켜 적응형 오류 복구를 가능하게 한다.
  • 분포 외 데이터셋과 실제 실패 데이터를 대상으로 제로샷 평가를 수행해, 새로운 작업, 로봇, 환경에 대한 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1단지 시뮬레이션 실패 데이터로만 훈련된 시각언어 모델이 실제 실패 및 새로운 작업에 대해 효과적으로 일반화될 수 있는가?
  • RQ2이진 분류나 고정 레이블 접근 방식에 비해 실패 탐지를 자유형 추론 작업으로 프레임링할 경우 해석 가능성과 적응 가능성은 향상되는가?
  • RQ3Aha의 실패 설명은 강화학습, 계획, 제로샷 생성에서 후속 로봇 정책 성능을 어느 정도 향상시킬 수 있는가?
  • RQ4다양하고 분포가 다른 환경에서 Aha는 최신의 VLM 및 전문 모델인 GPT-4o에 비해 실패 추론 능력에서 뛰어나게 성능을 내는가?
  • RQ5Aha의 실패 피드백는 여러 로봇 프레임워크에서 효과적으로 재사용되어 성공률과 내구성을 향상시킬 수 있는가?

주요 결과

  • Aha는 여러 메트릭과 데이터셋에서 평균적으로 GPT-4o보다 10.3% 높은 성능을 보이며, 새로운 실패 시나리오에 대한 일반화 능력이 뛰어나다는 것을 입증한다.
  • 비교 모델 여섯 곡 중 다섯 개의 SOTA VLM을 포함해 평가 메트릭 전반에서 평균 35.3% 높은 성능을 기록하여, Aha의 강건성과 일반화 능력이 뛰어나다는 것을 입증한다.
  • 강화학습 프레임워크에 통합된 Aha는 GPT-4o 대비 작업 성공률을 21.4% 향상시키며, 다섯 가지 벤치마크 작업에서 성공률이 22.34% 높다.
  • 작업 및 운동 계획(PRoC3S)에서 Aha는 GPT-4o 대비 성공률을 36.7% 향상시켰으며, LLM 기반 계획 개선 과정에서 더 정확한 실패 진단과 피드백 덕분이었다.
  • 제로샷 궤적 생성(Manipulate-Anything)에서 GPT-4V 대신 Aha-13B를 사용함으로써, 네 개의 RLBench 작업에서 평균적으로 추론 정확도와 전체 작업 성공률이 각각 5% 향상되었다.
  • Aha는 시뮬레이션 데이터만으로 미세조정되었음에도 불구하고 실제 실패 데이터셋과 다양한 로봇 시스템에 대해 효과적으로 일반화되었으며, 이는 FailGen의 절차적 데이터 증강 기법의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.