Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey on Robotics with Foundation Models: toward Embodied AI

Zhiyuan Xu, Kun Wu|arXiv (Cornell University)|2024. 02. 04.
Modular Robots and Swarm Intelligence인용 수 4
한 줄 요약

이 종합 검토는 대규모 언어, 시각, 시각-언어 모델과 같은 기초 모델을 인공지능 기반 로봇 공학에 통합하는 것을 탐구하며, 자율적 조작에서 고수준 계획 수립과 저수준 제어에 초점을 맞춘다. 이 모델들은 통합된 계획-제어 프레임워크를 통해 복잡하고 장기적인 작업에서 소수의 예시 또는 제로샷 일반화를 가능하게 하며, 효율성, 안전성, 데이터 증강과 같은 핵심 과제를 밝혀낸다.

ABSTRACT

While the exploration for embodied AI has spanned multiple decades, it remains a persistent challenge to endow agents with human-level intelligence, including perception, learning, reasoning, decision-making, control, and generalization capabilities, so that they can perform general-purpose tasks in open, unstructured, and dynamic environments. Recent advances in computer vision, natural language processing, and multi-modality learning have shown that the foundation models have superhuman capabilities for specific tasks. They not only provide a solid cornerstone for integrating basic modules into embodied AI systems but also shed light on how to scale up robot learning from a methodological perspective. This survey aims to provide a comprehensive and up-to-date overview of foundation models in robotics, focusing on autonomous manipulation and encompassing high-level planning and low-level control. Moreover, we showcase their commonly used datasets, simulators, and benchmarks. Importantly, we emphasize the critical challenges intrinsic to this field and delineate potential avenues for future research, contributing to advancing the frontier of academic and industrial discourse.

연구 동기 및 목표

  • 자율적 조작을 위한 기초 모델에 대한 종합적이고 최신의 개요를 제공하는 것.
  • 로봇 시스템에서 고수준 계획 수립과 저수준 제어에 기초 모델을 적용한 최근 접근 방식을 분류하고 분석하는 것.
  • 재현 가능한 연구와 실용적 응용을 지원하기 위해 분야에서 일반적으로 사용되는 데이터셋, 시뮬레이터, 벤치마크를 조사하는 것.
  • 실제 구현에서의 핵심 과제인 계산 효율성, 안전성, 데이터 부족과 같은 문제를 특정화하는 것.
  • 일반적인, 일반화 가능한, 그리고 견고한 인공지능 기반 로봇 시스템을 발전시키기 위한 향후 연구 방향을 제시하는 것.

제안 방법

  • 로봇 공학에서 기초 모델 응용을 두 가지 주요 유형으로 분류: 고수준 계획 수립(예: 자연어 명령 해석 및 작업 계획 생성)과 저수준 제어(예: 정밀한 모터 명령 생성).
  • 시각-언어 모델(VLM)과 대규모 언어 모델(LLM)을 사용하여 사용자 지시를 해석하고 환경을 인지함으로써 세계 지식 기반의 추론을 가능하게 하는 내용을 검토.
  • 구조화된 계획 형식(PDDL 등)과 비구조화된 형식(자연어 또는 코드 등)을 비교 분석하여 표현력과 실행 가능성, 모델 성능 간의 상충 관계 평가.
  • 계획과 제어를 통합하는 대규모 로봇 기초 모델의 엔드 투 엔드 학습을 분석하며, 뇌와 소뇌의 협업을 모방하여 작업 수행 성능 향상.
  • VLM과 확산 모델(예: Imagen Editor)을 활용한 데이터 증강 기법을 조사하여 작업에 관련된 내용을 손상시키지 않은 채 의미적으로 유의미한 이미지 편집을 생성.
  • LoRA 미세조정 및 모델 압축과 같은 효율성 기법을 평가하여 엣지 디바이스에 대규모 기초 모델을 구현할 때 계산 및 개인정보 보호 제약을 해결.
Figure 1 : Taxonomy of foundation models for high-level planning and their properties.
Figure 1 : Taxonomy of foundation models for high-level planning and their properties.

실험 결과

연구 질문

  • RQ1기초 모델을 어떻게 효과적으로 활용하여 장기적인 작업에서 제로샷 또는 소수의 예시로 일반화를 달성할 수 있는가?
  • RQ2표현력, 실행 가능성, 모델 성능 측면에서 구조화된(PDDL 등) 형식과 비구조화된(자연어 또는 코드 등) 형식 간의 상충 관계는 무엇인가?
  • RQ3기초 모델을 고수준 계획 수립과 저수준 제어 양쪽에 통합하여 통합적이고 확장 가능한 로봇 에이전트를 구축할 수 있는 방법은 무엇인가?
  • RQ4로봇 학습에서 정책의 일반화를 향상시키면서도 의미를 유지하는 가장 효과적인 데이터 증강 전략은 무엇인가?
  • RQ5자원 제약이 있는 로봇 시스템에 기초 모델을 구현할 때의 핵심 과제는 무엇이며, 효율성 및 안전성 메커니즘을 통해 어떻게 완화할 수 있는가?

주요 결과

  • PaLM-E나 RT-1와 같은 기초 모델은 작업별 특화 미세조정 없이도 다양한 작업에서 강력한 소수의 예시 또는 제로샷 일반화 능력을 보이며, 조작 작업에 효과적이다.
  • ROSIE와 같은 VLM 기반 데이터 증강 방법은 텍스트 지시와 확산 모델을 활용해 의미적으로 일관된 이미지 편집을 생성함으로써 수백 가지 작업에서 정책의 일반화를 향상시킨다.
  • LoRA 및 기타 파rameter 효율적 미세조정 기법은 대규모 기초 모델을 로봇 작업에 적응시키는 데 있어 계산 비용을 크게 감소시킨다.
  • 진전이 있었음에도 불구하고, 현재 기초 모델은 분포 외 상태(OOD)에서 어려움을 겪고 있으며, 오류 복구 전략이 견고하지 않아 실제 안전성 측면에서 핵심적인 격차를 드러낸다.
  • 대규모 기초 모델을 엣지 디바이스에 배포하는 것은 높은 추론 비용과 개인정보 우려로 인해 여전히 도전 과제이며, 모델 압축과 경량 아키텍처가 필요하다.
  • 안전성은 여전히 주요 과제이다: 기존의 이론적 보장(예: 리아푸노프 기반 방법)은 저차원, 이상적인 환경에만 적용 가능하며, 이미지와 같은 고차원 입력으로는 일반화되지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.