[논문 리뷰] DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment
DoReMi는 대규모 언어 모델(LLM)이 로봇 작업에서 계획 실행의 이탈을 감지하고 복구할 수 있도록 해주는 혁신적인 프레임워크이다. 이는 LLM이 실행 제약 조건을 생성하고, 시각-언어 모델(VLM)이 제약 위반 여부를 지속적으로 모니터링함으로써 작동한다. 실험 결과, 기준 방법 대비 로봇 팔 및 히ュ먼로이드 로봇 작업에서 작업 성공률가 향상되고 완료 시간이 감소하는 것으로 나타났다.
Large language models (LLMs) encode a vast amount of semantic knowledge and possess remarkable understanding and reasoning capabilities. Previous work has explored how to ground LLMs in robotic tasks to generate feasible and executable textual plans. However, low-level execution in the physical world may deviate from the high-level textual plan due to environmental perturbations or imperfect controller design. In this paper, we propose extbf{DoReMi}, a novel language model grounding framework that enables immediate Detection and Recovery from Misalignments between plan and execution. Specifically, we leverage LLMs to play a dual role, aiding not only in high-level planning but also generating constraints that can indicate misalignment during execution. Then vision language models (VLMs) are utilized to detect constraint violations continuously. Our pipeline can monitor the low-level execution and enable timely recovery if certain plan-execution misalignment occurs. Experiments on various complex tasks including robot arms and humanoid robots demonstrate that our method can lead to higher task success rates and shorter task completion times. Videos of DoReMi are available at \url{https://sites.google.com/view/doremi-paper}.
연구 동기 및 목표
- 환경적 요란이나 컨트롤러 오류로 인해 저수준 동작이 고수준 언어 계획에서 이탈하는 문제에 대비한 핵심적 격차를 메우기 위해.
- 단계 완료 후 지연된 피드백에 의존하는 것이 아니라, 실행 중에 이러한 이탈을 즉시 감지할 수 있도록 하기 위해.
- 제약 위반 감지를 통해 신속한 재계획 수립이 가능하게 하여 작업 성공률를 높이고 실행 시간을 단축시키기 위해.
- LLM이 고수준 계획 수립과 저수준 모니터링을 위한 실행 가능한 제약 조건 생성이라는 이중 기능을 수행하도록 활용하기 위해.
- 특정 물리적 조건에만 집중하는 경량이고 정밀한 제약 조건 감지기로 VLM을 통합하기 위해.
제안 방법
- LLM이 실행을 안내하기 위해 통합된 물리적 제약 조건(예: '빨간 블록은 Café 블록 위에 있다')이 포함된 고수준 텍스트 계획을 생성한다.
- 실행 중에 시각-언어 모델(VLM)이 환경을 지속적으로 모니터링하고 제약 조건 위반이 발생하는지 확인한다.
- 제약 조건 위반이 감지되면(예: 빨간 블록이 더 이상 Café 블록 위에 있지 않음), 시스템이 LLM을 통해 즉시 재계획을 실행한다.
- 재계획 과정은 현재 상태와 업데이트된 제약 조건에 기반해 액션 시퀀스를 동적으로 조정한다.
- 이 프레임워크는 닫힌 순환 방식으로 작동하여 작업 실행 전반에 걸쳐 지속적인 모니터링과 복구를 가능하게 한다.
- 이 방법은 계산 오버헤드를 최소화하기 위해 LLM을 통한 제약 조건 생성과 VLM을 통한 실시간 이진 제약 조건 검증에 의존한다.
실험 결과
연구 질문
- RQ1실시간으로 계획-실행 이탈을 감지하는 것이 장수행 로봇 작업에서 작업 성공률를 향상시키는 데 기여하는가?
- RQ2제약 조건 위반 발생 시 즉각적인 재계획 수립이 단계 완료 후 피드백을 기다리는 것에 비해 작업 완료 시간에 어떤 영향을 미치는가?
- RQ3LLM이 물리 세계의 상호의존성을 반영하는 의미 있는 실행 가능한 제약 조건를 효과적으로 생성할 수 있는가?
- RQ4VLM이 저수준 로봇 실행 중에 제약 조건 위반을 얼마나 정확하고 효율적으로 감지할 수 있는가?
- RQ5즉각적인 이탈 복구를 통해 작업 성능에 이론적이고 경험적으로 어떤 향상이 이루어지는가?
주요 결과
- DoReMi는 로봇 팔과 히ュ먼로이드 로봇을 포함한 복잡한 조작 작업에서 작업 성공률를 크게 향상시킨다.
- 실행 중 실패한 동작을 계속 수행하는 대신 즉각적인 복구를 허용함으로써 평균 작업 완료 시간을 단축시킨다.
- VLM이 실시간으로 제약 조건 위반을 감지하여 단계 완료를 기다리지 않고도 즉각적인 재계획 수립이 가능하다.
- LLM이 계획 수립과 제약 조건 생성이라는 이중 기능을 수행함으로써 고수준 의도와 저수준 실행 간의 일치도를 향상시킨다.
- 집중적인 제약 조건 감지기로 VLM을 통합함으로써 최소한의 계산 비용으로 정밀한 피드백을 제공한다.
- 시뮬레이션에서의 경험적 결과는 DoReMi가 지연된 피드백에 의존하거나 제약 조건 모니터링 기능이 없는 기준 방법보다 뛰어나다는 것을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.