Skip to main content
QUICK REVIEW

[논문 리뷰] LLMR: Real-time Prompting of Interactive Worlds using Large Language Models

Fernanda De La Torre, Cathy Mengying Fang|arXiv (Cornell University)|2023. 09. 21.
Educational Games and Gamification인용 수 10
한 줄 요약

LLMR은 Unity에서 특화된 GPT 모듈(Planner, Scene Analyzer, Builder, Inspector, Skill Library)을 운영하고 런타임 Roslyn 컴파일러와 함께 실시간으로 상호작용하는 3D 장면을 생성 및 편집하는 프레임워크로, 강력하고 실시간 MR 경험을 구현합니다.

ABSTRACT

We present Large Language Model for Mixed Reality (LLMR), a framework for the real-time creation and modification of interactive Mixed Reality experiences using LLMs. LLMR leverages novel strategies to tackle difficult cases where ideal training data is scarce, or where the design goal requires the synthesis of internal dynamics, intuitive analysis, or advanced interactivity. Our framework relies on text interaction and the Unity game engine. By incorporating techniques for scene understanding, task planning, self-debugging, and memory management, LLMR outperforms the standard GPT-4 by 4x in average error rate. We demonstrate LLMR's cross-platform interoperability with several example worlds, and evaluate it on a variety of creation and modification tasks to show that it can produce and edit diverse objects, tools, and scenes. Finally, we conducted a usability study (N=11) with a diverse set that revealed participants had positive experiences with the system and would use it again.

연구 동기 및 목표

  • Unity 기반 혼합 reality에서 LLM을 활용한 대화형 3D 장면의 실시간 생성 및 수정을 촉진.
  • 데이터가 부족하고 복잡한 장면 합성 작업에 대처하는 모듈식 LLM 기반 파이프라인 개발.
  • 반복적인 검사 및 메모리 관리로 생성된 Unity/C# 스크립트의 견고성을 개선하고 코드 오류를 줄인다.
  • 생성된 장면의 크로스플랫폼 상호 운용성과 실시간 실행을 시연한다.
  • AI 기반 MR 장면 작성을 위한 향후 연구를 장려하기 위한 사용성 증거와 공개 자원을 제공한다.

제안 방법

  • LLMR을 Planner, Scene Analyzer, Builder, Inspector, Skill Library로 구성된 특화된 GPT들의 오케스트레이션으로 제시하여 Unity C# 코드를 생성한다.
  • 실시간 장면 생성을 위해 Unity 내에서 생성된 스크립트를 컴파일하고 실행하기 위해 런타임 Roslyn 컴파일러를 사용한다.
  • 실행 전에 코드를 자동으로 디버깅하기 위한 Builder-Inspector 피드백 루프를 도입한다.
  • 컴팩트한 표현으로 장면 상태를 요약하고 조건부 코드 생성을 다루는 Scene Analyzer를 구현한다.
  • 토큰 한도, 성능 및 해석가능성의 균형을 맞추기 위한 메모리 모드가 있는 메모리 관리 전략을 도입한다.
  • 절제 연구, 크로스 플랫폼 시연, 그리고 사용성 및 견고성을 평가하기 위한 사용자 연구(N=11)를 통해 평가한다.

실험 결과

연구 질문

  • RQ1실시간 프롬프트 주도 생성을 통해 LLM을 사용하여 Unity에서 기능적이고 대화형 3D 장면을 생성할 수 있는가?
  • RQ2Planner, Scene Analyzer, Builder, Inspector 및 Skill Library 구성요소가 상호 작용하여 견고성을 개선하고 오류를 줄이는 방법은?
  • RQ3LLM 주도 MR 파이프라인에서 메모리 관리가 토큰 사용량, 성능 및 해석가능성에 미치는 영향은?
  • RQ4LLMR이 기기와 플러그인 간에 얼마나 광범위하게 크로스 플랫폼 상호 운용성과 실시간 응답성을 달성할 수 있는가?
  • RQ5비전문 참여자가 LLMR을 사용하여 장면을 생성하고 수정할 때의 사용자 경험은?

주요 결과

  • LLMR은 시판 GPT-4보다 우수하며 빈 장면과 기존 장면 모두에서 코드 오류를 3배 이상 감소시킨다.
  • 시스템은 작업 시퀀스에 대해 약 1분 정도의 완성 시간을 달성한다.
  • Planner, Scene Analyzer, Builder, Inspector 및 Skill Library를 포함한 구조화된 모듈식 파이프라인은 코드-인스펙터 피드백 루프를 통한 견고성 개선을 실현한다.
  • 11명의 참가자를 대상으로 한 사용성 연구에서 직관적 사용성과 시스템 재사용 의향이 보고되었다.
  • 크로스 플랫폼 시演은 Unity, Sketchfab 플러그인 및 외부 센서와의 상호 운용성을 보여주며 다용도 MR 워크플로를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.