Skip to main content
QUICK REVIEW

[논문 리뷰] GestureGPT: Toward Zero-Shot Free-Form Hand Gesture Understanding with Large Language Model Agents

Xin Zeng, Xiaoyu Wang|arXiv (Cornell University)|2023. 10. 19.
Hand Gesture Recognition Systems참고 문헌 79인용 수 5
한 줄 요약

GestureGPT는 대규모 언어 모델(Large Language Models, LLMs)에 기반한 이중 에이gent 대화 시스템을 활용해 제로샷 손짓 이해 및 기반 프레임워크를 제안한다. 손의 지능점 좌표를 자연어 설명으로 변환한 후, 손짓 에이gent와 맥락 에이gent 간의 반복적 대화를 통해 손짓을 상호작용 기능에 기반화한다. 스마트 홈 및 비디오 스트리밍 작업에서 각각 90.78% 및 80.11%의 제로샷 Top-5 기반 정확도를 달성한다.

ABSTRACT

Existing gesture interfaces only work with a fixed set of gestures defined either by interface designers or by users themselves, which introduces learning or demonstration efforts that diminish their naturalness. Humans, on the other hand, understand free-form gestures by synthesizing the gesture, context, experience, and common sense. In this way, the user does not need to learn, demonstrate, or associate gestures. We introduce GestureGPT, a free-form hand gesture understanding framework that mimics human gesture understanding procedures to enable a natural free-form gestural interface. Our framework leverages multiple Large Language Model agents to manage and synthesize gesture and context information, then infers the interaction intent by associating the gesture with an interface function. More specifically, our triple-agent framework includes a Gesture Description Agent that automatically segments and formulates natural language descriptions of hand poses and movements based on hand landmark coordinates. The description is deciphered by a Gesture Inference Agent through self-reasoning and querying about the interaction context (e.g., interaction history, gaze data), which is managed by a Context Management Agent. Following iterative exchanges, the Gesture Inference Agent discerns the user's intent by grounding it to an interactive function. We validated our framework offline under two real-world scenarios: smart home control and online video streaming. The average zero-shot Top-1/Top-5 grounding accuracies are 44.79%/83.59% for smart home tasks and 37.50%/73.44% for video streaming tasks. We also provide an extensive discussion that includes rationale for model selection, generalizability, and future research directions for a practical system etc.

연구 동기 및 목표

  • 기존 손짓 시스템이 사전 정의된 손짓 집합에 의존하고 맥락 인식 능력이 부족한 점을 해결하기 위해.
  • LLM의 추론 및 일반 지식 능력을 활용해 고정된 카테고리 외의 자유형 손짓을 제로샷으로 이해할 수 있도록 하기 위해.
  • 맥락 기반으로 동적으로 상호작용 기능과 손짓을 연결함으로써 손짓 인식과 기능 기반화 사이의 격차를 메우기 위해.
  • 손짓 상호작용에서 통합된 의도 추론을 위해 다중 라운드 대화를 가능하게 하는 이중 에이gent LLM 아키텍처를 개발하기 위해.
  • 실세계 상호작용 시나리오인 비디오 스트리밍 및 스마트 홈 제어와 같은 환경에서 프레임워크를 검증하기 위해

제안 방법

  • 손짓 기술 모듈은 손의 2차원 지능점 좌표에서 기하학적 규칙(손가락 각도, 거리, 운동 방향 기반)을 사용해 자연어 설명을 생성한다.
  • 이중 에이gent 대화 시스템을 적용한다: 손짓 에이gent는 손짓 설명을 해석하고 맥락을 질의하며, 맥락 에이gent는 기기 상태, 시선 데이터, 상호작용 이력 등의 지식 기반을 유지하고 응답한다.
  • 두 에이전트는 반복적이고 다중 라운드 대화를 통해 공동으로 사용자 의도를 추론하며, 손짓 의미와 맥락 정보를 통합한다.
  • LLM의 추론를 통해 손짓 설명과 맥락 신호를 융합하여 특정 상호작용 기능(예: TV 음소거, 음소거 해제)에 손짓을 기반화한다.
  • 설명 정확도 평가에는 공개된 제1인칭 및 제3인칭 시각 손짓 데이터셋을 사용하고, 기반 성능 평가는 실세계 구현을 통해 수행한다.
  • 에이전트로 대규모 언어 모델(GPT-4)을 사용하며, GPT-3.5와 Vicuna-13B를 비교한 추론 실험을 통해 모델 능력 요구사항을 평가한다.

실험 결과

연구 질문

  • RQ1LLM와 맥락 추론을 활용해 사전 정의된 손짓 카테고리 외의 범위로 일반화 가능한 제로샷 손짓 이해 시스템은 가능한가?
  • RQ2실세계 맥락에서 자유형 손짓을 상호작용 기능에 기반화하는 데에 이중 에이gent 대화 시스템은 얼마나 효과적인가?
  • RQ3상호작용 맥락(예: 기기 상태, 시선, 이력)은 손짓 기반화 정확도에 어떤 영향을 미치는가?
  • RQ4다양한 LLM(GPT-4, GPT-3.5, Vicuna-13B)은 대화를 통해 손짓 기반화를 지원하는 데 있어 어떤 차이를 보이는가?
  • RQ5시스템은 비디오 스트리밍 및 스마트 홈 제어와 같은 실시간 상호작용 환경에서 높은 정확도를 달성할 수 있는가?

주요 결과

  • 손짓 기술 모듈은 제1인칭 데이터셋에서 91.8%의 정확도, 제3인칭 데이터셋에서 81.0%의 정확도를 기록하여 시각에서 언어로의 변환 능력이 뛰어나다는 것을 입증했다.
  • 실세계 비디오 스트리밍 작업에서 시스템은 80.11%의 제로샷 Top-5 기반 정확도를 달성했으며, 일부 경우에서 인간 기준보다 뛰어난 성능을 보였다.
  • 스마트 홈 IoT 제어 작업에서 시스템은 90.78%의 제로샷 Top-5 기반 정확도를 달성하여 복잡하고 맥락 의존적인 상호작용에 대한 강력한 일반화 능력을 보였다.
  • GPT-4 기반 에이전트는 GPT-3.5(8.64% 정확도)와 Vicuna-13B(1% 미만 정확도)보다 유의미하게 뛰어난 성능을 보였으며, 손짓 이해에 고급 추론 능력이 필수적임을 시사했다.
  • 대화 라운드 수가 20을 초과할 경우, GPT-3.5 기반 시스템은 54.6%의 높은 실패율을 보였고, Vicuna-13B는 95% 이상의 실패율을 보였으며, 강력한 LLM이 없이선 의도 추론이 불안정함을 보였다.
  • 외부 LLM API 의존성으로 인해 실시간 성능 향상이 어려운 상황이며, 향후에는 저지연성 배포를 위해 로컬로 미세조정된 소형 LLM(예: 7B 또는 13B 파라미터) 개발이 필요하다고 제안된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.