Skip to main content
QUICK REVIEW

[논문 리뷰] LaMPP: Language Models as Probabilistic Priors for Perception and Action

Belinda Z. Li, William Chen|arXiv (Cornell University)|2023. 02. 03.
Natural Language Processing Techniques인용 수 4
한 줄 요약

LaMPP는 구조적 그래픽 모델에서 사전 훈련된 언어 모델(LMs)을 확률적 사전 분포로 사용하여 불확실성 하에서 인식 및 제어 작업을 향상시키는 프레임워크를 제안한다. 레이블과 동작에 대한 사전 분포에 LMs의 세계 지식을 통합함으로써, LaMPP는 의미 분할, 주행 탐색, 동작 인식 작업에서 희귀 및 새로운 입력에 대한 제로샷, OOD(Out-of-Distribution) 및 ID(In-Distribution) 일반화 성능을 향상시킨다. 이는 희귀 및 새로운 입력에 대해 측정 가능한 성능 향상을 이룬다.

ABSTRACT

Language models trained on large text corpora encode rich distributional information about real-world environments and action sequences. This information plays a crucial role in current approaches to language processing tasks like question answering and instruction generation. We describe how to leverage language models for *non-linguistic* perception and control tasks. Our approach casts labeling and decision-making as inference in probabilistic graphical models in which language models parameterize prior distributions over labels, decisions and parameters, making it possible to integrate uncertain observations and incomplete background knowledge in a principled way. Applied to semantic segmentation, household navigation, and activity recognition tasks, this approach improves predictions on rare, out-of-distribution, and structurally novel inputs.

연구 동기 및 목표

  • 데이터가 부족하거나 분포가 변화할 경우에도 강건한 공통 경험 사전 분포가 부족한 인식 및 제어 시스템의 문제를 해결하기 위해.
  • 대규모 언어 모델(LMs)에 내장된 풍부한 세계 지식을 자연어가 아닌 작업, 예를 들어 이미지 분할 및 동작 인식과 같은 작업에 활용하기 위해.
  • 확률적 그래픽 모델을 통해 불확실한 언어적 사전 분포와 작업에 특화된 비언어적 관측치를 원칙적으로 통합하기 위해.
  • LM 사전 분포와 도메인 특화된 가능도 모델을 조합하여 희귀, OOD, 또는 구조적으로 새로운 입력에 대한 모델 일반화 성능을 향상시키기 위해.

제안 방법

  • 인식 및 의사결정을 확률적 그래픽 모델 내 베이지안 추론으로 공식화하며, 레이블 공간 Y는 언어 모델에 의해 매개변수화된 사전 분포 P(Y, Y')에 의해 지배된다.
  • 언어 모델을 사용하여 자연어 통계 기반의 구조적 레이블(예: 장면 내 객체 동시 존재)에 대한 분포 P(Y)를 정의한다.
  • 비전 모델을 사용한 이미지나 동작 시퀀스를 위한 비디오 인코더와 같은 작업에 특화된 관측 모델 P(X|Y)와 LM 사전 분포를 조합한다.
  • 샘플링 또는 최적화를 통한 근사 추론을 수행하여 P(Y|X) ∝ P(Y)P(X|Y)를 계산함으로써 불확실성 인식 예측을 가능하게 한다.
  • LaMPP 프레임워크를 의미 분할, 가정 내 탐색, 비디오 동작 인식의 세 가지 작업에 적용하여, LMs를 사용해 레이블 및 동작 시퀀스 추론을 이끌어낸다.
  • 프롬프트 엔지니어링과 도메인 내 및 도메인 외 예제에서의 평가를 통해 LM 사전 분포를 校정하여 실제 세계 분포와의 일치도를 향상시킨다.

실험 결과

연구 질문

  • RQ1언어 모델이 자연어 이해를 넘어서 인식 및 제어 작업에 효과적인 일반 목적의 확률적 사전 분포로 기능할 수 있는가?
  • RQ2LM에서 유도된 사전 분포를 통합할 경우, 시각 및 로봇 작업에서 희귀, OOD, 또는 구조적으로 새로운 입력에 대한 성능 향상 정도는 어떠한가?
  • RQ3언어 모델의 세계 지식이 원칙적인 확률적 프레임워크 내에서 작업에 특화된 비언어적 관측치와 얼마나 효과적으로 조합될 수 있는가?
  • RQ4현재의 LMs는 순차적 행동 예측와 같은 복잡한 의사결정 과정에서 보정된 사전 분포를 제공하는 데에 얼마나 제한되어 있는가?

주요 결과

  • LaMPP는 의미 분할에서 제로샷 및 OOD 일반화 성능을 향상시키며, 희귀 객체 카테고리에서 mIoU가 3.5% 절대 향상되었다.
  • 비디오 동작 인식에서, OOD 설정에서 보류된 전이에 대해 평균 스텝 리콜이 8.2% 향상되어, 새로운 동작 시퀀스에 대한 강력한 일반화 성능을 보였다.
  • LaMPP는 의미 분할, 탐색, 동작 인식의 세 작업 전반에서 일관된 성능 향상을 달성하여, LM 사전 분포의 광범위한 적용 가능성을 입증했다.
  • LaMPP는 학습 분포 내에서도 측정 가능한 성능 향상을 보였으며, 이는 LM 사전 분포가 표준 설정에서 편향을 교정하고 강건성을 향상시킨다는 것을 시사한다.
  • 희귀 또는 구조적으로 새로운 입력에서 성능 향상이 가장 두드러지며, 이는 LMs의 사전 지식이 데이터 부족을 상쇄하는 데 기여한다.
  • 성과에도 불구하고, 동작 시퀀스에 대한 LM 사전 분포는 객체 동시 존재에 비해 여전히 신뢰도가 낮으며, LMs의 보정 부족과 프롬프트 순서 편향으로 인해 문제가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.