Skip to main content
QUICK REVIEW

[论文解读] LaMPP: Language Models as Probabilistic Priors for Perception and Action

Belinda Z. Li, William Chen|arXiv (Cornell University)|Feb 3, 2023
Natural Language Processing Techniques被引用 4
一句话总结

LaMPP 提出了一种框架,将预训练语言模型(LMs)作为结构化图模型中的概率先验,以提升在不确定性下的感知与控制任务表现。通过将 LMs 的世界知识整合到标签和动作的概率先验分布中,LaMPP 在语义分割、导航和动作识别任务中显著提升了零样本、分布外(OOD)以及分布内(in-distribution)的泛化能力,尤其在罕见和新样本上取得了可测量的性能提升。

ABSTRACT

Language models trained on large text corpora encode rich distributional information about real-world environments and action sequences. This information plays a crucial role in current approaches to language processing tasks like question answering and instruction generation. We describe how to leverage language models for *non-linguistic* perception and control tasks. Our approach casts labeling and decision-making as inference in probabilistic graphical models in which language models parameterize prior distributions over labels, decisions and parameters, making it possible to integrate uncertain observations and incomplete background knowledge in a principled way. Applied to semantic segmentation, household navigation, and activity recognition tasks, this approach improves predictions on rare, out-of-distribution, and structurally novel inputs.

研究动机与目标

  • 为解决感知与控制系统中缺乏稳健常识先验的问题,特别是在数据稀疏或分布偏移的情况下。
  • 利用大规模语言模型(LMs)中编码的丰富、嵌入世界知识,应用于非语言任务,如图像分割与动作识别。
  • 通过概率图模型,实现不确定语言先验与特定任务非语言观测的合理整合。
  • 通过结合 LM 先验与领域特定的似然模型,提升模型在罕见、分布外及结构上新颖输入上的泛化能力。

提出的方法

  • 将感知与决策建模为概率图模型中的贝叶斯推断,其中标签空间 Y 受参数化为语言模型的先验 P(Y, Y') 所支配。
  • 利用语言模型定义 P(Y) —— 基于自然语言统计的结构化标签分布(例如场景中的物体共现关系)。
  • 将 LM 先验与特定任务的观测模型 P(X|Y) 结合,例如用于图像的视觉模型或用于动作序列的视频编码器。
  • 通过采样或优化进行近似推断,计算 P(Y|X) ∝ P(Y)P(X|Y),实现具有不确定性感知的预测。
  • 将该框架应用于三项任务:语义分割、家庭导航与视频动作识别,利用 LMs 指导标签与动作序列的推断。
  • 通过提示工程与在分布内及分布外样本上的评估,对 LM 先验进行校准,以提升其与真实世界分布的一致性。

实验结果

研究问题

  • RQ1语言模型能否作为超越自然语言理解任务的、通用有效的概率先验,用于感知与控制任务?
  • RQ2将 LM 衍生的先验整合到视觉与机器人任务中,对罕见、分布外及结构上新颖输入的性能提升有多大?
  • RQ3在合理的概率框架下,语言模型的世界知识在多大程度上能与特定任务的非语言观测有效结合?
  • RQ4当前 LMs 在为复杂决策任务(尤其是序列动作预测)提供校准先验方面存在哪些局限性?

主要发现

  • LaMPP 在语义分割任务中显著提升了零样本与分布外泛化能力,在罕见物体类别上 mIoU 绝对提升 3.5%。
  • 在视频动作识别任务中,LaMPP 在分布外设置下对保留的过渡动作序列,平均步长召回率提升 8.2%,表明对未见动作序列具有强大的泛化能力。
  • 该方法在三项任务——语义分割、导航与动作识别中均实现一致性能提升,证明了 LM 先验的广泛适用性。
  • LaMPP 即在训练分布内也表现出可测量的性能增益,表明 LM 先验有助于纠正偏差并提升标准设置下的鲁棒性。
  • 性能提升在罕见或结构上新颖的输入上最为显著,此时 LMs 提供的先验知识可有效弥补数据稀缺问题。
  • 尽管性能有所提升,LM 对动作序列的先验仍不如对物体共现关系的先验可靠,主要受限于校准不足与提示顺序偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。