Skip to main content
QUICK REVIEW

[論文レビュー] LaMPP: Language Models as Probabilistic Priors for Perception and Action

Belinda Z. Li, William Chen|arXiv (Cornell University)|Feb 3, 2023
Natural Language Processing Techniques被引用数 4
ひとこと要約

LaMPPは、不確実性下での認知および制御タスクの性能向上を目的として、事前学習済み言語モデル(LMs)を構造的グラフィカルモデルにおける確率的事前分布として用いるフレームワークを提案する。ラベルおよび行動の事前分布にLMが持つ世界知識を統合することで、セマンティックセグメンテーション、ナビゲーション、行動認識の各タスクにおいて、ゼロショット、分布外(OOD)、分布内一般化性能が向上し、レアな入力および新しい入力に対して測定可能な向上が得られる。

ABSTRACT

Language models trained on large text corpora encode rich distributional information about real-world environments and action sequences. This information plays a crucial role in current approaches to language processing tasks like question answering and instruction generation. We describe how to leverage language models for *non-linguistic* perception and control tasks. Our approach casts labeling and decision-making as inference in probabilistic graphical models in which language models parameterize prior distributions over labels, decisions and parameters, making it possible to integrate uncertain observations and incomplete background knowledge in a principled way. Applied to semantic segmentation, household navigation, and activity recognition tasks, this approach improves predictions on rare, out-of-distribution, and structurally novel inputs.

研究の動機と目的

  • データスパarsityや分布シフトにさらされた状況下でも、頑健な常識的事前知識が欠如している認知および制御システムの課題に対処すること。
  • 大規模言語モデル(LMs)に埋め込まれた豊富な世界知識を、画像セグメンテーションや行動認識といった非言語的タスクに活用すること。
  • 確率的グラフィカルモデルを用いて、不確実性を伴う言語的事前知識とタスク固有の非言語的観測を原理的かつ整合的に統合すること。
  • LMの事前知識とドメイン固有の尤度モデルを組み合わせることで、希少な入力、分布外の入力、構造的に新しい入力に対するモデルの一般化性能を向上させること。

提案手法

  • 認知および意思決定を、ラベル空間Yが言語モデルによってパrameter化された事前分布P(Y, Y')に従う確率的グラフィカルモデルにおけるベイズ推論として定式化する。
  • 言語モデルを用いて、自然言語統計に基づいた構造的ラベル(例えば、シーン内でのオブジェクトの共起)の分布P(Y)を定義する。
  • 視覚モデルによる画像や動画エンコーダによる行動シーケンスのタスク固有の観測モデルP(X|Y)と組み合わせる。
  • サンプリングまたは最適化による近似推論を実行し、P(Y|X) ∝ P(Y)P(X|Y)を計算することで、不確実性を考慮した予測を可能にする。
  • LaMPPを、セマンティックセグメンテーション、家庭内ナビゲーション、動画行動認識の3つのタスクに適用し、LMを用いてラベルおよび行動シーケンスの推論をガイドする。
  • プロンプト工学および分布内・分布外の例での評価を通じて、LMの事前知識を現実の分布に適合させるためのキャリブレーションを実施する。

実験結果

リサーチクエスチョン

  • RQ1言語モデルは、自然言語理解をはるかに超えて、認知および制御タスクにおける効果的で汎用的な確率的事前知識として機能できるか?
  • RQ2LMから得られる事前知識を統合することで、視覚およびロボティクスタスクにおける希少な入力、分布外の入力、構造的に新しい入力に対する性能がどの程度向上するか?
  • RQ3言語モデルが持つ世界知識を、原理的な確率的フレームワーク内で、タスク固有の非言語的観測と効果的に組み合わせられるか?
  • RQ4現在のLMは、特に逐次的行動予測において、複雑な意思決定に適したキャリブレーションされた事前知識を提供する点で、どのような限界を有するか?

主な発見

  • LaMPPは、セマンティックセグメンテーションにおけるゼロショットおよび分布外一般化性能を向上させ、希少オブジェクトカテゴリにおいてmIoUが3.5%絶対的に向上した。
  • 動画行動認識においては、OOD設定下のホールドアウトされた遷移において、平均ステップリコールが8.2%向上し、未観測の行動シーケンスへの一般化性能が顕著に向上した。
  • セマンティックセグメンテーション、ナビゲーション、行動認識の3つのタスクすべてで一貫した向上が得られ、LMの事前知識の広範な適用可能性を示した。
  • LaMPPは、訓練分布内でも測定可能な向上を示しており、LMの事前知識が標準的な設定でもバイアスを是正し、モデルの頑健性を向上させることを示唆している。
  • 希少または構造的に新しい入力において、その向上が最も顕著であり、LMの事前知識がデータ不足を補う役割を果たしている。
  • 一部の向上は得られたが、行動シーケンスの予測では、LMのキャリブレーションの悪さやプロンプト順序バイアスのため、オブジェクトの共起より信頼性が低いことが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。