Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Procedural Planning via Dual Text-Image Prompting

Yujie Lu, Pan Lu|arXiv (Cornell University)|May 2, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、人間によるタスク完了を支援するためのテキスト・画像ペア計画を生成する、新しいタスクであるマルチモーダル手順計画(MPP)を紹介する。本稿では、大規模言語モデル(LLM)と拡散モデルを統合し、双方向ブリッジ(T2I-B および I2T-B)を用いる二モalityフレームワーク「テキスト・画像プロンプティング(TIP)」を提案する。この手法により、クロスモダリティの接地性が向上し、新しく収集された WikiPlan および RecipePlan データセットにおいて、単一モダリティまたはベースラインのマルチモーダル手法よりも、より情報量が多く、時間的に整合性があり、正確な計画が得られる。

ABSTRACT

Embodied agents have achieved prominent performance in following human instructions to complete tasks. However, the potential of providing instructions informed by texts and images to assist humans in completing tasks remains underexplored. To uncover this capability, we present the multimodal procedural planning (MPP) task, in which models are given a high-level goal and generate plans of paired text-image steps, providing more complementary and informative guidance than unimodal plans. The key challenges of MPP are to ensure the informativeness, temporal coherence,and accuracy of plans across modalities. To tackle this, we propose Text-Image Prompting (TIP), a dual-modality prompting method that jointly leverages zero-shot reasoning ability in large language models (LLMs) and compelling text-to-image generation ability from diffusion-based models. TIP improves the interaction in the dual modalities using Text-to-Image Bridge and Image-to-Text Bridge, allowing LLMs to guide the textual-grounded image plan generation and leveraging the descriptions of image plans to ground the textual plan reversely. To address the lack of relevant datasets, we collect WIKIPLAN and RECIPEPLAN as a testbed for MPP. Our results show compelling human preferences and automatic scores against unimodal and multimodal baselines on WIKIPLAN and RECIPEPLAN in terms of informativeness, temporal coherence, and plan accuracy. Our code and data: https://github.com/YujieLu10/MPP.

研究の動機と目的

  • 人間のタスク完了を支援するためのマルチモーダル指示(テキストおよび画像)の潜在的利点がまだ十分に解明されていないことに対処すること。
  • 情報量、時間的整合性、クロスモダリティの正確性という、マルチモーダル手順計画における主な課題を特定すること。
  • 大規模言語モデル(LLM)とテキストから画像への拡散モデルを統合する、新規の二モダリティ・プロンプティングフレームワーク(TIP)を提案すること。
  • マルチモーダル手順計画の評価を目的とした、2つの新しいベンチマークデータセット(WikiPlan および RecipePlan)を構築・公開すること。
  • TIP が自動評価および人間評価の両方において、単一モダリティおよびマルチモーダルベースラインを著しく上回る計画品質を達成することを示すこと。

提案手法

  • テキストから画像への拡散モデルを共同で活用する二モダリティ・プロンプティングフレームワーク「テキスト・画像プロンプティング(TIP)」を提案する。
  • LLM を用いて複雑で根拠のあるテキストプロンプトを生成し、T2I モデルが情報豊富な画像計画を生成できるようにする「テキストから画像へのブリッジ(T2I-B)」を実装する。
  • 生成された画像計画を言語化し、それを再び LLM にフィードバックすることで、テキスト計画の精練と根拠づけを図る「画像からテキストへのブリッジ(I2T-B)」を導入する。
  • LLM におけるゼロショット推論を用いて初期のテキスト計画を生成し、その後 I2T-B からの視覚的フィードバックを繰り返し活用して改善を図る。
  • 計画生成時にテキストおよび画像の両モダリティからの文脈を同時に考慮することで、時間的整合性を確保する。
  • 人間がアノテートしたテキスト・画像計画ペアを含む、2つの新しいデータセット(WikiPlan および RecipePlan)を収集・公開する。
Figure 3: T2I-B elicits visual imagination in LLM to generate explicit scene description (imagination prompt) for text-to-image model conditioned on the vanilla plan.
Figure 3: T2I-B elicits visual imagination in LLM to generate explicit scene description (imagination prompt) for text-to-image model conditioned on the vanilla plan.

実験結果

リサーチクエスチョン

  • RQ1テキストと画像のペアステップを含むマルチモーダル手順計画は、人間のタスク完了において、単一モダリティの計画よりも情報量が多く、正確なガイダンスを提供できるか?
  • RQ2LLM と T2I モデルを効果的に連携することで、クロスモダリティに根拠があり、時間的に整合性のある計画を生成できるか?
  • RQ3双方向ブリッジ(T2I-B および I2T-B)の導入が、マルチモーダル計画の情報量および整合性向上に与える影響は何か?
  • RQ4特にゼロショット設定において、TIP は単一モダリティおよびマルチモーダルベースラインと比べて、計画品質にどの程度優れているか?
  • RQ5提案された WikiPlan および RecipePlan データセットは、マルチモーダル手順計画の信頼できる評価をどの程度可能にするか?

主な発見

  • TIP は、WikiPlan および RecipePlan における人間評価の対面比較で、ステップベースのベースライン(S-Base)に対して 58% の勝率を記録し、計画の正確性において一貫した向上を示した。
  • I2T-B を除去した際、WikiPlan ではテキスト計画の品質が 37.5%、RecipePlan では 35.4% 減少した。これは、テキスト計画の根拠づけに I2T-B が果たす重要な役割を裏付けている。
  • T2I-B を導入することで、平均して FID スコアが 1.7% 向上し、アライメントスコアが 2.6% 向上した。これは、より正確で根拠のある画像計画の生成が可能になったことを示している。
  • 手順ベースの TIP 法がステップベースの TIP に対して 60% の勝率を記録した。これは、包括的計画が整合性および意図理解を向上させることを示している。
  • 人間評価では、情報量、整合性、正確性の観点から、TIP が生成した計画がベースラインを強く上回ることが確認された。
  • 新規に構築された WikiPlan および RecipePlan データセットは、高品質で人間がアノテートしたテキスト・画像計画ペアを備えており、マルチモーダル手順計画の信頼できるベンチマークを提供している。
(a) w. T2I-B
(a) w. T2I-B

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。