[논문 리뷰] Multimodal Procedural Planning via Dual Text-Image Prompting
이 논문은 인간이 작업을 수행하는 데 안내하는 텍스트-이미지 쌍 계획을 생성하는 새로운 작업인 다중모달 절차 계획(Multimodal Procedural Planning, MPP)을 소개한다. 새로운 데이터셋인 WikiPlan과 RecipePlan을 수집하여, LLM과 디퓨전 모델을 활용한 双방향 브리지(T2I-B 및 I2T-B)를 갖춘 이중모달 프레임워크인 텍스트-이미지 프롬프팅(Text-Image Prompting, TIP)을 제안한다. 이는 교차 모달 정렬을 향상시켜 단일모달 또는 기준 다중모달 방법보다 더 정보가 풍부하고 시간적으로 일관되며 정확한 계획을 생성한다.
Embodied agents have achieved prominent performance in following human instructions to complete tasks. However, the potential of providing instructions informed by texts and images to assist humans in completing tasks remains underexplored. To uncover this capability, we present the multimodal procedural planning (MPP) task, in which models are given a high-level goal and generate plans of paired text-image steps, providing more complementary and informative guidance than unimodal plans. The key challenges of MPP are to ensure the informativeness, temporal coherence,and accuracy of plans across modalities. To tackle this, we propose Text-Image Prompting (TIP), a dual-modality prompting method that jointly leverages zero-shot reasoning ability in large language models (LLMs) and compelling text-to-image generation ability from diffusion-based models. TIP improves the interaction in the dual modalities using Text-to-Image Bridge and Image-to-Text Bridge, allowing LLMs to guide the textual-grounded image plan generation and leveraging the descriptions of image plans to ground the textual plan reversely. To address the lack of relevant datasets, we collect WIKIPLAN and RECIPEPLAN as a testbed for MPP. Our results show compelling human preferences and automatic scores against unimodal and multimodal baselines on WIKIPLAN and RECIPEPLAN in terms of informativeness, temporal coherence, and plan accuracy. Our code and data: https://github.com/YujieLu10/MPP.
연구 동기 및 목표
- 인간의 작업 수행을 안내하는 데 있어 텍스트 및 이미지의 다중모달 지시어의 잠재적 기능이 아직 충분히 탐색되지 않은 점을 해결하기 위해.
- 다중모달 절차 계획에서의 핵심 과제인 정보성, 시간적 일관성, 교차 모달 정확성 등을 규명하기 위해.
- LLM과 텍스트-이미지 디퓨전 모델을 통합한 새로운 이중모달 프롬프팅 프레임워크(TIP)를 제안하기 위해.
- 다중모달 절차 계획 평가를 위한 두 가지 새로운 벤치마크 데이터셋인 WikiPlan과 RecipePlan을 구축하고 공개하기 위해.
- TIP가 자동 평가 및 인간 평가 모두에서 단일모달 및 다중모달 기준선 대비 계획 품질을 뚜렷이 향상시킨다는 것을 입증하기 위해.
제안 방법
- 절차 계획을 위한 이중모달 프롬프팅 프레임워크인 텍스트-이미지 프롬프팅(TIP)을 제안하며, 이는 LLM과 텍스트-이미지(T2I) 디퓨전 모델을 공동으로 활용한다.
- LLM을 사용해 복잡하고 지능적인 텍스트 프롬프트를 생성하는 텍스트-이미지 브리지(T2I-B)를 구현하여, T2I 모델이 정보가 풍부한 이미지 계획을 생성하도록 한다.
- 생성된 이미지 계획을 언어화하고 이를 다시 LLM에 피드백하여 텍스트 계획을 보완하고 정렬하는 이미지-텍스트 브리지(I2T-B)를 도입한다.
- LLM에서 제로샷 추론을 통해 초기 텍스트 계획을 생성한 후, I2T-B에서 유도된 시각 피드백을 반복적으로 활용해 계획을 향상시킨다.
- 계획 생성 과정에서 텍스트 및 이미지 모달의 맥락을 동시에 고려하여 시간적 일관성을 확보한다.
- 인간이 애너테이션한 텍스트-이미지 계획 쌍을 포함한 두 가지 새로운 데이터셋인 WikiPlan과 RecipePlan을 수집하고 공개한다.

실험 결과
연구 질문
- RQ1인간의 작업 수행을 위한 안내로 사용되는 텍스트 및 이미지 단위의 다중모달 절차 계획은 단일모달 계획보다 더 정보가 풍부하고 정확한가?
- RQ2LLM과 T2I 모델을 효과적으로 통합하여 교차 모달 정렬이 이루어지고 시간적으로 일관된 계획을 생성할 수 있는가?
- RQ3양방향 브리지(T2I-B 및 I2T-B)의 영향은 다중모달 계획의 정보성과 정렬 수준 향상에 어떤 영향을 미치는가?
- RQ4TIP는 제로샷 설정에서도 단일모달 및 다중모달 기준선 대비 계획 품질에서 뚜렷한 향상을 보이는가?
- RQ5제안된 WikiPlan과 RecipePlan 데이터셋은 다중모달 절차 계획 평가에 대해 얼마나 신뢰할 수 있는 기반을 제공하는가?
주요 결과
- TIP는 계획 정확도 평가에서 팀 기반 기준선(S-Base) 대비 58%의 승리 비율을 기록하여 일관된 향상을 입증했다.
- I2T-B를 제거한 실험에서 WikiPlan에서는 텍스트 계획 품질이 37.5% 감소했고, RecipePlan에서는 35.4% 감소하여, 이는 텍스트 계획 정렬에 있어 I2T-B의 핵심적 역할을 입증한다.
- T2I-B를 적용함으로써 평균 FID 점수는 1.7% 향상되고 정렬 수준은 2.6% 향상되어, 더 정확하고 정렬된 이미지 계획 생성에 효과적임을 보였다.
- 절차 기반 TIP 방법은 단계 기반 TIP 대비 60%의 승리 비율을 기록하여 통합적 계획 수립이 일관성과 의도 이해도 향상에 기여함을 시사한다.
- 인간 평가 결과, TIP가 생성한 계획은 정보성, 일관성, 정확성 측면에서 기준선 대비 강한 선호를 보였다.
- 새로운 WikiPlan과 RecipePlan 데이터셋은 고품질의 인간 애너테이션 텍스트-이미지 계획 쌍을 제공하여 다중모달 절차 계획 평가에 신뢰할 수 있는 기반을 마련했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.