[논문 리뷰] Visual Prompting in Multimodal Large Language Models: A Survey
이 종합 검토는 다중모달 대규모 언어 모델(MLLM)에서 시각적 프롬프팅에 대한 첫 번째 종합 분석을 제시하며, 정교한 시각적 기반, 복합적 추론, 환각 감소를 향상시키기 위해 시각적 프롬프팅 유형, 생성 방법, 정렬 기법을 분류한다. 이 연구는 픽셀 수준의 이질적 프롬프팅과 체계적인 훈련 전략을 통해 MLLM의 인식 능력과 제어 가능성 향상에 있어 시각적 프롬프팅이 핵심적 패러다임임을 규명한다.
Multimodal large language models (MLLMs) equip pre-trained large-language models (LLMs) with visual capabilities. While textual prompting in LLMs has been widely studied, visual prompting has emerged for more fine-grained and free-form visual instructions. This paper presents the first comprehensive survey on visual prompting methods in MLLMs, focusing on visual prompting, prompt generation, compositional reasoning, and prompt learning. We categorize existing visual prompts and discuss generative methods for automatic prompt annotations on the images. We also examine visual prompting methods that enable better alignment between visual encoders and backbone LLMs, concerning MLLM's visual grounding, object referring, and compositional reasoning abilities. In addition, we provide a summary of model training and in-context learning methods to improve MLLM's perception and understanding of visual prompts. This paper examines visual prompting methods developed in MLLMs and provides a vision of the future of these methods.
연구 동기 및 목표
- MLLM에서 텍스트 기반 프롬프팅의 한계로 인한 정확하지 않은 시각적 기반 및 환각 문제를 해결하기 위해.
- 경계 상자, 마커, 픽셀 수준 프롬프팅, 소프트 프롬프팅을 포함한 시각적 프롬프팅 기법의 체계적 분류를 제공하기 위해.
- 자동 시각적 프롬프팅 생성 방법과 MLLM 추론에의 통합을 검토하여 인식 및 추론 능력을 향상시키기 위해.
- 사전 훈련, 미세조정, 인라인 학습을 통한 정렬 기법을 분석하여 시각적 프롬프팅의 오해를 줄이고 복합적 추론 능력을 향상시키기 위해.
- 시각적 프롬프팅이 편향 감소와 디퓨전 및 복원 모델에서의 제어 가능한 시각적 생성을 가능하게 하는 역할을 탐색하기 위해.
제안 방법
- 공간 해상도와 모odal의 기반으로 시각적 프롬프팅을 경계 상자, 마커, 픽셀 수준 프롬프팅, 소프트 프롬프팅의 네 가지 주요 유형으로 분류.
- 감지 기반, 세분화 기반, 디퓨전 기반 프롬프팅 생성을 포함한 자동 시각적 프롬프팅 주석 생성 방법을 검토.
- 크로스 모odal 어텐션 메커니즘을 통해 시각적 기반, 물체 지칭, 복합적 추론 향상을 위해 MLLM에 시각적 프롬프팅이 어떻게 통합되는지 분석.
- 지시 훈련, 대비 학습, 인라인 학습과 같은 모델 훈련 전략을 검토하여 시각 인코더와 LLM 백본 간의 정렬을 도모하고 프롬프팅 오해를 줄이기 위해.
- 상호 정보 복원 기법과 공동 시각-텍스트 프롬프팅을 통한 환각 감소 효과를 평가.
- ControlNet과 T2I-Adapter와 같은 제어 메커니즘을 사용하여 텍스트-이미지 디퓨전 모델, 이미지 편집, 3D 생성과 같은 시각적 생성 작업에서 시각적 프롬프팅의 활용을 조사.
실험 결과
연구 질문
- RQ1텍스트 기반 프롬프팅만을 사용할 때와 비교해 시각적 프롬프팅이 MLLM에서 시각적 기반 및 물체 지칭의 정확도를 어떻게 향상시킬 수 있는가?
- RQ2주요 시각적 프롬프팅 유형과 형태는 무엇이며, 공간적 및 功能적 해상도에서 어떻게 다를 수 있는가?
- RQ3감지, 세분화 또는 디퓨전 모델을 사용해 다양한 이미지에 대해 시각적 프롬프팅을 자동으로 생성하는 방법은 무엇인가?
- RQ4어떤 훈련 및 인라인 학습 전략이 MLLM과 시각적 프롬프팅 간의 정렬을 효과적으로 수행하여 환각과 언어 편향을 줄이는가?
- RQ5다중모달 생성 작업에서 시각적 프롬프팅은 복합적 추론 능력과 제어 가능성을 어떻게 향상시키는가?
주요 결과
- 시각적 프롬프팅은 픽셀 수준의 정교한 지시를 가능하게 하여 시각 입력과 더 잘 일치시키므로, 정교한 시각적 기반 능력 향상과 환각 감소에 크게 기여한다.
- 시각적 프롬프팅과 텍스트 프롬프팅을 병행 사용하면, 특히 다중 물체 인식 작업에서 물체 환각 현상이 감소한다.
- 상호 정보 복원 기법은 시각적 프롬프팅이 생성 과정에 미치는 영향을 증폭시켜 기반 정확도 향상과 환각 감소에 기여한다.
- 감지 모델을 통한 프롬프팅 생성은 텍스트 프롬프팅에서 핵심 개념을 추출할 경우 특히 관련성과 정밀도를 향상시킨다.
- 시각적 프롬프팅은 모델 출력을 시각적 특징에 기반시켜 언어 편향을 완화하고 부적절한 상관관계에 대한 의존도를 줄인다.
- 시각적 생성 작업에서 ControlNet과 T2I-Adapter를 통한 시각적 프롬프팅은 공간 제어를 가능하게 하며, 미세조정 후 여섯 가지 시각 작업에서 성능 향상을 이룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.