[논문 리뷰] LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents
LLaVA-Plus는 종합적인 시각 지도 기반의 시각 및 시각-언어 모델 스킬 레포지토리를 통해 엔드 투 엔드 시각 지도 트레이닝을 통해 실생활 작업을 위한 동적이고 맥락 기반의 도구 조합을 학습하는 다중모odal 에이전트입니다. VisIT-Bench에서 최신 기준 성능을 기록하며, LLaVA보다 100 Elo 포인트 이상 높은 성능을 보이며 물체 검출, 의미 세분화, 상호작용 기반 이미지 편집과 같은 잠재 능력을 보여줍니다.
LLaVA-Plus is a general-purpose multimodal assistant that expands the capabilities of large multimodal models. It maintains a skill repository of pre-trained vision and vision-language models and can activate relevant tools based on users' inputs to fulfill real-world tasks. LLaVA-Plus is trained on multimodal instruction-following data to acquire the ability to use tools, covering visual understanding, generation, external knowledge retrieval, and compositions. Empirical results show that LLaVA-Plus outperforms LLaVA in existing capabilities and exhibits new ones. It is distinct in that the image query is directly grounded and actively engaged throughout the entire human-AI interaction sessions, significantly improving tool use performance and enabling new scenarios.
연구 동기 및 목표
- 실생활 시각-언어 작업을 위한 동적 도구 선택 및 조합이 가능한 일반 목적의 다중모달 보조자 개발
- 프롬프팅 기반 도구 사용의 한계를 극복하기 위해 상호작용 전반에 걸쳐 시각 신호를 지도화함으로써 내성성과 계획 능력을 향상
- 시각-언어 상호작용에서의 도구 사용을 위해 특화된 대규모 다중모달 지시 따르기 데이터셋을 새롭게 구축
- 기존 모델을 재학습하지 않고도 새로운 도구 전용 지시 데이터로 미세조정을 통해 지속적인 능력 확장 가능
- 시각 지도 기반의 엔드 투 엔드 학습이 다중모달 추론 및 도구 조합 능력의 잠재적 기능을 유도함을 입증
제안 방법
- 다양한 도구 사용 예제(시각 이해, 생성, 지식 검색 등)를 포함한 새로 구축된 다중모달 지시 따르기 데이터셋을 기반으로 모델 학습
- LLaVA-Plus는 사전 훈련된 시각 및 시각-언어 모델(예: 세분화, 검출, 이미지 생성 등)의 스킬 레포지토리를 유지하며 추론 중 동적으로 활성화 가능
- 모든 상호작용 전반에 걸쳐 원시 시각 입력을 사용함으로써 고정된 도구 호출에 의존하는 것보다 지도화된 추론과 계획 가능
- 도구 선택 및 조합은 시각 지도 지시 트레이닝을 통해 엔드 투 엔드로 학습되며, 다중모달 입력 기반으로 함수 호출과 인수를 생성할 수 있음
- 새로운 스킬은 새로운 데이터에 대한 지시 트레이닝을 통해 통합되며, 아키텍처 변경 없이 에이전트의 능력 확장을 가능하게 함
- 시각적 맥락을 유지하고 활용하는 상호작용적이고 다단계 대화 프레임워크를 지원함

실험 결과
연구 질문
- RQ1엔드 투 엔드 시각 지도 지시 트레이닝은 대규모 다중모달 모델이 복잡한 실생활 작업을 위해 여러 도구를 효과적으로 조합하는 데에 기여할 수 있는가?
- RQ2상호작용 세션 전반에 걸쳐 시각 지도를 유지할 경우, 프롬프팅 기반 방법에 비해 도구 사용 정확도와 추론 능력이著しく 향상되는가?
- RQ3기본 모델을 재학습하지 않고도 지시 트레이닝만으로 다중모달 에이전트가 새로운 도구를 학습할 수 있는가?
- RQ4도구 보강된 다중모달 에이전트의 성능은 실생활 지시 기반 벤치마크에서 최신 기준 모델과 비교해 어떻게 되는가?
- RQ5지속적인 지도화와 상호작용 환경에서 다양한 시각 및 시각-언어 도구의 조합으로부터 어떤 잠재 능력이 유도되는가?
주요 결과
- LLaVA-Plus는 VisIT-Bench 랭킹에서 새로운 최고 성능 기록을 달성하며, 1037의 에이로 등수를 기록하여 LLaVA보다 100점 이상 높은 성능을 보임
- 물체 검출 및 위치 지정과 같은 지도 작업에서 뛰어난 성능을 보이며, 다른 모델이 실패하는 역동적인 장면에서 플라이스키의 좌표를 정확히 식별함
- 시각 입력과 사용자 지시 기반으로 특정 의미적 레이아웃(예: '해저 풍경')을 가진 새로운 이미지를 생성하기 위해 여러 도구를 성공적으로 조합함
- 시각 분석과 조건부 이미지 생성 및 캡션 생성을 조합함으로써 상호작용 기반 이미지 편집 및 소셜 미디어 게시물 생성을 가능하게 하며, 계절 변화에 따른 시각 일관성을 유지함
- 실험 결과, 상호작용 전반에 걸쳐 시각 신호를 지도화할 경우 도구 사용 성능 향상과 프롬프팅 기반 에이전트에서 관찰되지 않은 새로운 능력이 가능해짐
- 모델는 검출된 장면 요소 기반으로 이미지 생성에 적절한 함수 인수를 생성하는 등 다중모달 계획 및 도구 조합의 잠재 능력을 보여줌

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.