[论文解读] u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
u-LLaVA 提出了一种统一的多模态大语言模型框架,利用大语言模型作为认知桥梁,连接特定任务的专家模型,从而减少幻觉现象和任务干扰。通过重新组织多样化的公开数据集——包括一个全新的15K张显著性指令数据集——该方法在视觉定位、分割和图像字幕等视觉任务上实现了最先进性能,并公开了完整的代码与模型。
Recent advancements in multi-modal large language models (MLLMs) have led to substantial improvements in visual understanding, primarily driven by sophisticated modality alignment strategies. However, predominant approaches prioritize global or regional comprehension, with less focus on fine-grained, pixel-level tasks. To address this gap, we introduce u-LLaVA, an innovative unifying multi-task framework that integrates pixel, regional, and global features to refine the perceptual faculties of MLLMs. We commence by leveraging an efficient modality alignment approach, harnessing both image and video datasets to bolster the model's foundational understanding across diverse visual contexts. Subsequently, a joint instruction tuning method with task-specific projectors and decoders for end-to-end downstream training is presented. Furthermore, this work contributes a novel mask-based multi-task dataset comprising 277K samples, crafted to challenge and assess the fine-grained perception capabilities of MLLMs. The overall framework is simple, effective, and achieves state-of-the-art performance across multiple benchmarks. We also make our model, data, and code publicly accessible at https://github.com/OPPOMKLab/u-LLaVA.
研究动机与目标
- 解决多模态大语言模型(MLLM)在下游任务微调过程中出现的幻觉和任务干扰问题。
- 将视觉定位、分割和字幕生成等多样化多模态任务统一到一个可扩展的单一框架下。
- 通过重新组织和增强公开数据集,尤其是主观性任务(如显著性分割)的数据,实现高效且可复现的训练。
- 利用大语言模型的世界知识引导专家模型,而无需在真实标注上进行端到端微调。
- 在保持简洁性和模块化的同时,实现在多个基准测试上的最先进性能。
提出的方法
- 将模态对齐模块和多任务模块集成到 LLaVA 架构中,使用大语言模型作为核心推理中枢。
- 利用 BLIP2 和 GPT 重新构建和重组公开数据集——包括为显著性分割新构建的 Salient-15K 数据集——以提升指令质量和任务特异性。
- 利用大语言模型从查询中解析隐式标签信息,并引导专家模型(如 GroundingDINO、SAM)完成定位和分割任务。
- 实施交叉验证工作流:通过大语言模型解析生成边界框,并利用 mask2bbox 输出进行验证,以提升鲁棒性。
- 采用 LoRA 微调实现高效的任务适应,避免全参数重新训练。
- 解耦特定任务模块(如定位、分割),并通过大语言模型的推理能力连接,以最小化任务间干扰。
实验结果
研究问题
- RQ1能否通过将大语言模型作为专家模型之间的推理桥梁,构建统一的 MLLM 框架,以减少幻觉和任务干扰?
- RQ2重新组织和增强公开数据集——尤其是主观性任务(如显著性分割)——对模型泛化能力和性能有何影响?
- RQ3大语言模型在无需直接监督边界框或分割掩码的情况下,能在多大程度上有效引导专家模型(如 GroundingDINO、SAM)?
- RQ4一个简单且模块化的框架能否在包括 VQA、定位、分割和视频字幕在内的多样化多模态任务上实现最先进性能?
- RQ5大语言模型生成与 mask2bbox 推理结果之间的交叉验证工作流,如何提升定位准确率?
主要发现
- u-LLaVA 在 RefCOCOg 测试集上达到最先进性能,Prec@0.5 达到 72.52%,优于使用真实边界框进行训练的 Shikra 等方法。
- 在 DUT-OMRON 显著性目标检测基准上,使用 Salient-15K 数据集的模型 mAP 达到 65.46%,表明其对主观显著性的理解能力得到提升。
- 消融实验表明,在第二阶段训练中包含所有数据类型(指代、语义、显著性、字幕)可实现最佳泛化效果,全微调下 RefCOCOg 的 mAP 达到 75.63%。
- 大语言模型解析结果与 mask2bbox 输出之间的交叉验证工作流提升了定位鲁棒性,使模型在无需端到端定位训练的情况下仍能保持高性能。
- 该框架在多样化任务中保持强大性能,包括视频字幕(字幕基准上达到 67.78%)和图像修复任务,定性结果表明其推理与生成质量均有提升。
- 模型、代码及数据(包括 Salient-15K 数据集)的开源,确保了可复现性,并支持社区对框架的扩展与改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。