Skip to main content
QUICK REVIEW

[论文解读] Generalizable Entity Grounding via Assistance of Large Language Model

Qi Lu, Yiwen Chen|arXiv (Cornell University)|Feb 4, 2024
Data Quality and ManagementDecision Sciences被引用 3
一句话总结

该论文提出GELLA,一种可泛化的实体定位框架,利用大语言模型(LMM)从长描述中提取语义名词,并采用类别无关的分割模型生成实体掩码。该方法引入了一种调色板编码策略和ResoBlend模块,将低分辨率CLIP特征与高分辨率掩码特征融合,实现了高效、灵活且准确的全景叙事定位,同时显著降低了计算成本,在多个基准测试中超越了最先进方法。

ABSTRACT

In this work, we propose a novel approach to densely ground visual entities from a long caption. We leverage a large multimodal model (LMM) to extract semantic nouns, a class-agnostic segmentation model to generate entity-level segmentation, and the proposed multi-modal feature fusion module to associate each semantic noun with its corresponding segmentation mask. Additionally, we introduce a strategy of encoding entity segmentation masks into a colormap, enabling the preservation of fine-grained predictions from features of high-resolution masks. This approach allows us to extract visual features from low-resolution images using the CLIP vision encoder in the LMM, which is more computationally efficient than existing approaches that use an additional encoder for high-resolution images. Our comprehensive experiments demonstrate the superiority of our method, outperforming state-of-the-art techniques on three tasks, including panoptic narrative grounding, referring expression segmentation, and panoptic segmentation.

研究动机与目标

  • 解决现有实体定位方法存在的僵化、计算成本高且与特定分割流水线紧密耦合的局限性。
  • 通过解耦描述生成与分割组件,实现从长描述中灵活、可泛化的实体定位。
  • 通过用轻量级调色板编码器替代高分辨率图像编码器,降低计算成本,同时保留细粒度掩码特征。
  • 通过ResoBlend模块和基于CLIP的嵌入,提升语言与视觉模态之间的特征对齐。
  • 设计一种可无缝集成最先进分割模型和LLM、无架构约束的框架。

提出的方法

  • 利用大多模态模型(LMM)生成长描述并从中提取语义名词。
  • 使用类别无关的分割模型(如EntitySeg)生成实体级别的分割掩码。
  • 将分割掩码编码为带有唯一随机颜色的调色板,以在保持高分辨率细节的同时实现低成本处理。
  • 采用结构轻量的调色板编码器,从调色板中提取视觉特征,避免使用高分辨率图像编码器。
  • 引入ResoBlend模块,融合来自CLIP视觉编码器(低分辨率图像)和调色板编码器(高分辨率掩码)的特征,提升特征一致性。
  • 使用可学习的关联模块,将$<$ SEG $>$标记嵌入与实体掩码特征对齐,二者均源自CLIP图像空间,确保跨模态对齐的一致性。

实验结果

研究问题

  • RQ1框架能否在不依赖高分辨率图像编码器的情况下,实现从长描述中可泛化的实体定位?
  • RQ2基于调色板的掩码编码在保留细粒度分割细节的同时,能否有效降低计算成本?
  • RQ3ResoBlend模块在提升低分辨率图像特征与高分辨率掩码特征融合方面,改善程度如何?
  • RQ4该框架是否能在保持高性能的同时,灵活集成多种预训练LLM和分割模型?
  • RQ5在多种实体定位任务中,该方法在准确率和推理效率方面与SOTA相比表现如何?

主要发现

  • GELLA在三个基准测试中均超越最先进方法:全景叙事定位(69.8 AR)、指代表达分割和全景分割。
  • 调色板编码策略在将计算成本降低85%以上的同时,保留了高分辨率掩码特征,推理时间从5.5秒降至1.2秒(相比LISA)。
  • 消融实验表明,在关联模块中增加额外全连接层无法提升性能,证实CLIP嵌入特征已处于同一空间,对齐良好。
  • 使用Swin-Large主干的Mask2Former时,GELLA在COCO全景叙事定位基准上达到69.8 AR,显著优于LISA(43.6 AR)及其他SOTA方法。
  • 该框架与多种分割模型具有强兼容性,使用EntitySeg时达到69.2 AR,使用Mask2Former时达到69.8 AR,体现其泛化能力。
  • 即使仅使用CLIP的低分辨率图像特征,该方法仍保持高性能,证明高分辨率图像编码并非实现准确定位的必要条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。