Skip to main content
QUICK REVIEW

[论文解读] OtterHD: A High-Resolution Multi-modality Model

Bo Li, Peiyuan Zhang|arXiv (Cornell University)|Nov 7, 2023
Advanced Neural Network Applications被引用 6
一句话总结

OtterHD-8B 是一种基于 Fuyu-8B 架构构建的高分辨率多模态语言模型,可处理最高达 1024×1024 的可变输入分辨率,从而实现对细微视觉细节的精确理解。它在针对小物体检测的新型基准 MagnifierBench 上优于固定分辨率模型,多项选择题准确率达到 32.6%,证明了在多模态推理中灵活高分辨率输入的关键优势。

ABSTRACT

In this paper, we present OtterHD-8B, an innovative multimodal model evolved from Fuyu-8B, specifically engineered to interpret high-resolution visual inputs with granular precision. Unlike conventional models that are constrained by fixed-size vision encoders, OtterHD-8B boasts the ability to handle flexible input dimensions, ensuring its versatility across various inference requirements. Alongside this model, we introduce MagnifierBench, an evaluation framework designed to scrutinize models' ability to discern minute details and spatial relationships of small objects. Our comparative analysis reveals that while current leading models falter on this benchmark, OtterHD-8B, particularly when directly processing high-resolution inputs, outperforms its counterparts by a substantial margin. The findings illuminate the structural variances in visual information processing among different models and the influence that the vision encoders' pre-training resolution disparities have on model effectiveness within such benchmarks. Our study highlights the critical role of flexibility and high-resolution input capabilities in large multimodal models and also exemplifies the potential inherent in the Fuyu architecture's simplicity for handling complex visual data.

研究动机与目标

  • 为解决大型多模态模型(LMMs)中固定分辨率视觉编码器的局限性,此类限制会降低推理灵活性并损害高分辨率输入下的性能。
  • 开发一种可在无需微调或重采样的情况下处理可变分辨率图像的模型,利用 Fuyu-8B 架构原生的位置嵌入实现分辨率适应性。
  • 提出一个新的基准 MagnifierBench,以严格评估 LMMs 在高分辨率图像中检测小物体和空间关系的能力。
  • 证明使用高分辨率输入进行指令微调可显著提升在细粒度视觉理解任务中的性能。

提出的方法

  • OtterHD-8B 是一种基于 Fuyu-8B 的视觉-语言模型,可直接处理原始像素输入,无需独立的视觉编码器,从而原生支持可变输入分辨率。
  • 该模型在包含最高达 1024×1024 分辨率的多样化数据集上进行指令微调,使其在推理过程中能够跨分辨率范围泛化。
  • 提出一种新型评估基准 MagnifierBench,包含来自第一人称视频的高分辨率图像(例如 2466×1766),其中小物体占据图像面积的约 1%。
  • 该基准包含两种问题类型:多项选择题和自由回答题,聚焦于细微的视觉属性和物体间关系。
  • 采用低秩适应(LoRA)进行高效微调,将每轮训练时间从 3 小时缩短至 1 小时,性能下降仅 2.7%。
  • 通过使用原始分辨率输入(不重采样)和标准重采样输入对模型进行评估,以隔离分辨率灵活性的影响。

实验结果

研究问题

  • RQ1当在无固定分辨率限制的高分辨率输入上进行训练和评估时,视觉-语言模型是否能在细粒度视觉理解任务中实现更优性能?
  • RQ2缺乏固定视觉编码器在多大程度上影响模型在不同输入分辨率上的泛化能力?
  • RQ3高分辨率输入在多大程度上能提升在复杂场景中检测小而低可见度物体的性能?
  • RQ4不同的微调策略(全微调与 LoRA)在高分辨率基准上的训练效率和最终性能方面有何影响?
  • RQ5在专为测试高分辨率视觉细节识别能力而设计的基准上,当前最先进 LMMs 的相对性能如何?

主要发现

  • 当使用原始高分辨率输入评估时,OtterHD-8B 在 MagnifierBench 的多项选择题上达到 32.6% 的准确率,显著优于固定分辨率模型。
  • 传统模型如 LLaVA 和 InstructBLIP 在标准 224×224 分辨率下评估时,分别仅达到 5.6% 和 20.8% 的准确率,表明在细粒度任务上接近随机水平。
  • 使用 LoRA 进行微调将每轮训练时间从 3 小时缩短至 1 小时,同时在 MagBench 上性能下降仅 2.7%,与全微调相比损失极小。
  • 与原始 Fuyu-8B 模型相比,OtterHD-8B 在使用高分辨率数据微调后,MagBench 准确率提升 12.5%。
  • 该模型的性能对输入分辨率极为敏感:在 1024×1024 分辨率下评估时,其表现达到最先进水平;而当图像被重采样至标准分辨率时,性能急剧下降。
  • 研究结果表明,视觉编码器预训练分辨率和模型架构设计对高分辨率细节任务的有效性具有显著影响,其中灵活的端到端模型如 OtterHD-8B 展现出更优的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。