[论文解读] Sight Beyond Text: Multi-Modal Training Enhances LLMs in Truthfulness and Ethics
本论文表明,视觉指令微调——即在图文指令数据上微调大语言模型(LLMs)——可显著提升其在纯文本任务中的真实性与伦理对齐程度,甚至优于使用超过一百万个人工标注样本进行强化学习人类反馈(RLHF)微调的模型。性能提升源于图文配对中固有的高质量指令数据,而非推理时的视觉输入。
Multi-modal large language models (MLLMs) are trained based on large language models (LLM), with an enhanced capability to comprehend multi-modal inputs and generate textual responses. While they excel in multi-modal tasks, the pure NLP abilities of MLLMs are often underestimated and left untested. In this study, we get out of the box and unveil an intriguing characteristic of MLLMs -- our preliminary results suggest that visual instruction tuning, a prevailing strategy for transitioning LLMs into MLLMs, unexpectedly and interestingly helps models attain both improved truthfulness and ethical alignment in the pure NLP context. For example, a visual-instruction-tuned LLaMA2 7B model surpasses the performance of the LLaMA2-chat 7B model, fine-tuned with over one million human annotations, on TruthfulQA-mc and Ethics benchmarks. Further analysis reveals that the improved alignment can be attributed to the superior instruction quality inherent to visual-text data. In releasing our code at github.com/UCSC-VLAA/Sight-Beyond-Text, we aspire to foster further exploration into the intrinsic value of visual-text synergies and, in a broader scope, multi-modal interactions in alignment research.
研究动机与目标
- 探究多模态训练,特别是视觉指令微调,是否能提升大语言模型在纯自然语言处理任务中的真实性与伦理对齐程度。
- 挑战多模态大模型在纯语言任务中表现较差的假设,并探索其在视觉-语言理解之外的潜在能力。
- 评估视觉指令微调是否能实现强于依赖海量人工标注数据的传统RLHF方法的对齐效果。
- 分析图文数据中指令质量作为提升大语言模型对齐程度的驱动因素的作用。
- 激发更广泛的研究,探索多模态交互作为解决人工智能对齐挑战的潜在路径。
提出的方法
- 使用来自LLaVA和CC3M的视觉指令微调数据,对LLaMA-7B和OpenLLaMA-3B模型进行微调。
- 采用CLIP ViT-L/14作为视觉编码器,并通过可学习的线性投影层将视觉标记映射到语言空间。
- 采用两阶段训练:第一阶段仅微调视觉-语言连接器,冻结大语言模型和视觉编码器;第二阶段同时微调连接器和大语言模型。
- 在第二阶段采用全参数微调与LoRA方法,以比较训练效率与性能表现。
- 在纯文本基准测试中评估最终的大语言模型权重(不含视觉编码器或连接器),以隔离其语言能力。
- 开展消融实验,评估不同类型的视觉指令数据对对齐性能的影响。
实验结果
研究问题
- RQ1即使在推理过程中不使用图像,视觉指令微调是否仍能提升大语言模型在纯文本任务中的真实性与伦理对齐程度?
- RQ2在真实性与伦理基准测试中,经视觉指令微调的大语言模型与RLHF微调模型相比表现如何?
- RQ3图文指令数据的质量在推动对齐效果提升方面起到何种作用?
- RQ4是否存在某些特定类型的视觉指令数据对特定对齐目标(如真实性与伦理)更有效?
- RQ5为何多模态大模型在图像受损时表现出性能下降,尽管其在纯文本设置中对齐程度已提升?
主要发现
- 经视觉指令微调的LLaMA2 7B模型在TruthfulQA-mc上达到46.0%的得分,较基础LLaMA2 7B提升7.1%,并优于经过超过一百万条人工标注数据微调的LLaMA2-chat 7B模型。
- 同一模型在伦理基准测试中得分为65.4%,较基础LLaMA2 7B提升19.6%,且无需显式伦理提示即超越LLaMA2-chat 7B模型。
- 性能提升归因于图文配对中更高的指令数据质量,而非推理时的视觉输入。
- 该提升效果在多个大语言模型尺寸与架构中保持一致,涵盖LLaMA与OpenLLaMA的3B与7B版本。
- 消融实验表明,视觉指令数据的有效性因所测量的对齐标准而异,表明其对任务具有敏感性。
- 尽管在文本对齐方面表现强劲,多模态大模型在图像字幕生成任务中CIDEr得分下降4.2分,在受损图像上的性能下降超过17%,表明文本与视觉鲁棒性之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。