[论文解读] Language Models as Knowledge Bases for Visual Word Sense Disambiguation
本文提出利用大型语言模型(LLMs)作为知识库,通过零样本和少样本提示技术注入LLM中存储的知识,以增强视觉词义消歧(VWSD)性能。该研究引入了一种新颖的基于文本的问答重构方法,将图像字幕作为答案选项,证明链式思维(Chain-of-Thought)提示能够实现可解释性推理,并在检索性能上优于基线视觉-语言模型。
Visual Word Sense Disambiguation (VWSD) is a novel challenging task that lies between linguistic sense disambiguation and fine-grained multimodal retrieval. The recent advancements in the development of visiolinguistic (VL) transformers suggest some off-the-self implementations with encouraging results, which however we argue that can be further improved. To this end, we propose some knowledge-enhancement techniques towards improving the retrieval performance of VL transformers via the usage of Large Language Models (LLMs) as Knowledge Bases. More specifically, knowledge stored in LLMs is retrieved with the help of appropriate prompts in a zero-shot manner, achieving performance advancements. Moreover, we convert VWSD to a purely textual question-answering (QA) problem by considering generated image captions as multiple-choice candidate answers. Zero-shot and few-shot prompting strategies are leveraged to explore the potential of such a transformation, while Chain-of-Thought (CoT) prompting in the zero-shot setting is able to reveal the internal reasoning steps an LLM follows to select the appropriate candidate. In total, our presented approach is the first one to analyze the merits of exploiting knowledge stored in LLMs in different ways to solve WVSD.
研究动机与目标
- 通过利用存储在大型语言模型(LLMs)中的知识而不进行微调,提升视觉词义消歧(VWSD)任务中的多模态检索性能。
- 探究将VWSD重构为使用生成的图像字幕作为多选答案的文本问答问题的可行性。
- 评估零样本和少样本提示策略在利用LLMs检索正确图像词义方面的有效性。
- 探索链式思维(CoT)提示作为揭示基于LLM的VWSD决策内部推理步骤的方法。
- 评估LLM作为知识库的方法在多模态、零样本设置下的可扩展性和泛化能力。
提出的方法
- 通过精心设计的提示以零样本方式从LLMs中检索知识,为模糊短语注入上下文语言知识。
- 将VWSD重构为多选问答任务,其中图像字幕作为关于正确图像词义的问题的候选答案。
- 对LLMs应用零样本和少样本提示策略,从候选列表中选择最合适的字幕。
- 使用链式思维(CoT)提示生成逐步推理轨迹,提升LLM决策的可解释性。
- 利用预训练的视觉-语言模型作为检索主干网络,并通过LLM衍生的知识注入进行增强。
- 在标准VWSD基准上评估性能,将LLM增强的检索方法与基线视觉-语言模型进行比较。
实验结果
研究问题
- RQ1LLMs能否在零样本设置下作为视觉词义消歧的有效知识库?
- RQ2将VWSD重构为使用图像字幕作为答案选项的文本问答任务,对检索性能有何影响?
- RQ3零样本和少样本提示在利用LLMs提升词义消歧准确率方面能发挥多大作用?
- RQ4链式思维(CoT)提示能否为基于LLM的VWSD决策提供有意义且人类可解释的推理轨迹?
- RQ5LLMs的规模和知识容量在多模态、知识增强的检索任务中如何影响性能?
主要发现
- LLM作为知识库的方法显著优于基线视觉-语言模型的检索性能,证明了外部知识注入的价值。
- 将VWSD重构为使用图像字幕作为答案选项的文本问答任务,能够有效利用LLMs实现多模态消歧。
- 采用链式思维的零样本提示可生成可解释的推理轨迹,揭示LLM如何为其词义选择提供理由。
- 少样本提示进一步提升了性能,表明即使仅有少量上下文示例,也能有效引导LLM实现正确消歧。
- 本研究证实LLMs可作为可扩展的、零样本的知识库用于多模态任务,克服了传统知识图谱的局限性。
- 结果表明,模型规模和LLMs内部的知识表征在视觉-语言任务中实现有效的基于知识的消歧至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。