Skip to main content
QUICK REVIEW

[论文解读] LingoQA: Visual Question Answering for Autonomous Driving

Ana-Maria Marcu, Long Chen|arXiv (Cornell University)|Dec 21, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

LingoQA 引入了一个全面的自动驾驶视频问答基准,包含一个 419,000 个样本的数据集,提供自由形式的问题与答案。它提出了 Lingo-Judge,一种学习型文本分类器,与人类评估的斯皮尔曼等级相关系数达到 0.95,优于 BLEU、METEOR、CIDEr 和 GPT-4 等指标。

ABSTRACT

We introduce LingoQA, a novel dataset and benchmark for visual question answering in autonomous driving. The dataset contains 28K unique short video scenarios, and 419K annotations. Evaluating state-of-the-art vision-language models on our benchmark shows that their performance is below human capabilities, with GPT-4V responding truthfully to 59.6% of the questions compared to 96.6% for humans. For evaluation, we propose a truthfulness classifier, called Lingo-Judge, that achieves a 0.95 Spearman correlation coefficient to human evaluations, surpassing existing techniques like METEOR, BLEU, CIDEr, and GPT-4. We establish a baseline vision-language model and run extensive ablation studies to understand its performance. We release our dataset and benchmark as an evaluation platform for vision-language models in autonomous driving.

研究动机与目标

  • 解决端到端自动驾驶系统中可解释性不足的问题,这会阻碍公众信任。
  • 克服由于缺乏全面基准而导致的自动驾驶视频问答模型评估难题。
  • 开发一种与人类偏好高度相关的可靠自动化评估指标,用于视频问答输出。
  • 构建一个大规模、高质量的、基于真实驾驶场景的自由形式 QA 对数据集,用于训练与评估。
  • 建立一个强大的基线模型与消融实验,以指导未来在可解释自动驾驶领域的研究。

提出的方法

  • 提出 LingoQA,一个面向自动驾驶视频问答的基准,包含从伦敦中部真实驾驶场景中收集的 419,000 个样本的自由形式 QA 对数据集。
  • 设计 Lingo-Judge,一种受 GPT-Judge 启发的学习型文本分类器,通过训练预测答案的事实正确性,以实现与人类评估的相关性。
  • 在 1,000 对人工标注的 QA 对组成的保留数据集上训练分类器,以确保与人类偏好的对齐。
  • 基于 Vicuna-1.5-7B 构建视觉-语言模型,通过在 4 秒内跨 5 帧采用晚期融合技术对视频输入进行微调。
  • 对视觉-语言模型的注意力层进行部分微调,以优化其在推理与感知任务中的性能。
  • 在模型训练与超参数调优过程中,使用 Lingo-Judge 指标实现快速、可扩展的评估。

实验结果

研究问题

  • RQ1在自动驾驶视频问答背景下,像 Lingo-Judge 这类自动化指标与人类评估的相关性如何?
  • RQ2视觉-语言模型在自动驾驶视频问答中的最优架构与训练策略是什么?
  • RQ3选择不同的基础语言模型(如 Vicuna、Llama-2、Mistral)对 LingoQA 基准性能有何影响?
  • RQ4使用自由形式问题与答案在多大程度上提升了视频问答评估的真实感与覆盖范围?
  • RQ5学习型指标是否能够超越 BLEU、METEOR、CIDEr,甚至 GPT-4 等成熟指标,在评估视频问答输出方面表现更优?

主要发现

  • Lingo-Judge 与人类评估的斯皮尔曼等级相关系数达到 0.950,显著优于现有自动化指标,包括 GPT-4。
  • 表现最佳的视觉-语言模型采用 Vicuna-1.5-7B 作为语言头,结合注意力层的部分微调与晚期视频融合。
  • Vicuna-1.5-7B 在性能上优于其他 7B 模型(如 Llama-2-7B 和 Mistral-7B),而尽管参数量相近,OPT-7B 的表现显著更低。
  • LingoQA 基准包含 419,900 对 QA 对,可支持对推理、物体识别、行为解释与场景描述等任务的评估。
  • 该评估指标高效且适用于频繁使用,支持在训练与开发过程中快速迭代模型设计。
  • 该基准与评估套件已公开发布,以加速可解释自动驾驶领域的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。