Skip to main content
QUICK REVIEW

[论文解读] Vi(E)va LLM! A Conceptual Stack for Evaluating and Interpreting Generative AI-based Visualizations

Luca Podo, Muhammad Ishmal|arXiv (Cornell University)|Feb 3, 2024
Scientific Computing and Data ManagementDecision Sciences被引用 3
一句话总结

本文提出了 EvaLLM,一个概念性评估框架,将大语言模型(LLM)生成的可视化效果分解为原子化、可解释的组件,实现细粒度、多维度的评估。该框架被实现为一个基于网络的平台,支持自动化与人工评分,通过针对 GPT-3.5-turbo 和 Llama2-70b 的两个案例研究,验证了其有效性,揭示了生成可视化中存在结构性和语义性错误,从而为基于 LLM 的可视化任务建立了标准化基准评估的基础。

ABSTRACT

The automatic generation of visualizations is an old task that, through the years, has shown more and more interest from the research and practitioner communities. Recently, large language models (LLM) have become an interesting option for supporting generative tasks related to visualization, demonstrating initial promising results. At the same time, several pitfalls, like the multiple ways of instructing an LLM to generate the desired result, the different perspectives leading the generation (code-based, image-based, grammar-based), and the presence of hallucinations even for the visualization generation task, make their usage less affordable than expected. Following similar initiatives for benchmarking LLMs, this paper copes with the problem of modeling the evaluation of a generated visualization through an LLM. We propose a theoretical evaluation stack, EvaLLM, that decomposes the evaluation effort in its atomic components, characterizes their nature, and provides an overview of how to implement and interpret them. We also designed and implemented an evaluation platform that provides a benchmarking resource for the visualization generation task. The platform supports automatic and manual scoring conducted by multiple assessors to support a fine-grained and semantic evaluation based on the EvaLLM stack. Two case studies on GPT3.5-turbo with Code Interpreter and Llama2-70-b models show the benefits of EvaLLM and illustrate interesting results on the current state-of-the-art LLM-generated visualizations.

研究动机与目标

  • 为解决日益广泛应用但易产生幻觉且难以遵循最佳实践的大语言模型生成可视化效果缺乏标准化、全面的评估框架的问题。
  • 将评估过程建模为可分解的原子组件堆叠结构,实现对可视化质量的结构化、可解释且可重复的评估。
  • 通过设计一个基于网络的平台来实现 EvaLLM 框架,支持自动化评估与人工参与的评估流程,以实现基准测试。
  • 通过在先进 LLM 上开展实证案例研究,展示该框架的实用性,识别出可视化生成中反复出现的错误。
  • 为未来在基于 LLM 的可视化任务中开展对比基准测试与错误分类体系的构建奠定基础。

提出的方法

  • 提出 EvaLLM 作为一个概念性堆叠框架,将评估划分为分层组件,每一层代表可视化质量的一个独立维度(如结构性、语义性、感知性等)。
  • 在每一层内定义多个评分层级,以实现细粒度评分,例如数据映射的正确性、可视化类型的选择以及对设计原则的遵循程度。
  • 实现一个基于网络的评估平台,支持通过 LLM 或基于规则的检查进行自动化评分,以及由多名评估者进行人工标注。
  • 将平台与 NvBench 数据集集成,对两个 LLM(GPT-3.5-turbo 搭载代码解释器与 Llama2-70b)的 50 个样本进行评估。
  • 利用平台收集并分析 EvaLLM 各层级的评分结果,识别错误模式,并以标准化方式评估模型表现。
  • 设计评估流程以支持未来扩展至复杂可视化(如桑基图、地理地图)及仪表板的评估。

实验结果

研究问题

  • RQ1如何以结构化、多维度且可解释的方式评估 LLM 生成的可视化效果,以同时捕捉其结构性与语义性质量?
  • RQ2LLM 生成可视化中最常见的错误类型是什么?如何利用分层评估框架对这些错误进行系统性分类与诊断?
  • RQ3像 EvaLLM 这样的标准化评估堆叠在多大程度上能够实现对不同 LLM 在可视化生成任务中表现的公平且量化的比较?
  • RQ4人工评估者与自动化系统在评分 LLM 生成的可视化效果时的一致性如何?人工参与的评估在识别细微语义缺陷方面发挥什么作用?
  • RQ5所提出的框架是否能够支持构建 LLM 在可视化生成中错误的分类体系?该分类体系如何为模型改进与缓解策略提供指导?

主要发现

  • 案例研究显示,GPT-3.5-turbo 与 Llama2-70b 均频繁生成存在结构性缺陷的可视化效果,例如错误的数据映射或不恰当的图表类型。
  • 语义性错误普遍存在,包括对用户意图的误解、标签错误以及未能遵循可视化最佳实践,即使视觉输出看起来合理。
  • 评估平台成功支持了多评估者的人工评分,实现了对自动化检查难以识别的细微问题的可靠检测。
  • EvaLLM 堆叠结构能够清晰识别特定层级中的错误类型——例如颜色使用或布局方面的感知问题——从而支持针对性的模型优化。
  • 尽管样本量有限(NvBench 中的 50 个样本),该框架已展现出强大的可扩展基准测试潜力,且可进一步扩展至桑基图、地理地图等复杂可视化形式。
  • 结果表明,当前 LLM 虽能生成基础可视化,但在遵循可视化设计原则方面仍缺乏稳健性与一致性,凸显了建立标准化评估体系的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。