Skip to main content
QUICK REVIEW

[论文解读] CHATREPORT: Democratizing Sustainability Disclosure Analysis through LLM-based Tools

Jingwei Ni, Julia Bingler|arXiv (Cornell University)|Jul 28, 2023
Big Data and Business Intelligence被引用 6
一句话总结

本文介绍了 chatReport,一个基于大语言模型的系统,通过将答案基于源文本并支持可追溯、专家参与的提示,实现了企业可持续性报告分析的自动化。该系统通过抽取式回答和源文引用,有效降低了幻觉现象,同时积极引入领域专家参与提示开发,最终形成一个公开可用的数据集和工具,推动可持续性披露分析的民主化。

ABSTRACT

In the face of climate change, are companies really taking substantial steps toward more sustainable operations? A comprehensive answer lies in the dense, information-rich landscape of corporate sustainability reports. However, the sheer volume and complexity of these reports make human analysis very costly. Therefore, only a few entities worldwide have the resources to analyze these reports at scale, which leads to a lack of transparency in sustainability reporting. Empowering stakeholders with LLM-based automatic analysis tools can be a promising way to democratize sustainability report analysis. However, developing such tools is challenging due to (1) the hallucination of LLMs and (2) the inefficiency of bringing domain experts into the AI development loop. In this paper, we ChatReport, a novel LLM-based system to automate the analysis of corporate sustainability reports, addressing existing challenges by (1) making the answers traceable to reduce the harm of hallucination and (2) actively involving domain experts in the development loop. We make our methodology, annotated datasets, and generated analyses of 1015 reports publicly available.

研究动机与目标

  • 解决长篇企业可持续性报告人工分析成本高、可及性低的问题。
  • 通过可追溯的抽取式回答与源文引用,降低大语言模型在可持续性披露分析中的幻觉现象。
  • 通过将专家反馈转化为可重用的提示规范,系统性地将领域专家整合进人工智能开发流程。
  • 基于气候相关财务信息披露工作组(TCFD)框架,建立披露质量的基准评估体系。
  • 提供一个公开可访问的数据集和工具,实现可持续性报告分析的透明化与可扩展性。

提出的方法

  • 系统采用检索增强生成(RAG)技术,将大语言模型的回答锚定在可持续性报告中的相关段落。
  • 采用抽取式答案生成策略,确保回答内容均直接获得源文本证据的支持。
  • 提出一种新颖的提示工程框架,可自动将专家对大语言模型输出的反馈转化为可重用、通用的提示模板。
  • 系统基于气候相关财务信息披露工作组(TCFD)框架,计算 TCFD 符合性评分,用于评估披露质量。
  • 支持用户驱动的问题回答,提供完整的源文引用,使用户可通过关键词搜索验证声明。
  • 采用基于 Cohen’s Kappa(0.54)的人工评估协议,用于评估幻觉现象与引用准确性的表现。
Figure 1: chatReport Pipeline
Figure 1: chatReport Pipeline

实验结果

研究问题

  • RQ1大语言模型系统如何降低在复杂可持续性报告分析中的幻觉现象?
  • RQ2在可持续性分析中,领域专家在大语言模型提示开发过程中的系统性整合程度如何?
  • RQ3自动化系统是否能在大规模场景下实现可靠、可追溯且可解释的可持续性披露分析?
  • RQ4源文引用与抽取式生成对降低大语言模型输出中幻觉现象的影响如何?
  • RQ5所提出的框架在生成 TCFD 披露合规性一致且准确评估方面效果如何?

主要发现

  • 系统实现了极高的无幻觉率,所有幻觉案例均可通过源文引用和抽取式回答格式轻松识别。
  • 人工评估中观察到 Cohen’s Kappa 为 0.54,表明在幻觉检测方面人工标注者间达成中等程度的一致性,证实答案与参考文献之间的差异易于被识别。
  • 系统成功为 1,015 份可持续性报告计算了 TCFD 符合性评分,实现了披露质量的基准化评估。
  • 采用可追溯的抽取式回答使用户能够通过在原始报告中搜索关键词来验证声明,显著提升了透明度。
  • 专家参与的提示工程框架成功将反馈转化为可重用的提示规范,提升了模型在多样化报告中的可靠性。
  • 生成的包含源文引用的大语言模型输出数据集已公开可用,为未来大语言模型引用验证研究提供了支持。
Figure 2: Automatic prompt engineering pipeline.
Figure 2: Automatic prompt engineering pipeline.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。