Skip to main content
QUICK REVIEW

[论文解读] Mapping the Challenges of HCI: An Application and Evaluation of ChatGPT for Mining Insights at Scale

Jonas Oppenlaender, Joonas Hämäläinen|arXiv (Cornell University)|Jun 8, 2023
Topic Modeling被引用 5
一句话总结

本文提出了一种基于大语言模型的两步法,利用ChatGPT(GPT-3.5)和GPT-4自动识别并筛选2023年CHI会议论文集中的研究挑战。通过先使用成本效益高的ChatGPT进行初步提取,再利用GPT-4进行高精度过滤,该方法成功从113个HCI主题中挖掘出4,392项研究挑战,表明大语言模型能够以强大的成本效益和可靠性,实现对大规模学术文献的可扩展、洞察驱动的定性分析。

ABSTRACT

Large language models (LLMs) are increasingly used for analytical tasks, yet their effectiveness in real-world applications remains underexamined, partly due to the opacity of proprietary models. We evaluate ChatGPT (GPT-3.5 and GPT-4) on the practical task of extracting research challenges from a large scholarly corpus in Human-Computer Interaction (HCI). Using a two-step approach, we first apply GPT-3.5 to extract candidate challenges from the 879 papers in the 2023 ACM CHI Conference proceedings, then use GPT-4 to select the most relevant challenges per paper. This process yielded 4,392 research challenges across 113 topics, which we organized through topic modeling and present in an interactive visualization. We compare the identified challenges with previously established HCI grand challenges and the United Nations Sustainable Development Goals, finding both strong alignment in areas such as ethics and accessibility, and gaps in areas such as human-AI collaboration. A task-specific evaluation with human raters confirmed near-perfect agreement that the extracted statements represent plausible research challenges (\k{appa} = 0.97). The two-step approach proved cost-effective at approximately US$50 for the full corpus, suggesting that LLMs offer a practical means for qualitative text analysis at scale, particularly for prototyping research ideas and examining corpora from multiple analytical perspectives.

研究动机与目标

  • 为解决在多样化且快速发展的人机交互(HCI)领域中识别当前研究挑战的挑战。
  • 评估闭源大语言模型——特别是ChatGPT和GPT-4——在使用前所未见数据进行知识密集型、洞察挖掘任务时的真实世界表现。
  • 证明结合成本效益高的大语言模型(如ChatGPT)与更高精度模型(如GPT-4)能够实现对大规模学术文本语料的可扩展、灵活且可靠的定性分析。
  • 提供一个实用且可复现的框架,用于大规模挖掘学术文献中的洞察,对学术研究和产业应用均具有启示意义。

提出的方法

  • 采用两步提示工程流水线:首先,使用结构化提示,由ChatGPT(GPT-3.5)从879篇CHI 2023论文中提取候选研究挑战。
  • 其次,使用GPT-4对候选挑战列表进行筛选,每篇论文仅保留最重要的五个挑战,以确保更高的精确度和质量。
  • 通过BERTopic进行主题建模,并使用UMAP进行降维和二维交互式地图可视化。
  • 通过迭代优化提示工程以提升一致性和可靠性,同时认识到提示设计是影响输出质量的关键因素。
  • 最终的4,392项挑战数据集通过定性评估进行了验证,样本输出中未检测到显著偏差。
  • 已将挑战的交互式可视化结果发布于 https://hci-research-challenges.github.io,供公众探索和下载。

实验结果

研究问题

  • RQ1大语言模型(如ChatGPT和GPT-4)能否有效识别大规模真实世界学术文献语料(如CHI 2023论文集)中的研究挑战?
  • RQ2将成本效益高的模型(ChatGPT)与更高精度模型(GPT-4)结合,如何提升从学术文本中进行洞察挖掘的可扩展性和可靠性?
  • RQ3大语言模型的输出在多大程度上对提示设计敏感?如何通过提示工程提升此类任务中的一致性和质量?
  • RQ4大语言模型是否可以在不依赖预设基准或标注数据的情况下,从学术文献中提取出有意义且非平凡的洞察?
  • RQ5在学术研究中,使用大语言模型进行定性分析的实际影响是什么,特别是在成本效益和灵活性方面?

主要发现

  • 该两步法大语言模型流水线成功从879篇CHI 2023论文中,跨越113个不同主题(从可访问性到可视化等)提取出4,392项研究挑战。
  • 使用ChatGPT进行初步提取、GPT-4进行筛选的策略被证明具有成本效益,能够在保证高精度的同时处理大规模语料。
  • 在确立最优提示后,该方法展现出强大的一致性和可靠性,输出仅存在轻微偏差。
  • 通过BERTopic和UMAP成功实现了研究挑战的可视化,生成了可访问的交互式、主题标注地图,网址为 https://hci-research-challenges.github.io。
  • 在提取挑战的定性样本中未检测到显著偏差,表明该方法可产生可信且非刻板印象的输出。
  • 本研究强调,当结合精心设计的提示和战略性模型组合时,大语言模型可作为学术研究中大规模定性分析的强大工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。