[论文解读] Supporting Human-AI Collaboration in Auditing LLMs with LLMs
本文介绍了AdaTest++,一种增强型审计工具,通过人机协作提升对大语言模型(LLMs)故障的检测能力。通过整合意义建构支持、结构化故障组织方式以及专家设计的提示模板,AdaTest++使审计人员能够有效结合人类推理与LLM生成的测试用例,成功识别出GPT-3和Azure情感模型中的26种不同故障类型,包括此前未充分报告的危害。
Large language models are becoming increasingly pervasive and ubiquitous in society via deployment in sociotechnical systems. Yet these language models, be it for classification or generation, have been shown to be biased and behave irresponsibly, causing harm to people at scale. It is crucial to audit these language models rigorously. Existing auditing tools leverage either or both humans and AI to find failures. In this work, we draw upon literature in human-AI collaboration and sensemaking, and conduct interviews with research experts in safe and fair AI, to build upon the auditing tool: AdaTest (Ribeiro and Lundberg, 2022), which is powered by a generative large language model (LLM). Through the design process we highlight the importance of sensemaking and human-AI communication to leverage complementary strengths of humans and generative models in collaborative auditing. To evaluate the effectiveness of the augmented tool, AdaTest++, we conduct user studies with participants auditing two commercial language models: OpenAI's GPT-3 and Azure's sentiment analysis model. Qualitative analysis shows that AdaTest++ effectively leverages human strengths such as schematization, hypothesis formation and testing. Further, with our tool, participants identified a variety of failures modes, covering 26 different topics over 2 tasks, that have been shown before in formal audits and also those previously under-reported.
研究动机与目标
- 解决在社会技术系统中对大语言模型进行偏见和有害行为审计的挑战。
- 通过利用人类与生成式大语言模型的互补优势,提升审计效率。
- 通过AI增强工具支持审计人员在假设形成、测试和意义建构阶段的工作。
- 减少审计工作流中对临时性人类创造力和系统驱动自动化依赖。
- 开发一种工具,支持专家和新手审计人员识别多样化的故障模式。
提出的方法
- 扩展AdaTest,增加支持意义建构的功能,包括使用自然语言提示生成测试用例。
- 引入树状结构界面,用于可视化和组织已发现的故障,以提供全局上下文。
- 基于专家思维过程访谈设计可重用的提示模板,以指导经验较少的审计人员。
- 将大语言模型作为协作者,根据人类提供的假设按需生成测试用例。
- 通过让AI研究人员和产业从业者参与“出声思考”用户研究,评估工具的有效性。
- 采用定性分析方法提炼设计洞见,并验证该工具在协作审计中的作用。
实验结果
研究问题
- RQ1如何结构化人机协作,以有效支持大语言模型的审计?
- RQ2意义建构与沟通在审计过程中对实现有效人-大语言模型协作起到何种作用?
- RQ3专家审计策略在多大程度上可转化为可重用的提示模板,以提升工具的广泛可用性?
- RQ4AdaTest++在多大程度上能帮助审计人员识别多样化的故障模式,包括此前未充分报告的模式?
- RQ5审计人员在信任和有效使用大语言模型进行测试用例生成时面临哪些挑战?
主要发现
- 使用AdaTest++的参与者成功在与大语言模型协作过程中执行了关键的意义建构阶段,包括假设形成与验证。
- 该工具使审计人员在两个任务——问答和情感分类——中识别出26种独特的故障类型,涵盖代表性偏差、分配不公以及错误信息危害。
- 审计人员将个人专业知识与情境推理能力,与大语言模型生成的测试用例相结合,展现出互补优势。
- 部分识别出的故障此前已在正式审计中报告过,而另一些则属于此前未充分报告的类型,表明该工具对细微故障模式具有高度敏感性。
- 用户在提示工程和假设评估中的信心校准方面存在困难,凸显了对更优支撑机制和信心支持功能的需求。
- 研究揭示了当前协作支持的局限性,如缺乏对分歧的建模机制,以及对故障树共享结构的限制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。