[论文解读] Rethinking Model Evaluation as Narrowing the Socio-Technical Gap
本文将大语言模型(LLMs)的模型评估重新定义为缩小人机技术鸿沟的手段——使技术能力与现实世界的人类需求对齐。它主张采用基于情境和人类需求真实性的评估方法,整合人机交互(HCI)与解释性人工智能(XAI)的洞见,构建多样化、情境感知的评估框架,以平衡实用性与有效性。
The recent development of generative large language models (LLMs) poses new challenges for model evaluation that the research community and industry have been grappling with. While the versatile capabilities of these models ignite much excitement, they also inevitably make a leap toward homogenization: powering a wide range of applications with a single, often referred to as ``general-purpose'', model. In this position paper, we argue that model evaluation practices must take on a critical task to cope with the challenges and responsibilities brought by this homogenization: providing valid assessments for whether and how much human needs in diverse downstream use cases can be satisfied by the given model ( extit{socio-technical gap}). By drawing on lessons about improving research realism from the social sciences, human-computer interaction (HCI), and the interdisciplinary field of explainable AI (XAI), we urge the community to develop evaluation methods based on real-world contexts and human requirements, and embrace diverse evaluation methods with an acknowledgment of trade-offs between realisms and pragmatic costs to conduct the evaluation. By mapping HCI and current NLG evaluation methods, we identify opportunities for evaluation methods for LLMs to narrow the socio-technical gap and pose open questions.
研究动机与目标
- 应对大语言模型领域日益严重的‘评估危机’,即传统指标无法捕捉现实世界中的实用价值与社会影响。
- 突出模型同质化带来的风险:少数通用模型支撑多样化应用,但缺乏对其适用性的充分评估。
- 将模型评估重新构认为一项社会技术性工作,聚焦于弥合模型能力与用户在真实部署情境中实际需求之间的差距。
- 推动评估方法在人类需求真实性和实际可行性之间取得平衡,承认成本与代表性之间的权衡。
- 鼓励开发基于实际应用场景的评估框架,而非仅关注技术性能或合成基准。
提出的方法
- 引入‘社会技术鸿沟’的概念——即技术能力与真实应用场景中以人为本的需求之间的偏离。
- 沿两个维度对现有自然语言生成(NLG)与人机交互(HCI)评估方法进行映射:情境真实性和人类需求真实性,以识别评估方法的权衡。
- 提出基于使用案例的模拟评估,基于用户行为实证数据并经真实用户数据验证,以提高保真度并减少对纯自动化评估的依赖。
- 倡导由专家主导的定性评估,由用户体验研究人员或设计师模拟用户行为,以探测模型行为并揭示潜在风险或局限性。
- 呼吁从外部开始正式化评估过程,利用实地研究的洞见来指导并验证高层次的评估协议。
- 建议开发衡量人类期望构念(如连贯性、公平性、信任)的指标,而非仅依赖通用指标如ROUGE或BERTScore。
实验结果
研究问题
- RQ1如何重构模型评估,使其更真实地反映现实世界中的人类需求与情境化使用,而非仅关注技术基准?
- RQ2评估真实性(情境与人类需求保真度)与实际成本(计算、时间、环境)之间的权衡是什么?
- RQ3如何设计模拟评估,以有意义地近似真实用户交互,同时避免过度简化或扭曲用户行为?
- RQ4在跨多样化应用的全面大语言模型评估中,‘使用案例’的有用且具有区分性的表征应如何定义?
- RQ5在高风险模型部署背景下,何时以及如何为低成本评估方法提供正当性?
主要发现
- 传统自动指标如ROUGE和BERTScore因与现实情境中人类期望构念的对齐有限,不足以评估大语言模型。
- 人工评估虽然更具有效性,但往往缺乏标准化、可复现性与可扩展性,削弱了其在现实世界部署决策中的可靠性。
- 通用大语言模型的兴起导致了模型同质化,增加了开发者在多样化使用场景中评估适用性并阐明局限性的责任。
- 若基于实证用户行为并经真实数据验证,模拟评估可成为有价值的工具;但缺乏原则的模拟可能歪曲用户需求。
- 由专家主导的定性评估——即设计师或用户体验研究人员模拟用户行为——可揭示自动化或标准人工评估无法检测到的关键行为缺陷与风险。
- 迫切需要正式化并建立关于人类期望构念(如公平性、连贯性、信任)的共识,以指导更具意义且价值对齐的评估指标开发。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。