[论文解读] Parachute: Evaluating Interactive Human-LM Co-writing Systems
本文提出了 Parasystem,一种以人为本的交互式人-语言模型协同写作系统评估框架,整合了动态交互、人-模型协作以及写作成果质量。该框架提出了一种结构化、以指标为导向的方法,用于评估迭代式协同写作过程,通过一项关于前沿系统的案例研究展示了其有效性,揭示了传统静态评估方法无法捕捉用户特定的交互改进。
A surge of advances in language models (LMs) has led to significant interest in using LMs to build co-writing systems, in which humans and LMs interactively contribute to a shared writing artifact. However, there is a lack of studies assessing co-writing systems in interactive settings. We propose a human-centered evaluation framework, Parachute, for interactive co-writing systems. Parachute showcases an integrative view of interaction evaluation, where each evaluation aspect consists of categorized practical metrics. Furthermore, we present Parachute with a use case to demonstrate how to evaluate and compare co-writing systems using Parachute.
研究动机与目标
- 解决交互式人-语言模型协同写作系统缺乏全面评估方法的问题。
- 识别反映用户-模型交互动态变化的关键评估维度,超越最终成果质量的范畴。
- 开发一种实用、整合性的框架,支持公平且全面的系统对比。
- 通过现有协同写作系统的案例研究,展示该框架的实用性。
提出的方法
- 该框架 Parasystem 基于协同创作交互设计框架(COFI),识别出三个核心评估方面:人-模型交互、动态交互轨迹与写作成果评估。
- 将前沿系统中现有的评估指标分类为子组,区分客观指标与主观指标。
- 框架整合了新型动态指标(如迭代建议整合、期望调整)与传统指标(如编辑距离、创造力、满意度)。
- 采用归纳方法,将近期协同写作系统(如 Wordcraft、Dramatron、Integrative Leaps)的指标收集并映射至 Parasystem 框架中。
- 该框架支持定性与定量评估,能够实现对协同写作系统的对比分析。
- 案例研究展示了 Parasystem 如何作为思维工具,用于评估并对比不同用户类型与交互动态下的系统能力。
实验结果
研究问题
- RQ1如何在不依赖最终成果质量的前提下,评估交互式人-语言模型协同写作系统?
- RQ2哪些关键的交互动态会影响协同写作中的用户表现与满意度?
- RQ3不同用户群体(如新手与专家)如何以不同方式从协同写作系统中获益?
- RQ4哪些指标最能捕捉用户-模型交互在迭代写作步骤中的动态变化?
- RQ5如何设计一个统一、整合性的评估框架,以支持公平且全面的系统对比?
主要发现
- 仅聚焦于最终成果的传统评估方法,无法捕捉语言模型对用户表现的动态影响,尤其对新手写作者而言更为显著。
- Parasystem 框架成功地将现有协同写作系统中的 20 多项评估指标映射并分类为三个整合性方面:交互性、动态性与成果质量。
- 新手用户在使用语言模型后,其结构与语法方面有显著提升,而专家用户则收益甚微——凸显了动态交互指标的重要性。
- 诸如“采纳率”、“完成时间”和“建议整合动态”等指标,揭示了系统可用性与效率的显著差异。
- 主观指标如“成果归属感”与“自豪感”与用户满意度及系统有效性密切相关。
- 该框架使研究人员能够识别不同用户画像与交互模式下的系统优劣势,支持更明智的设计决策。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。