[论文解读] Harnessing the Power of LLMs: Evaluating Human-AI Text Co-Creation through the Lens of News Headline Generation
本研究通过一项包含40名参与者的受控实验,评估了在新闻标题生成中人类与AI协作创作的三种交互类型——指导、选择和后期编辑。研究发现,结合指导与选择的交互方式能在最小化工作量的前提下生成最高质量的标题,且AI辅助并未削弱用户对创作过程的控制感或信任感。
To explore how humans can best leverage LLMs for writing and how interacting with these models affects feelings of ownership and trust in the writing process, we compared common human-AI interaction types (e.g., guiding system, selecting from system outputs, post-editing outputs) in the context of LLM-assisted news headline generation. While LLMs alone can generate satisfactory news headlines, on average, human control is needed to fix undesirable model outputs. Of the interaction methods, guiding and selecting model output added the most benefit with the lowest cost (in time and effort). Further, AI assistance did not harm participants' perception of control compared to freeform editing.
研究动机与目标
- 探究不同人机交互方式对新闻标题生成质量、工作量及用户感知所有权的影响。
- 评估AI辅助是否削弱用户对创作过程的控制感或信任感。
- 识别在文本协作创作任务中,人类控制与AI效率之间的最佳平衡点。
- 基于实证用户交互数据,为大语言模型驱动的写作工具提供设计指南。
- 发布一个包含840个经人工评分的标题的数据集,供未来在新闻场景中评估和进行RLHF微调的大语言模型使用。
提出的方法
- 开展了一项受控的被试间实验,参与者共40名,均具备编辑经验。
- 使用一个支持三种交互类型(指导、选择、后期编辑)的原型大语言模型驱动的标题生成系统。
- 对比了五种标题生成条件:手动撰写、AI单独生成,以及三种辅助变体(指导、指导+选择、指导+选择+后期编辑)。
- 采用Taste-Attractiveness-Clarity-Truth(TACT)框架,由20名专家评估标题质量。
- 收集用户对感知控制感、信任度和工作量的主观反馈,以评估心理与可用性因素。
- 分析定量与定性数据,比较不同条件下标题生成的性能、效率与用户体验。

实验结果
研究问题
- RQ1在TACT标准下,哪种人机交互方式能生成质量最高的新闻标题?
- RQ2哪种方式在保持标题质量的前提下,最小化用户的感知工作量与时间成本?
- RQ3AI辅助如何影响用户对最终标题的控制感与信任感?
- RQ4指导、选择与后期编辑等不同交互类型对标题质量与用户体验的相对影响如何?
- RQ5指导与选择的组合是否在协作创作任务中优于单一方法或手动撰写?
主要发现
- 大语言模型单独生成的标题平均质量与人工撰写相当,但仍需人工修正错误。
- 指导与选择的组合在标题质量最高且投入时间与精力最少。
- 后期编辑与手动撰写所需工作量显著高于指导选择,且未带来标题质量的相应提升。
- 所有条件下(包括AI单独生成与手动编辑)用户报告的感知控制感与信任度水平相似。
- 指导+选择成为最优交互模式,在质量、效率与用户体验之间实现最佳平衡。
- 本研究发布了包含840个经人工评分标题的数据集,供未来在新闻生成场景中评估大语言模型及进行RLHF微调使用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。