Skip to main content
QUICK REVIEW

[论文解读] Convo: What does conversational programming need? An exploration of machine learning interface design

Jessica Van Brummelen, Kevin Weng|arXiv (Cornell University)|Mar 3, 2020
Speech and dialogue systems参考文献 31被引用 5
一句话总结

本研究评估了对话式编程系统 Convo 中的语音、文本及多模态输入,发现用户更偏好根据自身经验水平定制的灵活输入模式。研究识别出关键设计需求:支持多模态、可视化功能、提升 ASR/NLU 性能,以及降低认知负荷,以增强编程教育中的可访问性与学习效果。

ABSTRACT

Vast improvements in natural language understanding and speech recognition have paved the way for conversational interaction with computers. While conversational agents have often been used for short goal-oriented dialog, we know little about agents for developing computer programs. To explore the utility of natural language for programming, we conducted a study ($n$=45) comparing different input methods to a conversational programming system we developed. Participants completed novice and advanced tasks using voice-based, text-based, and voice-or-text-based systems. We found that users appreciated aspects of each system (e.g., voice-input efficiency, text-input precision) and that novice users were more optimistic about programming using voice-input than advanced users. Our results show that future conversational programming tools should be tailored to users' programming experience and allow users to choose their preferred input mode. To reduce cognitive load, future interfaces can incorporate visualizations and possess custom natural language understanding and speech recognition models for programming.

研究动机与目标

  • 调查语音、文本及多模态输入在对话式编程中对初学者与高级用户可用性及认知负荷的影响。
  • 弥补对话式人工智能在编程领域,特别是输入模式偏好与学习成果方面实证研究的不足。
  • 评估当前自然语言理解(NLU)与自动语音识别(ASR)技术是否足以支持独立运行的对话式编程系统。
  • 探索对话式编程如何降低编程教育的入门门槛,并支持计算思维能力的发展。
  • 基于实证研究结果,为未来交互式机器学习系统的设计提供可访问性与可用性的证据支持建议。

提出的方法

  • 开发了 Convo,一个具备语音用户界面(VUI)、自然语言理解(NLU)、对话管理(DM)与编程引擎(PE)的对话式编程代理。
  • 开展一项用户研究,共 45 名参与者(初学者与高级程序员)使用仅语音、仅文本及语音或文本组合的多模态系统完成任务。
  • 收集任务完成时间、系统重置次数、话语长度及求助请求次数等定量数据,作为认知负荷的指标。
  • 通过李克特量表与开放式问题收集定性反馈,涵盖可用性、满意度、偏好与使用体验。
  • 进行主题分析与定量分析,识别用户偏好、系统性能与设计挑战中的模式。
  • 探讨受限与非受限自然语言输入的影响,以及可视化在降低认知负荷中的作用。

实验结果

研究问题

  • RQ1对话式编程工具的首选输入模式是什么——语音、文本,还是多模态?这一偏好是否因用户经验水平而异?
  • RQ2不同的输入模式(语音、文本、语音或文本)如何影响编程任务中的认知负荷?
  • RQ3初学者与高级程序员在使用对话式编程系统时,其偏好与表现是否存在差异?
  • RQ4在无视觉支持的情况下,当前的自动语音识别(ASR)与自然语言理解(NLU)技术是否足以支持对话式编程?
  • RQ5在对话式编程界面中,受限还是非受限自然语言输入更有效且更易用?

主要发现

  • 初学者对基于语音的编程表现出更高的乐观情绪,表明语音输入可能有助于降低初学者的入门门槛。
  • 在认知负荷指标(完成时间、重置次数、求助请求)方面,语音、文本与多模态系统之间无显著差异,表明各类模式在任务效率方面均具可行性。
  • 用户一致要求提升语音识别性能,并减少对自然语言输入的限制,凸显当前 ASR 与 NLU 在编程场景中的局限性。
  • 用户在使用仅语音系统时报告了较高的认知负荷,主要因缺乏视觉反馈,强调了可视化在构建心智模型中的重要性。
  • 用户强烈希望实现更自然、非受限的语言输入(如“nope”、“no thanks”)以及即时系统反馈,表明互动性强、响应迅速的代理能显著提升用户体验。
  • 本研究支持设计灵活的多模态对话式编程系统,使其能根据用户经验水平自适应,并允许用户自由选择输入模式,从而减少挫败感与认知压力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。