[论文解读] Building Your Own Product Copilot: Challenges, Opportunities, and Needs
本文基于对26名专业工程师的访谈,研究了软件工程师在使用大型语言模型(LLMs)构建AI驱动的产品副驾驶时面临的挑战。研究识别出提示工程、测试、状态管理及工具链方面的关键痛点,并提出需要统一、标准化的工具链与最佳实践,以简化开发流程并提升AI优先软件工程工作流的可靠性。
A race is underway to embed advanced AI capabilities into products. These product copilots enable users to ask questions in natural language and receive relevant responses that are specific to the user's context. In fact, virtually every large technology company is looking to add these capabilities to their software products. However, for most software engineers, this is often their first encounter with integrating AI-powered technology. Furthermore, software engineering processes and tools have not caught up with the challenges and scale involved with building AI-powered applications. In this work, we present the findings of an interview study with 26 professional software engineers responsible for building product copilots at various companies. From our interviews, we found pain points at every step of the engineering process and the challenges that strained existing development practices. We then conducted group brainstorming sessions to collaborative on opportunities and tool designs for the broader software engineering community.
研究动机与目标
- 理解软件工程师在使用大型语言模型(LLMs)构建产品副驾驶时所面临的现实挑战。
- 识别在开发AI驱动应用过程中,整个软件工程生命周期中的痛点。
- 探讨在生产环境中,LLM系统缺乏标准化工具链、测试实践与指标的问题。
- 提出可操作的机会与工具设计,以支持可扩展、可靠且可维护的副驾驶开发。
- 应对快速LLM创新与成熟AI集成产品工程实践之间日益扩大的差距。
提出的方法
- 对26名在主要科技公司负责构建产品副驾驶的专业软件工程师进行了深入访谈。
- 分析了从提示工程、测试、状态管理到工具集成等整个软件工程生命周期中的痛点。
- 组织小组头脑风暴会议,协作识别未来工具链的机遇与设计原则。
- 绘制现有工具链生态系统(如LangChain、Semantic Kernel)的图谱,并评估其在支持端到端副驾驶开发方面的局限性。
- 征求了对提示版本控制、成本监控及LLM行为可观测性等期望功能的反馈。
- 将发现整合为一个工具链需求框架,强调AI优先开发中的可用性、可维护性与开发者体验。
实验结果
研究问题
- RQ1工程师在真实环境中使用LLMs构建产品副驾驶时面临的主要挑战是什么?
- RQ2当前的软件工程实践与工具在支持LLM驱动应用开发方面存在哪些不足?
- RQ3为提高产品副驾驶的可靠性、可测试性与可维护性,最需要什么样的工具链与最佳实践?
- RQ4工程师如何在生产系统中管理提示工程、状态管理及模型行为的不可预测性?
- RQ5指标、可观测性与成本监控在AI副驾驶的开发与维护中起到什么作用?
主要发现
- 提示工程是主要瓶颈,由于LLM输出的脆弱性与不可预测性,需大量试错与事后调优。
- LLM工作流的测试极具挑战,因缺乏标准化指标,且缺少针对提示与模型行为变更的回归测试工具。
- 工程师报告在管理对话状态、编排复杂工作流以及确保不同LLM间行为一致性方面面临显著困难。
- 对统一、一站式开发环境的需求强烈,该环境应集成提示模板、向量数据库、托管服务与测试框架。
- 由于微小的提示变更或模型更新导致的成本与性能波动是主要担忧,工程师呼吁提供实时警报与可观测性工具。
- 尽管已有LangChain等框架,开发者在工具集成、复杂LLM流水线的可读性与可解释性方面仍面临困难。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。