Skip to main content
QUICK REVIEW

[论文解读] Report from the NSF Future Directions Workshop, Toward User-Oriented Agents: Research Directions and Challenges

Maxine Eskénazi, Tiancheng Zhao|arXiv (Cornell University)|Jun 10, 2020
Topic Modeling参考文献 134被引用 6
一句话总结

本文提出了一项以用户为中心的智能代理研究议程,将研究重点从代理能力转向用户需求、满意度与伦理完整性。该议程倡导跨学科研究、隐私保护的数据方法、对抗鲁棒性以及标准化评估,以确保在现实应用中实现可信、自适应且安全的代理系统。

ABSTRACT

This USER Workshop was convened with the goal of defining future research directions for the burgeoning intelligent agent research community and to communicate them to the National Science Foundation. It took place in Pittsburgh Pennsylvania on October 24 and 25, 2019 and was sponsored by National Science Foundation Grant Number IIS-1934222. Any opinions, findings and conclusions or future directions expressed in this document are those of the authors and do not necessarily reflect the views of the National Science Foundation. The 27 participants presented their individual research interests and their personal research goals. In the breakout sessions that followed, the participants defined the main research areas within the domain of intelligent agents and they discussed the major future directions that the research in each area of this domain should take

研究动机与目标

  • 通过将研究重点从以代理为中心的度量标准转向用户结果,解决代理性能与实际用户满意度之间日益扩大的脱节问题。
  • 通过确保代理行为的伦理、透明与可靠,防止重演过去的人工智能资金危机(如1990年代的自动语音识别衰退)。
  • 建立支持可复现性的研究基础设施,包括开源工具、共享任务与标准化评估平台。
  • 确保代理能够抵御对抗性输入,并具备检测有害行为(如攻击性语言或偏见)的能力。
  • 通过在提案中强制要求伦理考量、学生教育与公众传播,建立研究中的伦理标准。

提出的方法

  • 提出从基于词汇相似度(如BLEU)的代理评估,转向在交互式、现实世界对话场景中评估用户满意度与感知有用性。
  • 引入代理的“驾照”概念——标准化、全面的评估框架,用于在部署前认证代理质量。
  • 开发隐私保护算法,在最小化信息损失的前提下对敏感数据(语音、文本、视觉)进行匿名化处理。
  • 构建鲁棒的检测系统,以识别并缓解不适当代理行为,包括攻击性语言、错误信息与偏见。
  • 设计对对抗性用户输入具备内在鲁棒性的代理,尤其针对像微软Tay这样的持续学习系统。
  • 推广共享研究平台与开放数据,辅以数据表,以确保对话研究的透明性与可复现性。

实验结果

研究问题

  • RQ1如何重新定向智能代理研究,使其优先考虑用户满意度与感知有用性,而非代理生成输出的质量?
  • RQ2需要哪些标准化评估框架,以确保部署后代理的可信性与安全性?
  • RQ3如何在不牺牲模型效用的前提下,保护训练数据中的隐私,特别是在多模态与基于语音的系统中?
  • RQ4有哪些方法可以实现实时检测与防止有害代理行为(如偏见、错误信息或攻击性语言)?
  • RQ5如何在仍能从现实世界交互数据中获益的同时,使代理对对抗性用户输入具备鲁棒性?

主要发现

  • 当前的评估指标(如BLEU)与实际对话成功或用户满意度之间缺乏相关性,凸显了代理评估中的关键缺陷。
  • 2016年微软Tay事件——在16小时内因对抗性用户输入而被关闭——凸显了基于学习的代理亟需具备对抗鲁棒性。
  • 模拟用户与付费用户无法可靠反映真实用户行为,从而削弱了对话系统评估的有效性。
  • 迫切需要建立伦理研究实践,包括在提案中强制要求伦理考量与学生培训。
  • 标准化、开放且可重用的研究基础设施(包括共享任务与文档化的预训练模型)对于可复现性与研究进展至关重要。
  • 应开发代理的“驾照”——全面、多维度的评估——以确保在公开部署前具备安全与可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。