[论文解读] What Do You Mean I'm Funny? Personalizing the Joke Skill of a Voice-Controlled Virtual Assistant
本文提出通过使用隐式用户反馈来训练自然语言处理与深度学习模型,实现语音控制虚拟助手的个性化笑话推送。研究引入两种弱监督策略——五分钟重复使用与一天内返回,证明基于这些标签训练的模型在用户满意度和笑话排序准确性方面显著优于启发式基线模型,且基于变换器的模型在离线与在线评估中均优于逻辑回归模型。
A considerable part of the success experienced by Voice-controlled virtual assistants (VVA) is due to the emotional and personalized experience they deliver, with humor being a key component in providing an engaging interaction. In this paper we describe methods used to improve the joke skill of a VVA through personalization. The first method, based on traditional NLP techniques, is robust and scalable. The others combine self-attentional network and multi-task learning to obtain better results, at the cost of added complexity. A significant challenge facing these systems is the lack of explicit user feedback needed to provide labels for the models. Instead, we explore the use of two implicit feedback-based labelling strategies. All models were evaluated on real production data. Online results show that models trained on any of the considered labels outperform a heuristic method, presenting a positive real-world impact on user satisfaction. Offline results suggest that the deep-learning approaches can improve the joke experience with respect to the other considered methods.
研究动机与目标
- 通过基于用户偏好的个性化笑话推送,提升语音控制虚拟助手的用户满意度。
- 解决缺乏显式用户反馈用于标注笑话幽默感的挑战,转而利用隐式反馈信号。
- 评估并比较传统自然语言处理模型(逻辑回归)与深度学习模型(变换器、BERT、CNN)在笑话排序中的表现。
- 确定基于隐式反馈训练的弱监督模型是否能在实际部署中超越启发式笑话选择方法。
- 评估模型准确性、可扩展性与推理延迟之间的权衡,以适应生产环境部署。
提出的方法
- 采用两种基于隐式反馈的标签生成策略:'五分钟重复使用'(若用户在5分钟内再次请求笑话则标记为正样本)与'一天内返回'(若用户在1至25小时内返回则标记为正样本)。
- 训练一个逻辑回归(LR)模型,其输入特征包括基于自然语言处理的幽默特征(如语义组合、歧义性)、特定事件关键词(如'santa')以及子词嵌入的平均值/最大池化表示。
- 深度学习模型包括自定义变换器(DL-T)、BERT(DL-BERT)、基于CNN的架构(DL-CNN),以及包含或不包含特殊注意力机制与修改损失函数的变体。
- 所有模型均采用二分类任务进行点对点排序,损失函数结合标签平滑与Dropout以实现正则化。
- 特征包括用户级(如国家代码)、项目级(笑话文本)与上下文级(请求时间戳)变量,预处理包括独热编码与归一化。
- 通过网格搜索调整超参数,包括初始学习率、批量大小、正则化强度与注意力头数量,并根据延迟约束调整模型复杂度。
实验结果
研究问题
- RQ1能否有效利用如重复使用与返回行为等隐式用户反馈信号,生成弱标签以训练笑话排序模型?
- RQ2与传统自然语言处理模型(如逻辑回归)相比,深度学习模型(如变换器、BERT)在语音助手笑话个性化选择中的表现如何?
- RQ3架构改进(如特殊注意力机制与修改损失函数)对笑话排序模型性能有何影响?
- RQ4基于隐式反馈标签训练的模型是否能提升真实世界中的用户满意度指标,如留存率与对话参与度?
- RQ5在个性化笑话技能的生产环境部署中,模型准确性、推理延迟与可扩展性之间存在何种权衡?
主要发现
- 在在线A/B测试中,基于'五分钟重复使用'或'一天内返回'标签训练的模型显著优于启发式基线模型,用户留存率提升,中断率降低。
- 基于变换器的模型(DL-T)相较流行度基线模型,AUC-ROC相对提升31%,整体准确率相对提升24%,优于所有其他模型。
- 基于BERT的模型(DL-BERT)实现AUC-ROC相对提升30%、准确率提升27%,但因模型规模较大(340M参数)导致推理延迟较高。
- 在变换器模型中引入特殊注意力机制与修改损失函数带来了可测量的性能增益,其中DL-T-noAtt与DL-T-basic的性能低于完整模型。
- 与逻辑回归基线相比,DL-BERT的Top-1准确率提升1.4,DL-T提升0.43,表明其对最相关笑话的排序能力更强。
- 逻辑回归模型提供了高性能、低延迟的基线,但需大量特征工程,且在新语言与新地区上的可扩展性较差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。