[论文解读] When Life Gives You Lemons, Make Cherryade: Converting Feedback from Bad Responses into Good Labels
该论文提出Juicer框架,通过训练满意度分类器和回复修正模型,将现实人机交互中稀疏的二值反馈和自由形式的文本反馈转化为高质量的训练数据,从而生成改进的回复。通过将这些模型生成的修正结果引入对话模型,Juicer在结合Director模型以进一步提升回复质量时,性能可与使用100%黄金标注反馈微调的模型相媲美。
Deployed dialogue agents have the potential to integrate human feedback to continuously improve themselves. However, humans may not always provide explicit signals when the chatbot makes mistakes during interactions. In this work, we propose Juicer, a framework to make use of both binary and free-form textual human feedback. It works by: (i) extending sparse binary feedback by training a satisfaction classifier to label the unlabeled data; and (ii) training a reply corrector to map the bad replies to good ones. We find that augmenting training with model-corrected replies improves the final dialogue model, and we can further improve performance by using both positive and negative replies through the recently proposed Director model.
研究动机与目标
- 解决部署中的对话系统中反馈稀疏的问题,即用户很少提供二值的点赞/点踩或黄金标注的修正。
- 利用用户在表达不满时常提供的密集自由形式文本反馈作为信号,以改进模型训练。
- 开发一种框架,自动利用反馈生成高质量的坏回复修正,实现数据增强。
- 仅使用在部署过程中收集的自然真实反馈信号,提升对话模型性能。
- 评估模型生成的修正是否能与使用完整黄金标注数据训练的模型性能相匹配或超越。
提出的方法
- 在已有二值反馈上训练二分类满意度分类器,以预测模型回复是否令人满意。
- 训练回复修正模型,基于不良回复输出和解释问题的自由形式文本反馈,生成改进的回复。
- 使用训练好的满意度分类器为数据集中未标注的回复打上标签,从而扩展反馈的覆盖范围。
- 利用回复修正模型为低满意度输出生成修正回复,创建合成的高质量训练样本。
- 将生成的修正结果与原始训练数据合并,并重新训练最终的对话模型。
- 应用Director模型,通过联合优化正负响应信号,进一步提升生成质量。
实验结果
研究问题
- RQ1自由形式的文本反馈能否有效用于训练对话系统的满意度分类器和回复修正模型?
- RQ2与仅使用黄金标注修正相比,通过模型生成的修正来增强训练数据是否能提升对话模型性能?
- RQ3Juicer与Director模型的结合是否能进一步提升回复质量,超越单独使用任一方法的效果?
- RQ4Juicer的性能与使用100%黄金标注数据训练的模型相比如何,后者可作为性能上限?
- RQ5满意度分类器的质量在反馈转换流程中对下游性能的影响程度如何?
主要发现
- 自由形式的文本反馈显著提升了满意度分类器和回复修正模型的性能,实现了对不良回复的有效识别与修正。
- 与仅使用黄金标注修正相比,通过模型生成的修正增强训练数据后,在有效且未见的测试集上F1得分更高(18.5 vs. 18.0)。
- Director模型进一步提升了性能,实现45.5%的优质回复率(人类评估),优于仅使用Juicer的41.9%。
- 最佳的Juicer模型性能与使用100%黄金数据训练的模型相当:F1得分为17.7(对比17.6),人类评估中优质回复率为45.5%(对比47.0%)。
- 通过设定阈值仅选择最可信的修正结果,可提升性能,避免低质量预测带来的性能下降。
- 即使基线模型使用100%黄金标签,该框架仍表现更优,证明其能从稀疏反馈中有效提取信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。