Skip to main content
QUICK REVIEW

[论文解读] Empirical Analysis of Training Strategies of Transformer-based Japanese Chit-chat Systems

Hiroaki Sugiyama, Masahiro Mizukami|arXiv (Cornell University)|Sep 11, 2021
Speech and dialogue systems参考文献 10被引用 10
一句话总结

本文提出基于大规模Transformer的日本语闲聊对话系统,并利用新创建的日本语数据集评估微调策略。研究发现,训练数据构成——尤其是关注个性与同理心的对话——显著影响用户印象,而模型规模和附加信息的影响则因数据集类型不同而异。

ABSTRACT

In recent years, several high-performance conversational systems have been proposed based on the Transformer encoder-decoder model. Although previous studies analyzed the effects of the model parameters and the decoding method on subjective dialogue evaluations with overall metrics, they did not analyze how the differences of fine-tuning datasets affect on user's detailed impression. In addition, the Transformer-based approach has only been verified for English, not for such languages with large inter-language distances as Japanese. In this study, we develop large-scale Transformer-based Japanese dialogue models and Japanese chit-chat datasets to examine the effectiveness of the Transformer-based approach for building chit-chat dialogue systems. We evaluated and analyzed the impressions of human dialogues in different fine-tuning datasets, model parameters, and the use of additional information.

研究动机与目标

  • 开发大规模、最先进的基于Transformer的日本语对话模型,使其与英语最先进系统相当。
  • 创建并发布用于日本语闲聊对话的基准数据集,包括PersonaChat和EmpatheticDialogues的日本语适配版本。
  • 实证分析微调数据集特征、模型规模和附加信息如何影响人类对对话质量的感知。
  • 探究训练数据构成对主观用户印象的影响,特别是在低资源、非英语环境(如日语)下的影响。
  • 评估多数据集混合和附加信息(如个人简介句子)在提升多维对话质量方面的有效性。

提出的方法

  • 在大规模基于Twitter的对话语料上预训练大规模Transformer编码器-解码器模型(参数量为0.35B至1.6B)。
  • 在三个不同的日本语闲聊数据集上微调模型:Fav(兴趣爱好对话)、ED(同理心对话)和PC(个性相关对话)。
  • 通过多维人工评估:自然性、情感表达、一致性、专注度、话题相关性以及整体印象。
  • 对比平坦微调(无附加信息)与标记微调(附加个人简介或情境上下文)对感知质量的影响。
  • 探索数据集混合策略(如Mix50K、Mix150K),以评估整合多样化数据源带来的性能提升。
  • 使用困惑度作为客观指标,并与主观人工评估结果对比,以评估自动评估与人工判断之间的一致性。

实验结果

研究问题

  • RQ1不同微调数据集(如个性、同理心、兴趣爱好)如何影响日本语闲聊系统中人类对对话质量的感知?
  • RQ2在多大程度上,添加附加信息(如个人简介句子)能改善对话质量的特定方面,如话题相关性或专注度?
  • RQ3增加模型规模是否始终能提升主观对话质量,还是其效果取决于训练数据分布?
  • RQ4混合多个数据集是否能带来优于单一数据集的性能提升,且这种效果如何随数据集质量变化?
  • RQ5自动指标(如困惑度)与人类对日本语对话系统对话质量的评估之间,相关性如何?

主要发现

  • Fav数据集(兴趣爱好对话)在整体用户印象上显著优于ED和PC,在所有评估维度上均取得最高分。
  • ED数据集提升了自然性、情感表达和一致性,但因重复性同理心回应和话题发展受限,导致专注度下降。
  • PC数据集在任何特定印象类别中均未表现出显著改善,表明尽管聚焦于个性,但对用户感知影响有限。
  • 添加附加信息(标记条件)通常导致ED和PC的总体评估得分下降,可能因对上下文过度拟合或产生僵化响应模式。
  • 模型规模仅在Fav和Mix150K数据集上与性能呈强正相关;在ED或PC上未观察到此类相关性,表明模型缩放效应具有数据集依赖性。
  • 当总数据量增加时,数据集混合能提升性能,特别是当混合高质量与低质量数据集时,表明数据量可补偿质量差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。