[论文解读] FrugalScore: Learning Cheaper, Lighter and Faster Evaluation Metricsfor Automatic Text Generation
FrugalScore 提出了一种方法,通过将昂贵的基于预训练语言模型的评估指标(如 BERTScore 和 MoverScore)蒸馏为紧凑模型,来学习轻量化、快速且准确的自动文本生成评估指标。该方法在参数量减少 35 倍、推理时间缩短 24 倍的同时,保持了原始指标 96.8% 的性能,使计算资源受限的用户也能获得高质量的评估能力。
Fast and reliable evaluation metrics are key to R&D progress. While traditional natural language generation metrics are fast, they are not very reliable. Conversely, new metrics based on large pretrained language models are much more reliable, but require significant computational resources. In this paper, we propose FrugalScore, an approach to learn a fixed, low cost version of any expensive NLG metric, while retaining most of its original performance. Experiments with BERTScore and MoverScore on summarization and translation show that FrugalScore is on par with the original metrics (and sometimes better), while having several orders of magnitude less parameters and running several times faster. On average over all learned metrics, tasks, and variants, FrugalScore retains 96.8% of the performance, runs 24 times faster, and has 35 times less parameters than the original metrics. We make our trained metrics publicly available, to benefit the entire NLP community and in particular researchers and practitioners with limited resources.
研究动机与目标
- 解决基于大规模预训练语言模型的先进 NLG 评估指标所面临的高计算成本和难以访问的问题。
- 开发一种固定且低成本的替代方案,用于替代 BERTScore 和 MoverScore 等昂贵指标,同时保持与人类判断的高度相关性。
- 使计算资源有限的研究人员和实践者能够使用可靠、快速且轻量的评估指标。
- 通过训练仅需一次前向传播且无需相似度计算的紧凑模型,实现评估成本与模型大小的解耦。
- 通过高效的微调和数据整理,证明蒸馏后的指标在某些情况下可超越其原始版本。
提出的方法
- 从多个来源(包括合成数据、反向翻译和真实 NLG 数据集)采样多样化的句子对。
- 使用高性能参考指标(如 BERTScore-BERT-Base)对采样对进行评分,以创建监督训练数据集。
- 在标注数据集上使用标准微调方法(初始值为 2e-5,批大小为 32)训练一个小型轻量级模型(如 BERT-Small)。
- 在微调前对合成数据进行继续预训练,以提升泛化能力和性能。
- 推理时仅使用一次前向传播,避免昂贵的相似度计算,从而显著降低推理时间。
- 在 TAC 和 WMT 等标准基准上评估蒸馏模型,以衡量其与人类判断的相关性。
实验结果
研究问题
- RQ1是否可以训练出一个紧凑轻量的模型,以近似昂贵的大规模预训练语言模型-based NLG 评估指标的性能?
- RQ2在合成数据上继续预训练并在人工标注数据上微调,是否能提升蒸馏指标的泛化能力和准确性?
- RQ3在某些场景下,蒸馏后的指标是否可能表现优于原始指标?
- RQ4包含多样化数据源(尤其是随机生成和反向翻译生成的句子对)在多大程度上影响最终指标的性能?
- RQ5在不牺牲与人类判断相关性的情况下,评估指标的推理成本最多可降低多少?
主要发现
- FrugalScore 在所有任务、模型和变体上的平均性能达到原始指标的 96.8%,其性能通过与人类判断的皮尔逊相关系数衡量。
- FrugalScore 模型的推理速度比原始指标快 24 倍,使其在训练循环和大规模实验中可高效使用。
- 蒸馏后的模型参数量仅为原始指标的 1/35,显著降低了内存和计算开销。
- 在合成数据上继续预训练后再微调,相比直接微调,在 TAC 数据上的皮尔逊相关系数平均提升 4.4 分。
- 训练过程中排除随机对可提升性能,表明当数据分布已能捕捉语义多样性时,负样本并非必需。
- 反向翻译策略对性能贡献最大,凸显其在指标学习中数据增强方面的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。