Skip to main content
QUICK REVIEW

[论文解读] FR: Folded Rationalization with a Unified Encoder

Wei Liu, Haozhao Wang|arXiv (Cornell University)|Sep 17, 2022
Topic Modeling被引用 5
一句话总结

本文提出折叠理性化(FR),一种统一框架,通过使用共享文本编码器将理性化中的生成器与预测器合并为单一阶段,消除了两阶段模型中因训练不同步导致的退化问题。FR通过共享表示学习实现互惠学习,使理性化质量在F1分数上相比最先进方法最高提升10.3%。

ABSTRACT

Conventional works generally employ a two-phase model in which a generator selects the most important pieces, followed by a predictor that makes predictions based on the selected pieces. However, such a two-phase model may incur the degeneration problem where the predictor overfits to the noise generated by a not yet well-trained generator and in turn, leads the generator to converge to a sub-optimal model that tends to select senseless pieces. To tackle this challenge, we propose Folded Rationalization (FR) that folds the two phases of the rationale model into one from the perspective of text semantic extraction. The key idea of FR is to employ a unified encoder between the generator and predictor, based on which FR can facilitate a better predictor by access to valuable information blocked by the generator in the traditional two-phase model and thus bring a better generator. Empirically, we show that FR improves the F1 score by up to 10.3% as compared to state-of-the-art methods.

研究动机与目标

  • 解决两阶段理性化模型中因生成器训练不佳导致其输出无信息性理性化文本,进而使预测器过拟合于此类低质量输入的退化问题。
  • 通过统一编码器使预测器能够访问完整输入中更丰富、未经过滤的信息,从而提升生成理性化文本的质量。
  • 消除现有两阶段框架中对复杂正则化模块或人工超参数调优(如学习率平衡)的需求。
  • 提出一种更简单、更高效的训练范式,通过共享表示学习实现生成器与预测器之间的学习同步。

提出的方法

  • FR引入一个在生成器与预测器之间共享的统一文本编码器,取代传统的两阶段流水线。
  • 生成器执行软或硬标记选择以生成理性化文本,而预测器则同时使用完整输入与理性化文本进行预测。
  • 共享编码器确保两个组件从相同的上下文表示中学习,从而实现同步且更稳定的训练。
  • 生成器通过预测器的反馈获益,而预测器则能从训练良好的生成器中获得高质量的理性化信号。
  • 该框架采用端到端联合优化进行训练,无需辅助模块或分阶段训练。
  • 该方法兼容标准理性化目标,可直接应用于现有数据集,无需对网络架构进行大规模修改。

实验结果

研究问题

  • RQ1生成器与预测器之间使用统一编码器,能否缓解两阶段理性化模型中的退化问题?
  • RQ2与分别训练生成器与预测器相比,共享表示学习在多大程度上提升了理性化质量?
  • RQ3FR在无需额外模块或超参数调优的情况下,相较于现有正则化两阶段方法,性能提升程度如何?
  • RQ4生成器与预测器之间学习速度的同步是否带来更稳定且更有效的收敛?
  • RQ5FR能否在多样化的NLP任务(如情感分析与文本分类)中保持高理性化可解释性的同时实现良好泛化?

主要发现

  • 在基准理性化数据集上,FR相比最先进方法,F1分数最高提升10.3%。
  • 该方法在无需额外正则化模块或复杂超参数调优的情况下,实现了更优性能。
  • 消融实验证实,共享编码器通过促进生成器与预测器之间的互惠学习,显著减少了退化问题。
  • 即使预测器的学习率未与生成器精确平衡,FR仍优于RNP及其他两阶段模型。
  • 失败案例揭示了在捕捉高层次世界知识与逻辑推理方面存在局限,表明在语义理解方面仍存在超越表面标记选择的改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。