[论文解读] STable: Table Generation Framework for Encoder-Decoder Models
STable 提出了一种新颖的文本到表格生成框架,采用基于排列的训练方式与语法约束、动态单元格排序的解码机制,应用于编码器-解码器模型。该方法在多个数据集上实现了最先进性能,通过灵活且基于置信度的表格生成方式,避免了自回归方法固有的误差累积问题,F1 分数最高提升 15%。
The output structure of database-like tables, consisting of values structured in horizontal rows and vertical columns identifiable by name, can cover a wide range of NLP tasks. Following this constatation, we propose a framework for text-to-table neural models applicable to problems such as extraction of line items, joint entity and relation extraction, or knowledge base population. The permutation-based decoder of our proposal is a generalized sequential method that comprehends information from all cells in the table. The training maximizes the expected log-likelihood for a table's content across all random permutations of the factorization order. During the content inference, we exploit the model's ability to generate cells in any order by searching over possible orderings to maximize the model's confidence and avoid substantial error accumulation, which other sequential models are prone to. Experiments demonstrate a high practical value of the framework, which establishes state-of-the-art results on several challenging datasets, outperforming previous solutions by up to 15%.
研究动机与目标
- 通过显式建模表格结构,解决自回归文本到表格生成中的误差累积与结构不一致问题。
- 将多种 NLP 任务——如实体关系抽取、知识库填充和发票解析——统一于单一、可端到端训练的框架之下。
- 实现灵活、由模型引导的解码顺序,以最大化置信度,避免对行或列顺序的刚性约束。
- 通过在所有单元格因子化顺序的排列上进行训练,提升表格生成的泛化能力与鲁棒性。
- 通过直接输出结构化、有效的表格,减少下游处理步骤,无需后处理。
提出的方法
- 提出一种基于排列的训练方法,通过最大化所有可能的表格单元格因子化顺序下的期望对数似然,提升模型性能。
- 采用语法约束解码器,通过防止无效标记序列(如未打开即结束单元格)来确保生成表格的结构有效性。
- 在推理阶段采用动态、基于置信度的单元格选择策略,每一步选择模型置信度最高的单元格,以最小化误差传播。
- 支持每步并行解码多个单元格,实现加速,同时保持性能损失最小。
- 提前预测行数,实现在内容生成前对表格进行结构化初始化。
- 利用 T5 和 TILT 基础编码器处理原始文本和文档输入,提升方法的广泛适用性。
实验结果
研究问题
- RQ1基于排列的训练方案是否能提升文本到表格生成的泛化能力与鲁棒性?
- RQ2与固定顺序的自回归生成相比,解码过程中采用动态、基于置信度的单元格排序是否能减少误差累积?
- RQ3语法约束解码是否能确保生成表格的结构有效性,而无需后处理?
- RQ4解码顺序的灵活性在多样化表格生成任务中对性能有何影响?
- RQ5并行解码在多大程度上可加快推理速度,同时保持高质量输出?
主要发现
- 在 PWC ★ 数据集上,STable 实现了 14.9% 的相对 F1 提升,从 26.8 提升至 30.8。
- 在银行对账单数据集上,模型实现了 8.8 分的 F1 提升(从 61.1 提升至 69.9),相对提升达 14.4%。
- 在 CORD 和 Rotowire Team 数据集上,模型优于线性化基线方法,表明在多样化任务中具有持续的性能增益。
- 无远距离行约束和按列解码顺序表现欠佳,表明灵活、由模型引导的排序策略更具优势。
- 每步并行解码最多 10 个单元格,使推理时间最多减少五倍,且在 Team 和 DWIE 等数据集上性能损失极小。
- 外层启发式策略(最小/最大内部得分)对性能的影响大于内部评分方法,验证了基于置信度的选择策略的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。