[论文解读] Adversarial TableQA: Attention Supervision for Question Answering on Tables
本文提出神经算子(NeOp),一种用于表格问答的新颖神经网络架构,通过利用操作信息——具体而言,即推导答案所涉及的正确单元格和操作——作为注意力监督,以提升模型性能、鲁棒性与可解释性。通过引入单元格级别的注意力监督,NeOp 显著优于先前模型,在 MLB 数据集上达到 80.3% 的最终准确率,并展现出对对抗性扰动的强韧性。
The task of answering a question given a text passage has shown great developments on model performance thanks to community efforts in building useful datasets. Recently, there have been doubts whether such rapid progress has been based on truly understanding language. The same question has not been asked in the table question answering (TableQA) task, where we are tasked to answer a query given a table. We show that existing efforts, of using "answers" for both evaluation and supervision for TableQA, show deteriorating performances in adversarial settings of perturbations that do not affect the answer. This insight naturally motivates to develop new models that understand question and table more precisely. For this goal, we propose Neural Operator (NeOp), a multi-layer sequential network with attention supervision to answer the query given a table. NeOp uses multiple Selective Recurrent Units (SelRUs) to further help the interpretability of the answers of the model. Experiments show that the use of operand information to train the model significantly improves the performance and interpretability of TableQA models. NeOp outperforms all the previous models by a big margin.
研究动机与目标
- 解决现有表格问答模型仅依赖答案监督时所存在的可解释性与鲁棒性不足问题。
- 探究仅使用答案监督是否会导致模型通过虚假推理路径‘侥幸猜中’答案。
- 提出一种新型监督信号——操作信息(正确单元格与操作),以实现更精确且可解释的学习。
- 开发一种神经模型 NeOp,通过分层注意力架构利用该操作信息,以提升性能与可解释性。
- 评估模型在保留答案但改变输入单元格或操作的对抗性扰动下的鲁棒性。
提出的方法
- 神经算子(NeOp)是一种多层序列网络,由选择性循环单元(SelRUs)组成,用于列、枢纽词、参数和操作的选择。
- 每个 SelRU 层关注问题与表格中的特定组件:列、枢纽词(如‘等于’)、参数(如‘0’)以及最终操作(如‘最大值’)。
- 各 SelRU 的注意力权重用于引导选择相关表格单元格与操作,最终由操作求解器选择输出操作。
- 模型采用一种新型损失项 $L_{cell}$ 进行训练,该损失项在训练过程中鼓励正确选择单元格,从而提升注意力监督效果。
- 操作信息被用作监督:与仅提供最终答案不同,模型被训练以识别推导答案所用的正确单元格与操作。
- 该架构支持对预测结果的逐步解释,注意力权重可可视化,以显示每个时间步所选择的单元格与操作。
实验结果
研究问题
- RQ1仅通过答案监督进行训练的表格问答模型是否可能被虚假推理路径误导,从而仍得到正确答案?
- RQ2在模型训练中引入操作信息(即用于计算答案的具体单元格与操作)是否能提升模型性能与可解释性?
- RQ3与仅答案监督或基于 SQL 的监督相比,使用操作信息进行注意力监督在对抗性输入下的鲁棒性如何?
- RQ4具有分层注意力架构的神经模型是否能在表格问答任务中实现比现有模型更高的准确率与更好的可解释性?
- RQ5通过操作信息实现的注意力监督在多大程度上增强了模型对数值与操作扰动的鲁棒性?
主要发现
- NeOp 在 MLB 数据集上达到 80.3% 的最终准确率,显著优于先前模型,如 Sempre(64.4%)与 NePR(32.4%)。
- 在使用 $L_{cell}$ 损失训练时,NeOp 在 MLB 数据集上的性能提升了 17.6%,证明了单元格级别注意力监督的有效性。
- 在存在数值扰动(V-P)的对抗性样本中,NeOp 的性能仅下降 0.25%,相比 Sempre(-2.80%)与 NePR(-3.70%)展现出更高的鲁棒性。
- 在存在操作扰动(O-P)的对抗性样本中,NeOp 保持 80.1% 的准确率,表明其对操作类型变化具有极强的抗性。
- 通过分层注意力机制,模型的可解释性得到增强:每个时间步选择一列、一个枢纽词与一个参数,最终操作求解器选择正确操作,支持逐步推理的可视化。
- 将操作信息作为监督信号,可实现可扩展且无需技术背景的标注,标注人员仅需识别相关单元格与操作,而无需编写 SQL 或复杂逻辑。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。