Skip to main content
QUICK REVIEW

[论文解读] Same Side Stance Classification Task: Facilitating Argument Stance Classification by Fine-tuning a BERT Model

Stefan Ollinger, Lorik Dumani|arXiv (Cornell University)|Apr 23, 2020
Topic Modeling参考文献 8被引用 6
一句话总结

该论文提出微调一个 BERT 模型用于同一立场分类任务,其目标是在无需特定主题标注的情况下,判断两个论点是否对某一主题持相同立场。在辩论网站获取的论点对上微调 BERT-base 和 BERT-large 模型,该方法实现了最先进性能,其中大模型在未截断的同主题测试数据上达到 94.71% 的准确率,优于支持向量机(SVM)基线模型,并在共享任务排行榜上排名第一。

ABSTRACT

Research on computational argumentation is currently being intensively investigated. The goal of this community is to find the best pro and con arguments for a user given topic either to form an opinion for oneself, or to persuade others to adopt a certain standpoint. While existing argument mining methods can find appropriate arguments for a topic, a correct classification into pro and con is not yet reliable. The same side stance classification task provides a dataset of argument pairs classified by whether or not both arguments share the same stance and does not need to distinguish between topic-specific pro and con vocabulary but only the argument similarity within a stance needs to be assessed. The results of our contribution to the task are build on a setup based on the BERT architecture. We fine-tuned a pre-trained BERT model for three epochs and used the first 512 tokens of each argument to predict if two arguments share the same stance.

研究动机与目标

  • 为解决现有方法需要特定主题训练而难以在不同主题间可靠分类论点立场的挑战。
  • 通过聚焦于判断两个论点是否持相同立场,而非区分支持/反对标签,简化立场分类任务。
  • 评估基于 BERT 的模型在无需显式特征工程的情况下,学习论点之间语义相似性的有效性。
  • 研究输入序列长度及截断对立场分类模型性能的影响。

提出的方法

  • 在标注为相同立场或不同立场的论点对数据集上,对预训练的 BERT-base 和 BERT-large 模型进行三轮微调。
  • 将每对论点的前 512 个词元作为输入,通过 [CLS] 词元表示进行分类。
  • 在两种设置下训练和评估模型:同主题(训练集与测试集主题相同)和跨主题(训练集与测试集主题不同)。
  • 在不同最大序列长度(32 至 512 个词元)下比较性能,包括截断和非截断数据。
  • 使用准确率和 F1 分数评估模型性能,结果报告在截断和完整句子输入上。
  • 使用 Hugging Face Transformers 库实现并训练 BERT 模型,利用上下文嵌入实现语义相似性检测。

实验结果

研究问题

  • RQ1微调后的 BERT 模型是否能在同一立场分类任务中超越传统的基于 SVM 的基线模型?
  • RQ2增加输入序列长度是否能提升具有不同句法和语义复杂度的论点对的分类准确率?
  • RQ3模型性能是否对输入截断敏感?还是能有效从部分句子中学习?
  • RQ4当在某一主题上训练并在另一主题上测试时,模型是否具有更好的泛化能力?
  • RQ5基于 BERT 的方法是否能在无需显式特征工程的情况下,学习论点立场的有意义语义表征?

主要发现

  • BERT-large 模型在未截断的同主题测试数据上达到 94.71% 的准确率,显著优于 54% 准确率的 SVM 基线模型。
  • BERT-base 模型在未截断的同主题测试数据上达到 90.64% 的准确率,即使在较小架构下也表现出强劲性能。
  • 在所有序列长度设置下,大模型在同主题和跨主题评估中均优于基础模型。
  • 将输入截断至 512 个词元并未显著降低性能,因为 76% 的论点对本身长度已低于 512 个词元。
  • 模型在部分截断的句子上表现良好,表明对不完整输入具有鲁棒性,因此假设 4(需要完整句子)被否定。
  • 在共享任务排行榜上,该方法在跨主题分类中排名第一,准确率为 73%,精确率为 72%,召回率为 66%,在精确率上优于 ASV 团队。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。