Skip to main content
QUICK REVIEW

[论文解读] PerCQA: Persian Community Question Answering Dataset

Naghme Jamali, Yadollah Yaghoobzadeh|arXiv (Cornell University)|Dec 25, 2021
Expert finding and Q&A systems被引用 5
一句话总结

本文介绍了PerCQA,这是首个大规模波斯语社区问答(CQA)数据集,包含989个问题和21,915个来自流行波斯语论坛Ninisite的标注答案。作者使用单语(ParsBERT)和多语种(XLM-RoBERTa)预训练语言模型建立了强有力的基线模型,结果表明在英语SemEvalCQA数据集上微调XLM-R可使性能相比单语ParsBERT提升+3%的宏平均F1,为波斯语答案选择任务设立了新的最先进水平。

ABSTRACT

Community Question Answering (CQA) forums provide answers for many real-life questions. Thanks to the large size, these forums are very popular among machine learning researchers. Automatic answer selection, answer ranking, question retrieval, expert finding, and fact-checking are example learning tasks performed using CQA data. In this paper, we present PerCQA, the first Persian dataset for CQA. This dataset contains the questions and answers crawled from the most well-known Persian forum. After data acquisition, we provide rigorous annotation guidelines in an iterative process, and then the annotation of question-answer pairs in SemEvalCQA format. PerCQA contains 989 questions and 21,915 annotated answers. We make PerCQA publicly available to encourage more research in Persian CQA. We also build strong benchmarks for the task of answer selection in PerCQA by using mono- and multi-lingual pre-trained language models

研究动机与目标

  • 为解决自然语言处理研究中缺乏高质量、公开可用的波斯语CQA数据集的问题。
  • 利用真实论坛数据,推动波斯语答案选择、问题检索和专家发现的研究。
  • 制定严谨的标注指南与工具,确保问题-答案对标注的高质量与一致性。
  • 使用单语和多语种预训练语言模型,为答案选择任务建立强有力的基线。
  • 促进开发能够提升波斯语CQA论坛可用性与质量的自然语言处理系统。

提出的方法

  • 通过网络爬取从波斯语最流行的论坛Ninisite中提取了989个问题和21,915个答案。
  • 制定了详细且迭代的标注指南,将答案标注为三种标签:优质、不良和潜在。
  • 开发了内部标注工具,以简化并加速标注流程。
  • 数据集结构设计与SemEvalCQA英语数据集保持一致,以实现跨语言兼容性。
  • 评估了多种模型,包括PV-Cnt、BiLSTM-attention、RCNN和CETE,使用五种词嵌入:Word2vec、FastText、ParsBERT、mBERT和XLM-RoBERTa。
  • 通过在英语SemEvalCQA数据集上微调XLM-R和mBERT,测试了跨语言迁移在PerCQA上的表现。

实验结果

研究问题

  • RQ1能否从真实社区论坛中构建一个高质量、大规模的波斯语CQA数据集,并实现一致的标注?
  • RQ2与非上下文嵌入相比,单语和多语种预训练语言模型在波斯语答案选择任务上的表现如何?
  • RQ3通过跨语言迁移,英语CQA数据集中的知识能在多大程度上提升波斯语答案选择任务的性能?
  • RQ4在低资源环境下,标注质量和一致性对下游模型性能有何影响?
  • RQ5哪种模型架构和嵌入类型能为波斯语CQA任务提供最强的基线性能?

主要发现

  • PerCQA包含989个问题和21,915个标注答案,是首个公开可用的波斯语CQA数据集。
  • 在PerCQA上微调的XLM-RoBERTa模型取得了61.14的宏平均F1分数,相比ParsBERT的58.07高出3.07分。
  • 在微调PerCQA数据集时,多语种模型(如XLM-R和mBERT)优于单语ParsBERT,表明多语种预训练具有优势。
  • 从英语到波斯语的跨语言迁移显著提升了性能,XLM-R在零样本设置下取得52.48的宏平均F1,在微调设置下达到61.14。
  • 所有基线中,上下文嵌入(ParsBERT、XLM-R)的表现显著优于非上下文嵌入(Word2vec、FastText)。
  • 使用XLM-R嵌入的CETE模型表现最佳,证明了基于Transformer的上下文建模在波斯语答案选择任务中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。