[论文解读] Overview of AuTexTification at IberLEF 2023: Detection and Attribution of Machine-Generated Text in Multiple Domains
本论文介绍了 AuTexTification 2023,这是 IberLEF 2023 上的一项共享任务,专注于在英语和西班牙语的五个领域中检测和归因机器生成文本(MGT)。该任务引入了一个涵盖人类与大语言模型(LLM)生成文本的多领域数据集,在跨领域泛化能力和对六种模型的细粒度归因方面对检测器进行了评估,其主要贡献在于在真实、多样的条件下对 MGT 检测与归因进行基准测试。
This paper presents the overview of the AuTexTification shared task as part of the IberLEF 2023 Workshop in Iberian Languages Evaluation Forum, within the framework of the SEPLN 2023 conference. AuTexTification consists of two subtasks: for Subtask 1, participants had to determine whether a text is human-authored or has been generated by a large language model. For Subtask 2, participants had to attribute a machine-generated text to one of six different text generation models. Our AuTexTification 2023 dataset contains more than 160.000 texts across two languages (English and Spanish) and five domains (tweets, reviews, news, legal, and how-to articles). A total of 114 teams signed up to participate, of which 36 sent 175 runs, and 20 of them sent their working notes. In this overview, we present the AuTexTification dataset and task, the submitted participating systems, and the results.
研究动机与目标
- 评估机器生成文本(MGT)检测器在多样化领域、写作风格和语言下的泛化能力。
- 探究在六种候选模型中对 MGT 进行细粒度归因至特定大语言模型的可行性。
- 为 MGT 检测与归因研究提供一个公开可用的、多领域、多语言的人类与 LLM 生成文本数据集。
- 通过支持 MGT 的取证分析,推动负责任的人工智能发展,助力内容审核与合规监管。
- 建立一个反映真实世界部署场景(超越领域内设置)的 MGT 检测与归因基准。
提出的方法
- 该任务包含两个子任务:二分类(人类 vs. MGT)和多类别归因(识别六种 LLM 中哪一种生成了文本)。
- 通过自动从现有公开来源收集,构建了一个多领域数据集,涵盖推文、评论、教程文章、新闻和法律文件,语言为英语和西班牙语。
- 使用三种 BLOOM 模型(1B7、3B、7B1)和三种 GPT-3 模型生成 MGT,确保模型规模与架构的多样性。
- 训练数据包含三个领域,而测试数据覆盖两个未见领域,以评估子任务 1 中的跨领域泛化能力。
- 子任务 2 在训练和测试中均使用全部五个领域,以评估细粒度归因性能。
- 评估框架支持零样本和少样本泛化,评估指标包括跨领域和模型的准确率、F1 和宏平均 F1。
实验结果
研究问题
- RQ1在英语和西班牙语中,MGT 检测器在仅基于部分领域进行训练后,能否有效泛化到未见过的领域?
- RQ2在多领域设置下,模型在区分六种不同 LLM 生成的 MGT 方面表现如何?
- RQ3领域、语言和模型规模对 MGT 可检测性与可归属性有何影响?
- RQ4MGT 检测器在非正式(如推文)与正式(如法律文件)写作风格中的表现有何差异?
- RQ5当模型在架构或规模上非常接近时,细粒度归因在多大程度上仍可实现?
主要发现
- AuTexTification 共享任务成功在五个多样化领域中评估了 MGT 检测与归因,揭示了跨领域泛化方面存在显著挑战。
- 检测器在未见领域上的表现较低,表明领域分布偏移仍是真实世界 MGT 检测系统的关键障碍。
- 对特定 LLM 的细粒度归因是可行的,且在架构或规模特征差异较大的模型上准确率更高。
- 性能在不同领域间差异显著,正式领域(如法律和新闻文本)的检测准确率高于非正式领域(如推文)。
- 该数据集在语言学分析方面具有重要价值,揭示了人类与机器生成文本在风格、句法和词汇模式上的系统性差异。
- 研究结果凸显了对鲁棒、可泛化检测模型的需求,以在无需微调的情况下适应新领域和写作风格。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。