QUICK REVIEW
[论文解读] MT-Adapted Datasheets for Datasets: Template and Repository
Marta R. Costa‐jussà, Roger Creus|arXiv (Cornell University)|May 27, 2020
Natural Language Processing Techniques参考文献 14被引用 10
一句话总结
本文提出了一种专用于机器翻译(MT)数据集的资料表模板及公开仓库,将Gebru等人提出的通用资料表框架适配至更契合MT数据消费者需求的场景。该工作引入了关于数据来源、许可协议、维护方式及法律可持续性的针对性问题,并为EuroParl与News-Commentary提供了示例资料表,以提升MT研究中的透明度与可复现性。
ABSTRACT
In this report we are taking the standardized model proposed by Gebru et al. (2018) for documenting the popular machine translation datasets of the EuroParl (Koehn, 2005) and News-Commentary (Barrault et al., 2019). Within this documentation process, we have adapted the original datasheet to the particular case of data consumers within the Machine Translation area. We are also proposing a repository for collecting the adapted datasheets in this research area
研究动机与目标
- 解决广泛使用的MT数据集缺乏标准化、以用户为中心的文档化问题。
- 将通用资料表框架(Gebru et al., 2018)适配至MT研究人员与实践者的具体需求。
- 建立一个由社区驱动的公开仓库,用于MT数据集资料表,以提升透明度与可复现性。
- 鼓励数据消费者——而不仅是数据创建者——记录其使用数据集的信息,特别是在原始创建者缺乏详细文档的情况下。
- 通过追踪更新记录、法律状态与贡献政策,支持数据集的长期可持续性。
提出的方法
- 通过剔除对数据消费者不相关的提问(如数据收集流程与预处理细节),对原始资料表模板进行调整。
- 新增关注数据来源、首次发布日期、地理使用限制与法律可持续性的问题。
- 引入关于维护实践的查询,包括版本日志、自动更新机制与数据相关性检查。
- 明确包含关于贡献政策的问题,以明确谁可参与数据集改进。
- 在 https://mtdatasheets.cs.upc.edu 建立公开且经人工审核的仓库,用于托管与维护MT数据集资料表。
- 为两个主要MT基准数据集提供了示例资料表:EuroParl(v10)与News-Commentary(v15)。
实验结果
研究问题
- RQ1如何调整数据集文档,使其更服务于机器翻译中的数据消费者,而非仅面向创建者?
- RQ2MT研究人员在评估数据集的偏见、来源与长期可用性时,最需要哪些具体信息?
- RQ3为提升MT研究中的透明度与可用性,对原始资料表模板需做出哪些必要修改?
- RQ4如何通过社区驱动的仓库有效收集、验证并维护MT数据集文档?
- RQ5许可协议、地理限制与法律变更在MT数据集长期可行性中扮演何种角色?
主要发现
- 经调整的资料表模板新增了12个针对MT数据消费者的特定问题,如来源归属、首次发布日期与法律可持续性。
- 位于 https://mtdatasheets.cs.upc.edu 的仓库现已托管由社区贡献的主流MT数据集资料表,并经过人工审核以确保质量。
- 为两个在WMT评估中广泛使用的基准数据集——EuroParl(v10)与News-Commentary(v15)——创建了示例资料表。
- 该模板明确排除了关于数据收集与预处理的问题,承认消费者通常不具备此类信息。
- 本研究强调了追踪数据集维护工作的重要性,包括版本日志、自动更新与数据相关性检查。
- 该框架有助于更准确评估法律风险,例如立法变更可能对数据集使用权限造成的影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。