[论文解读] The Code2Text Challenge: Text Generation in Source Code Libraries
本文介绍了 Code2Text 挑战赛,这是一个共享任务,旨在从软件库中的源代码函数生成自然语言描述。该任务利用语义解析器归纳研究中已有的数据集,涵盖多种编程语言和自然语言,用于训练和评估函数文档生成的文本生成模型,并计划发布独立的测试集,以支持代码文档生成的基准测试。
We propose a new shared task for tactical data-to-text generation in the domain of source code libraries. Specifically, we focus on text generation of function descriptions from example software projects. Data is drawn from existing resources used for studying the related problem of semantic parser induction (Richardson and Kuhn, 2017b; Richardson and Kuhn, 2017a), and spans a wide variety of both natural languages and programming languages. In this paper, we describe these existing resources, which will serve as training and development data for the task, and discuss plans for building new independent test sets.
研究动机与目标
- 建立一个面向软件库源代码数据到文本生成的共享任务,重点聚焦于函数文档。
- 利用语义解析器归纳研究中已有的数据集作为训练和开发资源。
- 支持多语言编程和自然语言输入,提升代码文档中的跨语言泛化能力。
- 设计并规划独立的测试集,以实现对代码到文本模型的公平评估。
- 通过弥合代码与人类可读文档之间的鸿沟,推动软件工程中自然语言生成的发展。
提出的方法
- 该方法依赖于先前语义解析器归纳研究(Richardson 和 Kuhn,2017a,b)中已有的数据集作为训练和开发数据。
- 该方法聚焦于将函数级代码结构映射为自然语言描述,将其视为序列到序列的生成任务。
- 该框架支持多种编程语言和自然语言,支持多语言模型的训练与评估。
- 该任务被设计为共享挑战,采用标准化的评估协议,并将单独发布测试集。
- 该方法强调战术性数据到文本生成,其中输入为代码片段,输出为描述性自然语言注释。
- 该系统设计为可扩展,允许研究人员将各种神经序列模型应用于代码到文本生成问题。
实验结果
研究问题
- RQ1现有模型在从源代码生成准确且自然的函数描述方面效果如何?
- RQ2多语言训练数据在代码到文本生成中的零样本或少样本泛化方面能提升到何种程度?
- RQ3生成的文档质量与源代码的复杂性和结构之间存在何种相关性?
- RQ4将多样化的编程语言结构与自然语言描述对齐面临哪些主要挑战?
- RQ5标准化测试集如何提升不同代码到文本生成模型之间的可重现性与可比性?
主要发现
- 本文建立了一个基于语义解析器归纳研究中已有数据集的代码到文本生成共享任务框架。
- 训练和开发数据涵盖多种编程语言和自然语言,支持跨语言评估。
- 作者计划发布独立的测试集,以确保在共享任务中对模型评估的无偏性。
- 该挑战旨在支持神经序列模型在真实世界软件文档生成任务中的基准测试。
- 该工作为未来自动化文档生成研究奠定了基础,特别强调可重现性与多语言支持。
- 该任务作为 INLG 2017 共享任务赛道的正式组成部分发布,表明其获得学术认可与标准化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。