[论文解读] NAS-Bench-NLP: Neural Architecture Search Benchmark for Natural Language Processing
本文提出了 NAS-Bench-NLP,这是首个基于循环神经网络(RNN)的自然语言处理神经架构搜索基准。它提供了在语言建模范式上训练的14,000个RNN架构的预计算性能指标,支持在内在(词语相似性)和外在(GLUE)任务中进行可复现的评估与神经架构搜索算法基准测试,其中LSTM和GRU始终表现出最佳性能。
Neural Architecture Search (NAS) is a promising and rapidly evolving research area. Training a large number of neural networks requires an exceptional amount of computational power, which makes NAS unreachable for those researchers who have limited or no access to high-performance clusters and supercomputers. A few benchmarks with precomputed neural architectures performances have been recently introduced to overcome this problem and ensure more reproducible experiments. However, these benchmarks are only for the computer vision domain and, thus, are built from the image datasets and convolution-derived architectures. In this work, we step outside the computer vision domain by leveraging the language modeling task, which is the core of natural language processing (NLP). Our main contribution is as follows: we have provided search space of recurrent neural networks on the text datasets and trained 14k architectures within it; we have conducted both intrinsic and extrinsic evaluation of the trained models using datasets for semantic relatedness and language understanding evaluation; finally, we have tested several NAS algorithms to demonstrate how the precomputed results can be utilized. We believe that our results have high potential of usage for both NAS and NLP communities.
研究动机与目标
- 为解决NLP领域缺乏可复现且易于访问的神经架构搜索基准的问题,创建一个基于RNN架构的预计算基准。
- 在无需大量训练资源的情况下,实现对神经架构搜索算法的公平且高效的比较。
- 在内在(词嵌入)和外在(GLUE)自然语言处理任务中评估架构性能。
- 通过在同一搜索空间上测试多种神经架构搜索算法,展示该基准的实用性。
- 发布所有训练好的架构及其性能指标,以支持社区范围的研究与模型比较。
提出的方法
- 定义了一个新型的RNN衍生搜索空间,包含LSTM、GRU及其他可配置连接方式与单元类型的RNN变体。
- 使用标准文本数据集,在语言建模范式上训练了14,000个独特的架构。
- 通过静态词嵌入的词语相似性测试进行内在评估。
- 通过下游GLUE基准任务进行外在评估,以衡量迁移性能。
- 构建了一个仿真环境,用于测量训练墙时长、验证困惑度和测试对数困惑度,以支持神经架构搜索算法的基准测试。
- 使用graph2vec将架构图嵌入低维特征空间,以供贝叶斯优化等神经架构搜索方法使用。
实验结果
研究问题
- RQ1当通过内在和外在指标评估时,基于RNN的架构在不同自然语言处理任务中的表现如何?
- RQ2大规模RNN搜索空间的预计算性能数据是否能够实现有效且高效的神经架构搜索算法基准测试?
- RQ3手工设计的架构(如LSTM和GRU)与搜索空间中随机采样的架构相比,其全局性能如何?
- RQ4性能在不同语言建模范式数据集之间是否具有良好的泛化能力?
- RQ5在模拟的神经架构搜索环境中,使用预计算指标时,不同神经架构搜索算法(如Hyperband、贝叶斯优化)的表现如何?
主要发现
- 该基准包含14,000个预训练的RNN架构,并提供了在语言建模和下游GLUE任务中的完整性能指标。
- LSTM和GRU架构始终实现了最低的测试对数困惑度(L* = 4.36),证实其在全球范围内的卓越性能。
- 不同数据集间的性能表现出高度相关性,表明在一个数据集上的结果可预测在其他数据集上的表现。
- 在神经架构搜索算法基准测试中,Hyperband实现了最低的最终遗憾,紧随其后的是使用50维graph2vec特征的贝叶斯优化。
- 困惑度值的分布并未偏向最优解,表明高性能架构稀少,且难以通过随机搜索轻易发现。
- 该基准揭示了若干性能与LSTM和GRU相当的替代架构,提示存在设计新颖且高效的RNN结构的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。