[论文解读] Hardware Design and Analysis of the ACE and WAGE Ciphers
本文介绍了ACE和WAGE两种轻量级认证加密算法的硬件设计与分析,这两种算法已提交至NIST轻量级密码学标准化流程。两者均采用sLiSCP海绵冗余模式,ACE(320位状态)和WAGE(259位状态)均针对高效硬件映射进行了优化;结果显示,ACE在四款ASIC库中最高实现4 bpc吞吐量,功耗为7260 GE,而WAGE达到4.57 bpc吞吐量,功耗为11080 GE,表明在高并行度下具备出色的面积与能效效率。
This paper presents the hardware design and analysis of ACE and WAGE, two candidate ciphers for the NIST Lightweight Cryptography standardization. Both ciphers use sLiSCP's unified sponge duplex mode. ACE has an internal state of 320 bits, uses three 64 bit Simeck boxes, and implements both authenticated encryption and hashing. WAGE is based on the Welch-Gong stream cipher and provides authenticated encryption. WAGE has 259 bits of state, two 7 bit Welch-Gong permutations, and four lightweight 7 bit S-boxes. ACE and WAGE have the same external interface and follow the same I/O protocol to transition between phases. The paper illustrates how a hardware perspective influenced key aspects of the ACE and WAGE algorithms. The paper reports area, power, and energy results for both serial and parallel (unrolled) implementations using four different ASIC libraries: two 65 nm libraries, a 90 nm library, and a 130 nm library. ACE implementations range from a throughput of 0.5 bits-per-clock cycle (bpc) and an area of 4210 GE (averaged across the four ASIC libraries) up to 4 bpc and 7260 GE. WAGE results range from 0.57 bpc with 2920 GE to 4.57 bpc with 11080 GE.
研究动机与目标
- 设计并分析ACE与WAGE两种NIST LWC候选算法的高效硬件实现,重点关注面积、吞吐量与能效效率。
- 评估ACE与WAGE在多种ASIC技术下,随着并行化(展开)程度增加时的可扩展性。
- 通过标准化综合结果,比较ACE与WAGE与其他LWC候选算法的相对硬件效率。
- 识别将轻量级密码原_primitive映射到硬件时的关键设计权衡,特别是S盒、LFSR与关键路径延迟方面。
- 使用真实的ASIC库与定时精确的能效测量,对ACE与WAGE进行全面的硬件评估。
提出的方法
- 将基于Simeck S盒与Welch-Gong置换的ACE与WAGE置换函数,统一映射为sLiSCP海绵冗余模式,用于认证加密与哈希操作。
- 实现串行与展开(并行)架构,支持不同程度的并行化(p=1至p=8),实现吞吐量从0.5提升至4.57 bpc。
- 采用来自不同代工厂的四款ASIC库(65 nm、90 nm、130 nm),确保对面积、功耗与能效指标的无技术依赖性评估。
- 通过逻辑综合与布局布线后分析,从10 MHz时钟下的时序仿真中提取准确的门等效(GE)面积、最大频率与每比特功耗。
- 在展开设计中复制关键组件(如S盒、LFSR与WGP功能),分析面积增长与关键路径延迟。
- 通过模拟8192比特数据块的功耗,测量每比特平均功耗,评估并行化下的能效权衡。
实验结果
研究问题
- RQ1增加并行化程度如何影响ACE与WAGE在硬件中的面积、吞吐量与能效效率?
- RQ2ACE与WAGE在不同ASIC技术与实现方式下的硬件资源需求(面积、功耗、能效)有何差异?
- RQ3为何WAGE的功耗随并行化增加而上升,而ACE的功耗反而下降,尽管两者均针对低面积进行了优化?
- RQ4S盒与WGP组件的关键路径延迟如何影响展开设计中的性能与能效扩展?
- RQ5使用标准化综合结果,ACE与WAGE在硬件面积上与其他NIST LWC候选算法相比如何?
主要发现
- ACE实现的吞吐量范围为0.5 bpc(平均四库为4210 GE)至4 bpc(7260 GE),且每比特功耗随吞吐量提升而下降。
- WAGE实现的吞吐量范围为0.57 bpc(2920 GE)至4.57 bpc(11080 GE),其展开时面积增长显著(p=1至p=8时达3.80倍),高于ACE的1.72倍。
- WAGE每比特功耗随并行化增加,源于其WGP组件较长的关键路径(10级门)与更高的毛刺活动,而ACE的S盒关键路径仅2级门,影响较小。
- WAGE的最优性(吞吐量/面积²)在p=3时达到峰值,而ACE在p>8后仍持续提升,表明ACE在高并行度下具备更优可扩展性。
- 非并行版本的WAGE面积小于ACE,但在高并行度下,由于WGP、S盒与反馈逻辑等更大组件的复制,WAGE的面积超过ACE。
- 在ST微电子65 nm工艺上的初步对比显示,ACE与WAGE均为面积最小的LWC候选之一,ACE为4.2 kGE,WAGE为1.5 kGE(报告提交值),但接口与功能差异限制了直接比较。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。