Skip to main content
QUICK REVIEW

[论文解读] Floating-Point Arithmetic on Round-to-Nearest Representations

Peter Kornerup, Jean‐Michel Muller|arXiv (Cornell University)|Jan 18, 2012
Numerical Methods and Algorithms参考文献 6被引用 4
一句话总结

本文提出一种基于2的补码并附加舍入位的RN编码浮点表示方法,通过简单的截断即可实现常数时间的向最近舍入。通过将尾数编码为规范化的符号数字格式,该方法消除了对对数时间舍入递增的需求,从而实现比IEEE-754具有同等精度但速度更快、更简单的算术单元,同时通过使用非零尾随位检测(sticky-bit)实现高效的定向舍入,无需递增操作。

ABSTRACT

Recently we introduced a class of number representations denoted RN-representations, allowing an un-biased rounding-to-nearest to take place by a simple truncation. In this paper we briefly review the binary fixed-point representation in an encoding which is essentially an ordinary 2's complement representation with an appended round-bit. Not only is this rounding a constant time operation, so is also sign inversion, both of which are at best log-time operations on ordinary 2's complement representations. Addition, multiplication and division is defined in such a way that rounding information can be carried along in a meaningful way, at minimal cost. Based on the fixed-point encoding we here define a floating point representation, and describe to some detail a possible implementation of a floating point arithmetic unit employing this representation, including also the directed roundings.

研究动机与目标

  • 设计一种浮点数算术系统,实现在常数时间内无偏的向最近舍入,避免传统IEEE-754舍入所需的对数时间开销。
  • 通过在2的补码基础上附加舍入位,实现对基本算术运算(加法、乘法、除法)的硬件简化。
  • 高效支持向最近舍入和定向舍入模式(RU、RD、RZ、RA),且无需舍入递增操作。
  • 证明RN表示在专用硬件(如ASIC/FPGA)中可保持与IEEE-754相当的精度和准确性,同时减少面积和延迟。

提出的方法

  • 使用2的补码的规范编码并附加舍入位,使得通过截断即可在常数时间内获得向最近舍入结果。
  • 将定点数表示为区间以追踪舍入信息,确保算术运算过程中的正确性。
  • 定义与IEEE-754类似的浮点格式,其中尾数以RN规范形式(2的补码 + 舍入位)编码。
  • 通过将加法与减法分解为“接近”和“远离”两种情况,利用区间算术保持舍入语义。
  • 对乘法与除法使用标准2的补码算术,仅对进位信息进行最小修改以保留舍入信息。
  • 通过非零尾随位检测(sticky-bit)和条件舍入位更新实现定向舍入:RU将r=1,RD将r=0,RZ将r=s_a,RA将r=¬s_a,基于尾部是否为零。

实验结果

研究问题

  • RQ1是否可以在不使用对数时间递增操作的前提下,实现在浮点数算术中常数时间的向最近舍入?
  • RQ2如何高效编码符号数字表示,以支持通过截断实现常数时间取反与舍入?
  • RQ3在对RN表示的算术进行最小修改的前提下,标准2的补码算术可以多大程度上被重用?
  • RQ4是否可以在此表示中高效实现定向舍入而无需舍入递增操作?
  • RQ5RN表示是否在保持与IEEE-754等效精度的同时,降低硬件复杂度与延迟?

主要发现

  • 通过截断RN规范表示,可实现常数时间向最近舍入,消除了IEEE-754中对数时间递增的需求。
  • 取反操作通过按位取反在常数时间内完成,相比标准2的补码需要完整加法器,有显著改进。
  • 加法与减法操作仅对标准2的补码逻辑进行最小修改,借助基于区间的语义确保正确性。
  • 乘法与除法使用标准算法并适配以携带舍入信息,额外开销仅限于标准2的补码操作。
  • 定向舍入(RU、RD、RZ、RA)可通过非零尾随位检测与条件舍入位更新实现,无需递增操作。
  • RN表示在相同格式下实现了与IEEE-754相同的离散化误差与精度,但在硬件实现中面积与延迟更小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。