QUICK REVIEW
[论文解读] Floating point numbers are real numbers
Walter F. Mascarenhas|arXiv (Cornell University)|May 30, 2016
Numerical Methods and Algorithms参考文献 9被引用 5
一句话总结
本文提出将浮点数视为实数,以应用连续数学推导浮点运算中舍入误差的更紧、更简洁的界。通过重新解释标准误差模型,用线性化的 ku 替代 Higham 的 γₖ,并证明了求和的更紧误差界:|fl(∑xₖ) - ∑xₖ| ≤ nu∑|xₖ|,该界比以往结果更简单且更精确,尤其在支持次正规数时表现更优。
ABSTRACT
Floating point arithmetic allows us to use a finite machine, the digital computer, to reach conclusions about models based on continuous mathematics. In this article we work in the other direction, that is, we present examples in which continuous mathematics leads to sharp, simple and new results about the evaluation of sums, square roots and dot products in floating point arithmetic.
研究动机与目标
- 使用连续数学简化并扩展现有浮点运算中的误差界。
- 证明浮点数可被视为实数,以推导更紧、更直观的误差界。
- 在误差分析中用线性化的 ku 替代 Higham 的 γₖ = ku/(1−ku),简化证明与结果。
- 推导求和误差的新、更紧的界:|fl(∑xₖ) - ∑xₖ| ≤ nu∑|xₖ|,该界在支持次正规数时成立。
- 将这些结果扩展至点积,并证明 Wilkinson 误差界中的 O(u²) 项与 1.06 因子可被消除。
提出的方法
- 将浮点数视为实数的子集,以利用连续数学的工具。
- 以 (1+ε) 论证为基础,但通过实值误差传播建模来优化舍入误差。
- 提出求和的新误差界:|fl(∑xₖ) - ∑xₖ| ≤ nu∑|xₖ|,该界源自 nu 的凹函数。
- 应用线性规划对偶性,验证特定示例中的最坏情况误差情形。
- 通过相应调整误差模型,修正下溢和非次正规数算术的误差界。
- 通过去除高阶项与保守因子,重新表述现有误差界(如 Higham、Wilkinson 的结果)。
实验结果
研究问题
- RQ1能否使用连续数学推导浮点求和误差的更紧、更简洁的界?
- RQ2能否在不损失严谨性的情况下,用线性化的 ku = ku 替代 Higham 的 γₖ = ku/(1−ku)?
- RQ3对 n+1 个数的和的浮点计算中,相对误差的最紧可能界是什么?
- RQ4能否通过改进误差模型,消除 Wilkinson 误差界中的 1.06 因子?
- RQ5下溢和缺乏次正规数如何影响浮点误差界的紧致性?
主要发现
- 证明了求和误差的新、更紧的界:|fl(∑xₖ) - ∑xₖ| ≤ nu∑|xₖ|,该界在 nu 上严格为凹函数,且比 Higham 的基于 γₖ 的界更简单。
- 当 20nu ≤ 1 且舍入到最近数、单位舍入误差为 u 时,该界 |fl(∑xₖ) - ∑xₖ| ≤ nu∑|xₖ| 在支持次正规数的算术中成立。
- 对于非负 xₖ,推导出更紧的界:|fl(∑xₖ) - ∑xₖ| ≤ u∑ₖ₌₁ⁿ∑ᵢ₌₀ᵏxᵢ,该界避免了 u 的高阶项。
- 建立了点积的新误差界:|fl(∑xₖyₖ) - ∑xₖyₖ| ≤ (n+1)u∑|xₖyₖ|,该界在 ∑|xₖyₖ| 不太小时成立。
- 证明该界 (n+1)u∑|xₖyₖ| 与 Higham 的主导项 nu|𝐱|ᵀ|𝐲| 等价,但不包含 O(u²) 余项。
- 本文证明,通过所提出的连续数学框架,Wilkinson 误差界中的 1.06 因子与 Higham 分析中的 O(u²) 项均可被严格消除。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。