[论文解读] Conffusion: Confidence Intervals for Diffusion Models
Conffusion 提出一种方法,为图像到图像任务(如超分辨率和图像修复)中的扩散模型生成逐像素的置信区间,实现统计上保证的不确定性估计。通过使用分位数回归损失微调预训练扩散模型,该方法在保持理论覆盖保证的同时,将置信区间变得更紧致,并实现比基于采样的基线方法快三个数量级的推理速度。
Diffusion models have become the go-to method for many generative tasks, particularly for image-to-image generation tasks such as super-resolution and inpainting. Current diffusion-based methods do not provide statistical guarantees regarding the generated results, often preventing their use in high-stakes situations. To bridge this gap, we construct a confidence interval around each generated pixel such that the true value of the pixel is guaranteed to fall within the interval with a probability set by the user. Since diffusion models parametrize the data distribution, a straightforward way of constructing such intervals is by drawing multiple samples and calculating their bounds. However, this method has several drawbacks: i) slow sampling speeds ii) suboptimal bounds iii) requires training a diffusion model per task. To mitigate these shortcomings we propose Conffusion, wherein we fine-tune a pre-trained diffusion model to predict interval bounds in a single forward pass. We show that Conffusion outperforms the baseline method while being three orders of magnitude faster.
研究动机与目标
- 为扩散模型输出提供统计上严谨的置信区间,确保真实像素值以用户定义的概率落在区间内。
- 克服基于采样的扩散模型置信区间估计方法推理速度缓慢的问题。
- 在保持理论覆盖保证的前提下,相比现有分位数回归方法,提升置信区间的紧致性。
- 通过单一预训练扩散模型实现在不同任务和数据集之间的迁移学习,用于置信区间估计。
- 将去噪模型与扩散过程解耦,实现高效的单次前向传播推理。
提出的方法
- 使用分位数回归损失微调一个预训练扩散模型(如 ADM),在单次前向传播中预测每个像素的下界和上界。
- 将去噪模型与扩散过程解耦,使其可被重新用于置信区间估计,而无需重新训练完整的扩散过程。
- 应用归纳预测原理,确保真实像素值以用户指定的概率落在预测区间内。
- 利用 ImageNet 提供的强大预训练特征,实现在超分辨率和图像修复等下游任务上的零样本迁移。
- 采用近似推理:与为每张图像采样数千次输出不同,直接通过单次前向传播预测边界。
- 使用单一标量分位数损失,联合优化多个分位数(如 0.05 和 0.95),以定义区间边界。
实验结果
研究问题
- RQ1我们能否在图像到图像任务中为扩散模型输出构建统计上有效的置信区间?
- RQ2我们能否实现比基于采样的基线方法更快的置信区间估计推理速度?
- RQ3微调预训练扩散模型用于区间预测,是否能产生比现有分位数回归方法更紧致、更可靠的边界?
- RQ4扩散预训练对于有效区间估计是否必不可少?还是通用特征提取器已足够?
- RQ5一个单一预训练模型能否在超分辨率和图像修复等多样化任务中实现泛化?
主要发现
- Conffusion 的推理速度比基于采样的基线快三个数量级,将推理时间从数千次前向传播减少到单次前向传播。
- 该方法生成的置信区间比当前最先进方法 ADM_{UQ} 更紧致,同时保持理论覆盖保证。
- N-Conffusion 在区间大小和视觉质量上均优于基于采样的和分位数回归的基线方法,生成的边界既真实又清晰。
- 扩散预训练至关重要:消融实验表明,非扩散模型(如使用 ImageNet 或 Instagram 预训练编码器的 FPN)生成的区间明显宽于 Conffusion。
- 该方法在各类任务中保持强大性能,能有效从 ImageNet 预训练模型泛化到 CelebA-HQ 等其他数据集,无需任务特定的微调。
- Conffusion 通过在中间时间步估计置信区间,实现了扩散生成过程的早期停止,为最终输出质量提供了快速代理指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。