最近,NVIDIA Research 发布了一个非常有意思的新项目——PiD(Pixel Diffusion Decoder)。刚看到这个名字时,很多人可能会误以为它和工业控制里的 PID 控制器有关,其实完全不是。
PiD 全称是:
Pixel Diffusion Decoder:基于 Pixel Diffusion 的像素解码器
它解决的是目前几乎所有 AI 文生图模型都存在的一个瓶颈——最后一步图片解码太慢,而且高清图片质量还不够好。
AI 生成图片,最后一步一直都是瓶颈现在的大模型,例如:
FLUXStable Diffusion 3Qwen-ImageZ-Image以及各种 RAE(Representation AutoEncoder)模型
它们生成图片时,其实并不是直接生成 RGB 图片。真正生成的是一种叫 Latent(潜空间表示) 的隐藏特征。也就是说,扩散模型负责生成 Latent,VAE Decoder 再把 Latent 解码成真正的图片。你用过 Midjourney、Stable Diffusion 或者 Flux 这些 AI 画图工具吗?有没有注意到一个现象:AI 生成一张图,往往先出来一张「模模糊糊」的草稿,然后还要再跑一遍「超分辨率」才能变清晰?
这不是偶然,而是 AI 图像生成的结构决定的。AI 在一个极度压缩的「潜空间」里作画,画完之后要用一个叫 VAE 解码器 的组件把压缩的信息翻译回真实像素——这个翻译过程,恰恰是最容易丢失细节的环节。

问题来了。
这一套 Decoder 已经用了很多年。它最大的目标其实只有一个:
尽量恢复原图。
它并不会主动创造更多细节。因此在高分辨率情况下,它就会暴露两个问题:
解码速度越来越慢高清细节越来越差要想要高清,就得在 VAE 解码之后,再叠加一个「超分」模型。两步走,慢,还贵。
它到底在解决什么问题?目前主流高分辨率文生图流程基本是:
在压缩后的潜空间里跑扩散用 VAE / RAE 解码回像素如果分辨率不够,再接一个超分模型问题来了:VAE 解码器本质上是「重建导向」的——它只是在尽量还原编码器压缩掉的信息,而不是主动「生成」更多细节。到了 2K、4K,它还特别吃显存和时间。

PiD 的思路很直接:把「潜空间 → 高分辨率像素」这件事,直接做成一个条件像素扩散模型。解码和上采样合二为一,不再走「先解码再超分」的级联路线。
更厉害的是:可以提前结束 Diffusion这是我认为 PiD 最聪明的一点。大家都知道:Diffusion 一般需要很多步。才能得到最终 Latent。但是作者发现:其实不用跑完。PiD 一样可以生成高质量图片。论文里称之为:
Early Exit(提前退出)

为了做到这一点,PiD 在训练时引入了带噪声的 Latent,并设计了 sigma-aware adapter 来处理不同噪声水平的潜变量,因此即使 Latent 尚未完全去噪,也能完成高质量解码。(NVIDIA)
于是:Diffusion 可以少跑很多步。整体速度继续提升。
核心亮点直接在高分辨率像素空间去噪 从 512×512 的潜变量,一次性生成 2048×2048(4×),甚至支持 8×,延迟明显更低。能吃「半成品」潜变量 传统解码器必须等潜空间扩散跑完。PiD 用了一个轻量的 sigma-aware adapter,把带噪声的潜变量注入像素扩散骨干,所以你可以提前终止潜空间采样,整体速度再往上提一截。蒸馏到只需 4 步 用 DMD2 蒸馏后,推理步数压到 4 步,实际可用。兼容性强 既支持普通 VAE 潜空间(Flux、SD3 等),也支持最近流行的语义潜空间(DINOv2、SigLIP、RAE 系列)。
实际速度和效果官方数据(512² → 2048²):
消费级 RTX 5090:不到 1 秒,峰值显存约 13 GBGB200:最快约 210 ms比 SeedVR2 这类级联扩散超分快最多约 5.9 倍,视觉质量还更高(人工评测和 Gemini 裁判都更偏好 PiD)从官网对比图来看,PiD 在纹理、边缘、细节保留上明显优于标准 VAE 解码 + 常见超分方案,尤其是那种「看起来已经生成完,但细节还不够锐」的场景。
支持的不只是 Stable Diffusion很多人会认为:这是给 Stable Diffusion 做的。其实不是。PiD 被设计成一个通用的 Latent Decoder。目前已经支持:
FLUX.1FLUX.2Stable Diffusion 3Qwen-ImageZ-ImageDINOv2 RAEScale-RAE未来只要模型输出的是 Latent,就有机会接入 PiD。
为什么这项技术意义这么大?很多人觉得:Decoder 不重要。真正重要的是 Diffusion。其实不是。现在很多 AI 图片模型已经进入:
拼推理速度阶段
例如:
FluxSDXL TurboFLUX Kontext各种蒸馏模型大家都在想办法减少:Diffusion Steps。但是:最后 Decoder 依然是固定耗时。因此:Decoder 已经成为新的瓶颈。PiD 正是在这个位置做优化。它意味着:未来所有 Latent Diffusion 模型,都有机会:直接替换 Decoder。无需重新训练整个生成模型。
PiD 的未来会怎样?我认为 PiD 的影响可能不仅仅局限于图片生成。因为现在越来越多模型采用:
Semantic LatentRAERepresentation AutoEncoderDiffusion Transformer(DiT)这些模型生成的信息越来越抽象。传统 VAE 已经越来越跟不上。而 Pixel Diffusion Decoder 提供了一种新的思路:Decoder 本身,也可以是一套生成模型。未来 Decoder 很可能不再只是恢复器,而会成为生成链路中的重要组成部分。
为什么说这是一个范式转变?长期以来,AI 图像生成领域有一个隐性共识:「生成」和「超清」是两个独立的任务,由两套模型分工完成。PiD 打破了这个边界——它证明了解码本身可以是生成性的,可以在解码过程中直接「脑补」出高频细节。
这不只是快了 6 倍那么简单。它意味着整个 AI 图像生成的推理架构可以被重新设计:更少的模型、更少的显存、更短的链路,同时拿到更好的质量。

如果未来这项技术被整合进主流平台(Midjourney、Adobe Firefly、微信 AI 画图……),普通用户大概率什么都不需要做,就悄悄享受到了「图更清、速度更快」的升级。
一句话总结:PiD 让 AI 画图从「生成 + 超分两步走」变成「一步直出高清」,是英伟达在 AI 图像解码领域的一次结构性突破,值得关注。
写在最后过去几年,大家都把注意力集中在 Transformer、Diffusion、DiT 等核心生成模型上,而 Decoder 往往被认为只是最后的“收尾”步骤。
PiD 的出现改变了这种思路。它把原本负责“还原”的 Decoder,升级为一个能够参与生成、补充细节、同时完成高清放大的 Pixel Diffusion 模块。这样不仅减少了模型串联带来的复杂度,也让推理速度和画质获得了兼顾。

对于开发者来说,这意味着未来高分辨率文生图可以拥有更低的延迟;对于普通用户来说,则意味着生成 2K、4K 甚至更高分辨率图片的等待时间将大幅缩短,而画面细节也会更加丰富。
或许在不久之后,"VAE Decoder" 这个沿用了多年的经典模块,将逐渐被新一代的 Pixel Diffusion Decoder 所取代。