在AI的世界里,要创造一样东西,最高效的方式或许不是从零搭建,而是先彻底理解它如何"湮灭",再把时间的方向倒过来。扩散模型(Diffusion Model)就是这样一位拥有"时间倒流"超能力的法医物证专家——它先花漫长的时间研究"完整的图像如何一步步走向混沌",然后把播放键按下"倒带",从一堆纯随机噪声中,一步一步地逆向拼凑,直到一面完美无瑕的图像凭空"长"了出来。
目录 / 四层认知
01 总览——时间倒流法医物证专家
02 核心哲学——先学会毁掉,才能学会创造
03 1000步vs一步——散步与跳跃的差距
04 残酷的代价——"慢"是原罪
05 文本生图——Stable Diffusion的磁力棒
06 速度拯救术——蒸馏与确定性采样
07 终极总结——从概率抽卡到时间雕刻

图1 扩散模型 = 时间倒流法医物证专家:盯着碎玻璃碴(纯噪声),一步步逆向拼回完美玻璃(高清图像)
① 核心哲学——先学会毁掉,才能学会创造
前向加噪学习"毁灭" → 逆向去噪学会"时间倒流"
扩散模型的逻辑,和人类艺术家完全不同。人类画家是从白纸起笔,一笔一笔加上色彩(这是GAN或VAE的思路)。而扩散模型走了一条极端的"曲线救国"路线。
第一步:前向过程(Forward Process,学习"毁灭")。训练时,模型不学习怎么画,而是学习怎么"毁"。它拿一张高清的猫图,在几百步内,往这张图上一点一点地添加微小的随机噪点(高斯噪声)。第0步是清晰的猫,第100步猫的轮廓模糊像是起雾了,第500步只能看到色块看不出是猫,第1000步彻底变成一堆纯雪花马赛克(纯随机噪声),和原图没有半点关系。
模型在这1000步里,死死记住了每一个"清晰度等级"的统计规律,以及"如何从清晰图像转变为雪花"的数学路径。它不是在学画画,它是在学"万物如何走向混沌"的物理定律。

图2 前向过程:高清猫图→第100步起雾→第500步色块→第1000步纯雪花,学习"毁灭"的物理规律
第二步:逆向过程(Reverse Process,学会"时间倒流")。模型学完了"把图变糊"的规律,接下来玩一个魔术:它把时间倒过来。既然它知道"第500步的模糊图"下一步会变成"第501步的更糊图",那反过来,它学会了预测:"如果给定第501步的糊图,我该怎么减去一点噪声,才能大概回到第500步?"
训练时,模型就是反复比对"自己猜的降噪结果"和"真实的前一步清晰图"之间的差距,调整参数,直到"逆向猜"的误差无限接近于零。

图3 逆向过程:纯雪花→第500步色块→第100步轮廓→第0步清晰猫,把时间倒带一步步拼回原图
扩散模型最反直觉的天才之处:它学会的不是"生成"的语法,而是"解构"的物理。当它把"解构"练到极致,顺带就把"重构"练成了。
② 1000步vs一步——散步与跳跃的差距
Diffusion的渐进式生成 vs GAN的一步到位
这是扩散模型区别于GAN(生成对抗网络)的核心技术壁垒。
GAN是一步生成,它直接尝试把随机噪声映射成高清图。这好比让一个盲人直接把一堆砖头扔成一座故宫,难度极高,所以GAN经常画崩(手指头六根、脸部扭曲)。
而扩散模型选择"温水煮青蛙",分1000步走:前几步只负责决定"这块区域大体是红色还是蓝色"(定色调),中间几百步决定"这里应该是眼睛的轮廓还是背景的树枝"(定结构),最后几十步只负责加"皮肤的纹理"和"睫毛的阴影"(加细节)。
这种"由粗到细"的渐进式生成,使得生成过程极其稳定,图像质量极高。它把一次高难度的"跳跃",分解成了1000次简单的"散步"。每一步只需要做极其微小的调整——不是从0到1,而是从0.001到0.002。

图4 1000步散步(每步微调0.001→0.002,稳定到达完美猫图)vs 一步跳跃(GAN直接跳,画崩手指六根)
③ 残酷的代价——"慢"是原罪
训练慢+推理慢,工程师的两把手术刀
事无完美,扩散模型最大的死穴就一个字:慢。
训练慢:要给模型看几亿张图,每张图被毁掉1000次,这本身就是天文数字的运算量。推理慢:你给它一个提示词,它要从纯雪花开始,硬生生跑完1000步降噪,才能给你一张图。即使是顶级显卡,生成一张高清图往往需要几十秒到几分钟,而GAN只需要0.01秒。
为了拯救速度,工程师们发明了两把"手术刀":
→ 蒸馏(Distillation):训练一个小模型,专门模仿大模型"跳步"的技能,让它学会从第500步直接跳到第0步,把步数从1000压缩到50。
→ 确定性采样器(如DDIM):既然路径是固定的,那就不必走1000步,直接每隔20步踩一脚油门,只用50步走完全程,代价是牺牲极微小的细节质量。

图5 速度拯救:大模型满头大汗走1000步 vs 蒸馏小模型跳步1000→50 vs DDIM每隔20步踩油门
④ 文本生图——Stable Diffusion的磁力棒
CLIP文本编码器:语义向量引导每一步去噪
我们最常接触的扩散模型应用,就是Stable Diffusion和Midjourney。它在纯扩散模型的基础上,引入了一个"作弊器"——文本编码器(CLIP Text Encoder)。
当你说"一只宇航员柴犬"时,这串文字先被转换成一个"语义向量"。在逆向去噪的每一步(第800步、第500步、第100步),这个向量都像一根无形的"磁力棒",强行拽着那团"正在成形的雪花"往"柴犬形状"和"宇航服质感"的方向靠拢。
如果哪一步没有这根磁力棒,模型就会随机生成一张"看起来像图但啥也不是"的抽象画;有了磁力棒,它才变成了听从指挥的"造物主"。文本不是命令,而是引力——每一步降噪都被这根磁力棒轻轻拉向目标。

图6 CLIP磁力棒:文字→语义向量→磁力棒,在逆向去噪每一步拉拽雪花往"柴犬宇航员"方向靠拢
终极总结:从"概率抽卡"到"时间雕刻"
亲历者,第三十八站,我们站在了"视觉生成"这座高塔的塔尖。
扩散模型给了我们一个深刻的哲学启示:在AI的世界里,要创造一样东西,最高效的方式或许不是从零搭建,而是先彻底理解它如何"湮灭",再把时间的方向倒过来。
它不再像前几代的AI那样"抽卡式"碰运气,而是像一位耐心的钟表匠,在数学的高维空间里,一步一步地、确定性地把混沌拧回秩序。正是这套"缓慢但极致"的精雕细琢,让今天的AI画师能画出足以乱真的油画,让设计师能一秒生成百张海报草图。
下一站,我们将彻底脱离"生成图像"的范畴,把目光投向那个离我们物理世界最近的方向——具身智能(Embodied AI),让AI真的长出双脚,踏入人间。

图7 范式转变:从概率抽卡(赌徒撒牌碰运气)到时间雕刻(钟表匠确定性地把混沌拧回秩序)
扩散模型不是更快的画笔,而是更深的哲学。先理解湮灭,再逆转时间——创造的终极密码藏在对毁灭的极致理解中。
它用1000次微小的散步替代了一次危险的跳跃,用缓慢但确定的时间雕刻,取代了盲目碰运气的概率抽卡。
原文链接:https://mp.weixin.qq.com/s/d7iG2tfc-MrOU62TPgkGGw?scene=1
|