皮皮舟岁月

A JOURNAL OF TRAVEL · CODE · MARKETS
第三十六期 · 第 36 号 二〇二六年八月 · 立秋之后

扩散模式 VS 推理模式·产业篇:生成与思考,AI计价的两套引擎

2026-09-04 197 阅读 合集 · 9月市场观察

面向已有 AI 基础的读者。这篇文章把过去十年里 AI 世界里最像「两套相反世界观」的两种范式放在同一张桌上——扩散模式(Diffusion / 发散生成)推理模式(Reasoning / 链式思考)。我们既讲技术(扩散模型 vs 推理模型),也讲思维方式(发散 vs 聚焦),并从基本概念、核心机制、硬件、成本、应用、产业与时间线多个维度把两者剥开对比,最后落到一句话:它们不是对手,而是互补的两种引擎。

封面_产业篇:左为发散/生成的涌现之形,右为推理/思考的秩序之网


壹 · 两个词,两层含义

「Diffuse」这个词最有意思的地方,是它同时精确地指向了两个看似无关、实则同构的东西。

技术层面,它指 Diffusion——扩散模型。从一堆纯噪声里,一步一步把隐藏的图片、视频、声音「显影」出来;这是 2020 年之后统治图像与视频生成的那套数学。OpenAI 的 DALL·E、Sora,Stability AI 的 Stable Diffusion,Black Forest Labs 的 FLUX,快手可灵、字节即梦,它们的底下九成都是扩散(或其变体)。

认知层面,它指「发散思维」(diffuse think)——人脑里那种放松的、放松联想、注意力摊开的状态,灵感往往在这里冒头。与之相对的是「聚焦/推理」思维(focused / reasoning),注意力收窄成一条线,严谨递推、步步验证。

而「Reasoning / 推理模式」则直接指向 2024 年之后那条最陡峭的曲线:从 OpenAI 的 o1 到 DeepSeek-R1,模型在回答问题「之前」先自行写下一长串看不见的思考过程(chain-of-thought),像解数学题那样逐步推导。

为什么要放在一起写?因为一个有趣的呼应正在发生:技术世界正沿着「生成」与「思考」两条路加速,而它们各自的内在节奏,恰好可以借用人类大脑「发散—聚焦」两种模式的隐喻来理解。 扩散是「先撒开、再收敛」的浮现式生成;推理是「先锚定、再递进」的显式演绎。理解这一对,就能理解 2025–2026 年 AI 的成本、硬件、产品,甚至人才市场的底层逻辑。


贰 · 基本概念:两套引擎各是什么

扩散模式:从噪声里「显影」

扩散模型的思想源头来自热力学。往一杯牛奶里滴一滴墨,墨会不可逆地扩散开、变成均匀的浅灰——这是一个「加熵」的过程。扩散模型把这个过程反过来学:如果我知道「怎么把一张清晰的图逐步加噪成纯噪声」,那我就能训练一个网络学会纯噪声「怎么一步步去噪回清晰的图」。

  • 前向过程(加噪):给定一张真实图片,逐步加入高斯噪声,让它在一段离散的时间步里退化成纯噪声。
  • 反向过程(去噪):训练一个神经网络,输入「某一步的噪声图」,预测「应该去掉的那一点噪声」,反复坐上几十步,把噪声图一步步还原成一张高清图。

这一正一反,就是 DDPM(Denoising Diffusion Probabilistic Models)的骨架(Ho et al., 2020,目前引用已约 1.76 万次)。它后来被工程化地移植进潜空间(Latent Diffusion,2022,引用约 1.5 万次),在比像素小得多的压缩特征空间里做扩散,成本暴降,才让 Stable Diffusion 这类开源模型能跑进普通显卡。

推理模式:从已知里「推导」

推理模型不回答「是不是」,而是回答「怎么来的」。它把「答案」拆解成一条可审计的、逐步推进的思考链:先理解问题,再定义子目标,一步步走,随时能自查、能回溯、能换路。

推理解法的代表是思维链(Chain-of-Thought,Wei et al.,2022):只要在提示词里让模型「一步一步想」,它的复杂推理正确率就显著上升。2024 年 OpenAI 的 o1 把这件事内化了——不是靠提示词,而是把「思考」做成了模型自身的训练与运行机制,模型先自己生成一大段内部的思考 token,再给出最终答案。

一句话总结:扩散模式做的是「逆猜过程」——逆向还原噪声背后的信号;推理模式做的是「顺推路径」——沿着逻辑链逼近结论。 前者擅长创造新内容,后者擅长解决旧难题。

这里先把一个容易混淆的点立清楚:扩散与推理并不互斥,今天很多头部产品其实是两者的混合体。 DALL·E 的初版(2021)本质是一个 12B 的自回归 Transformer 加 dVAE 解码器,并不是纯扩散;而 Sora、可灵表面上以扩散为主干,却又借用 Transformer 的序列建模去维持视频跨帧的连贯性。我们讨论的“模式”,是指决定一个系统“解题心智”的主导引擎,而不是某个模型的全部零件。只有在这种定义下,“扩散擅长创造、推理擅长求解”的分法才真正站得住。

为了在直觉上把两套引擎钉得更死,不妨借两个老物件打比方。扩散模式像老式的照片冲印:底片浸在显影液里,你一遍遍地浸泡、定影,模糊的轮廓渐渐浮现成清晰的画面——你看到的每一步都不是“逻辑推理”,而是“逐渐显现”;终稿是一张完整、却不一定守规矩的照片。推理模式则像解一道几何证明题:从已知条件出发,一行一行地写理由,每步都有依据、可查、可改、可重来,直到最后一行才得出那个结论。一句话,一个给你“作品”,一个给你“证明”。


叁 · 核心机制:噪声到结构 vs 已知到结论

扩散的正向—反向动力学

扩散模型的本质是学一个「数据分布 → 噪声分布」的可逆时间表,然后用神经网络逼近逆向的每一小步。最经典的损失函数让模型在某个随机时间步上预测「刚加进去的那点噪声」:

# DDPM 前向加噪 + 训练核心(示意,PyTorch 风格)
def q_sample(x_start, t, noise, alpha_bar):
    # x_t = sqrt(alpha_bar_t) * x0 + sqrt(1 - alpha_bar_t) * eps
    return torch.sqrt(alpha_bar[t]) * x_start + torch.sqrt(1 - alpha_bar[t]) * noise

def train_step(model, x0):
    t = torch.randint(0, T, (x0.shape[0],))
    noise = torch.randn_like(x0)
    x_t = q_sample(x0, t, noise, alpha_bar)
    noise_pred = model(x_t, t)          # 网络学会:给定 x_t 和步数,还剩多少噪声
    return F.mse_loss(noise_pred, noise)

采样时则反过来,从纯噪声 $x_T \sim \mathcal{N}(0,I)$ 出发,沿着网络预测的噪声方向,一步步往回走几十步(DDIM 通常约 20–50 步,FLUX 消费级推荐约 25 步剧情速度质量平衡)得到图像。生成「一次成图」,没有中间的文字逻辑,也没有可解释的推理。

随着控制与加速算法的演化,后来的模型更进一步:一致性模型(Consistency Models) 把多步教师「蒸馏」成几乎一步的学生;流匹配(Flow Matching / Rectified Flow) 用一种更光滑、可扩展性更好的路径替代了原始扩散的加噪曲线,成为 FLUX、Sora 等新世代生成模型的主流。再往后,DiT(Diffusion Transformer) 把扩散的骨干网络从 U-Net 换成 Transformer,让扩散也能吃大模型的规模化红利。

扩散能“画得好”,还有一个工程上的秘密——classifier-free guidance(无分类器引导)。采样时同时用「带条件」和「不带条件」两个预测做外插,放大提示词的影响力,让生成结果更贴着语义走;如今这几乎是所有文生图模型的标配,也是“提示词能有多听话”的来源。但扩散对长程一致性与纯逻辑天然薄弱——每一步只负责消掉当前这一图的噪声,并不持有「这句话到底要说什么」的全局语义,所以在纯文字任务上,它长期被自回归压着打。这也正是两者最根本的分工:扩散看局部与分布,自回归看全局与语义。

推理的前向解码与测试时扩展

推理模型的底座仍是 Transformer 的自回归解码——逐 token 生成。它的「新东西」在于两点:

  1. 思考 token(reasoning token):在正式回答之间,模型先一次性生成成千上万字的内部推导,这些 token 对用户不可见,但参与生成、参与计费(具体量级见柒、捌的案例与账本)。
  2. 测试时计算(test-time compute):把「想得更久 = 算得更多」显式地变成商品。OpenAI 从 o1 到 o3,支持调节 effort/思考预算;Anthropic 的 Claude Opus 4.7 引入 adaptive thinking 与 dynamic budget;Google Gemini 有 Thinking/Deep Think 档位。这是 2025 年之后最被热议的新扩展律(scaling),与训得更大的「训练时扩展」互补。

一段粗糙的「推理循环」示意(内部思考 → 答案),以及推理模型家族常用的 Best-of-N 采样——多路思考后投票选优:

# 推理延长示意:内部思考 → 收敛到答案(伪代码)
def reason(model, prompt, budget=2000):
    think = ""
    used = 0
    while used < budget:                    # 花掉一段"思考预算",逐步推进
        step = model.decode_with_logits(think, stop_at="\n")
        think += step; used += len(step)
        if step.startswith("所以") or step_starts_answer(think):
            break
    return model.complete(think + "最终回答:")   # 再吐出一个可见答案

# 测试时"多路投票"(Best-of-N)提升稳定正确率
best = max((model.reason(p) for _ in range(N)),
           key=lambda r: self_consistency_score(r))

值得强调:推理模型的能力不是“在提示词里加一句想一想”那么简单,而是靠强化学习烧出来的。 DeepSeek-R1-Zero 的做法很有代表性——不给模型任何“标准答案步骤”,只给最终的正确/错误奖励信号,让模型自己在海量试错里“涌现”出一套可解释的长思维链:它是自己学会“先想清楚再回答”的。OpenAI 的秘密也大致在这个方向:用大规模强化学习加验证器(verifier),把“会推理”直接写进权重。这也从机制上解释了为什么推理模型的训练比普通对话模型贵得多——它优化的是过程,而不只是答案。


肆 · 起源与演进:一条时间轴,两种叙事

用时间轴看最清楚:扩散走的是一条「从物理定律到开源爆款」的曲线,推理走的是一条「从规则系统到自我思考」的曲线,而这两条曲线在 2024–2025 年几乎同时进入了陡峭期。

年份 扩散(生成)路线 推理(思考)路线
2015 Sohl-Dickstein 用非平衡热力学提出扩散生成 深度学习推理仍以符号/规则为主
2017 Transformer 提出,自回归架构定型
2019 Score-based 生成模型奠基
2020 DDPM、DDIM:现代扩散框架成型 GPT-3 展示少样本推理
2021 Diffusion 在图像质量上超过 GAN
2022 8 月 Stable Diffusion 开源,扩散进入消费级 思维链 CoT 提出;DALL·E 用自回归+扩散混合
2023 SDXL、DiT、一致性模型 GPT-4 综合推理登顶
2024 Sora、SD3/MMDiT、FLUX、流匹配大规模化 9 月 o1 开启显式思考范式;12 月 o3、Gemini Thinking、QwQ
2025 FLUX.2(FP8)、视频扩散(可灵/Veo/Seedance)、扩散语言模型初现(Mercury、DiffusionGemma) DeepSeek-R1 开源引爆推理蒸馏;Claude、Gemini、Grok 全面转向 hybrid reasoning;测试时扩展律成热词
2026 扩散与自回归开始双向融合,多模态音视频一体生成 GPT-5/5.5、Gemini 3、Claude Opus 4.x,推理成本分层成为产品形态

同样以 2022 年为镜,那其实是一段被高强度压缩的“图像大爆炸”年:4 月 DALL·E 2、5 月 Google Imagen、8 月 Stable Diffusion 开源,Midjourney 则在一路小圈子里口碑发酵。一年之内,文生图从实验室演示变成了几千万人的日常工具,节奏快得几乎改写了设计师与画师的生产方式。反观推理侧,同期却显得有些“沉闷”——GPT-4 的综合能力让人惊叹,可一旦碰上多步算术或严谨证明就露出短板。也正是这个缺口,才让 2024 年下半年 OpenAI 用一个完整的产品形态把谜底揭穿:把“想得更久”明码标价地卖给需要正确性的用户。两条曲线的此消彼长,构成了整个生成式时代最耐看的一条暗线。

两个「引爆点」尤其值得单独说。

扩散的引爆点是开源。 2022 年 8 月 22 日 Stable Diffusion 以开放权重发布,CompVis/stable-diffusion 仓库如今约 7.3 万 star,AUTOMATIC1111 的 WebUI 更达约 15.6 万 star。一夜之间,Midjourney、Runway,再到国内的可灵、即梦,整个文生图/文生视频生态都在这套公开机制上疯长。

推理的引爆点是"开源 + 蒸馏"。 2025 年 1 月 20 日 DeepSeek-R1 以 MIT 许可开源了 660B 权重和完整思考轨迹,并能蒸馏出 1.5B 到 70B 的小模型;32B/70B 蒸馏版在多项能力上逼近 o1-mini。这让「人人都能做带思考能力的小模型」成为现实,OpenAI 的秘方第一次被摊开在桌面上。

有意思的是:2025 年两条曲线开始交汇。Google 发布 DiffusionGemma(26B MoE,声称文本生成最快可快 4 倍,因扩散可并行处理 256-token 的块),Mercury 在 H100 上宣称超过 1000 tokens/s。扩散不再只画图了——它开始尝试写文字、做语言推理;而推理模型则越来越「生成式」,把一整段思维「涌现」出来。两个世界在靠近。


伍 · 硬件要求:一张 4090 能把两者分开

对 AI 技术人来说,硬件是最直观的「分水岭」。同样是「消费级显卡能不能玩」,扩散和推理的答案完全不同。

扩散:消费级显卡是主战场

  • 训练并不便宜,但也已经「降」到场内玩家能摸到:Stable Diffusion 当年公开训练约花 15 万 GPU·小时、约 256 台 A100、成本约 60 万美元;Anyscale 声称 SD v2 在约 20 亿张图上训练成本可压到 4 万美元以内;甚至出现过号称 1890 美元、37M 张图、1.16B 参数、8 卡 H100 约 2.6 天训完的「微预算」实验。
  • 推理/微调更是人人都能碰:RTX 4090 上 SDXL 单张约 3.2 秒,FLUX 约 18 秒;FLUX FP16 显存最低约 12GB,4090/3090 完全可跑;SDXL 的 LoRA 微调 16GB 以上显存即可。SD 家族 + LoRA + ControlNet + ComfyUI,是过去三年全球「个人民宿」式生成工作台的标准配置。

推理:显卡决定了你能用多大的「脑子」

  • 训练是算力大头,这一点扩散没法比——训练一个前沿 LLM 的算力门槛远高于「画图」模型,这也是为何前沿推理大模型集中在少数巨头手里。
  • 推理的差别不在「能不能跑」,而在「想多久、贵多少」。自回归推理逐 token 生成,本身就吃算力和时延;而加了思维链后,思考 token 让推理成本成倍放大——不是输出变长,而是每一次回答都要先走几千上万字的内部推导(成本侧的完整账本见捌)。GPU 显存决定了你能装下多大的模型,而「思考预算」决定了你要为它付多少电费。
维度 扩散(生成) 推理(思考)
训练算力门槛 中(开源后近消费级/低价云可训) 高(前沿模型需万卡级集群)
推理硬件友好度 高(4090 即畅玩,本地部署主流) 中(可本地,但思考成本高)
推理节奏 并行解码/显影,数十步成图 逐 token 自回归 + 长思考链
显存敏感点 采样步数与模型体量 思考 token 量与模型体量
本地可玩性 ★★★★★ ★★★☆

还有一层工程现实的差异更值得点出:生成型任务的算力可以大量让利给“批处理”和“缓存”——同一个提示词可以并行产出几十张候选图,一次采样中间的张量能被高效复用,GPU 利用率往往拉得很高;而推理型任务本质是一串无法并行摊平的顺序依赖——第 N 个思考 token 必须等前 N-1 个生成完,再叠加越来越长的 KV 缓存,GPU 的并行度被顺序性死死压住。这也是为什么同样规模的集群,跑稳定文生图可能同时服务几万用户,而一个深度推理模型的在线并发却要小心规划。硬件的天花板,从来不只是“装不装得下”,更是“闲不闲得下来”。


陆 · 思维方式:发散与聚焦,人类心智的一体两面

这一层是「隐喻落地」——为什么扩散和推理正好能对应大脑的两种模式。

配图_产业篇_发散与聚焦:左为松弛散开的发散联想之网,右为拧成一股线的聚焦推理之链

人脑其实在两套模式间高频切换:**发散模式(diffuse thinking)**里,注意力是「松弛摊开」的,神经信号在更大范围自由连接,顿悟、灵感、拍脑门的好主意的产生大多靠它;**聚焦模式(focused thinking)**里,注意力拧成一条线,专注在已知、可靠、可验证的步骤上,严谨但容易陷入同一个思路出不来。睡觉、散步、洗澡时冒出的灵感,往往就是发散模式在后台帮你工作。

把这套切换映射到 AI 上:

  • 扩散模式 = 机器版的"发散"。它不做显式推理分类,它让信息在数百万维的"噪声空间"里自由重组,靠大量的并行尝试与统计收敛,最终"浮现"出一个结构。它不解释、不保证逻辑,但它能创造出之前不存在的像素组合——这正是灵感的样子。
  • 推理模式 = 机器版的"聚焦"。它锚定目标,把推理拆成可验证的小步,每一步都建立在上一步之上。它慢、它贵,但它可靠、可审计、可纠错——这正是严密推导的样子。

更妙的是,真正的创造力来自两者的协作,而非取舍。人类是先发散地想出若干方向,再聚焦地严密验证;AI 产品当下也正在走向同样的"先扩后收":扩散侧开始借用推理式的约束与控制(ControlNet、提示词推理、世界模型),推理侧开始尝试扩散式的并行生成与全局纠错(扩散语言模型)。发散负责"生成可能性",聚焦负责"收敛正确性"——两者之间,才是一个完整的心智闭环。

这套"双模式"并非生造。认知科学家 Barbara Oakley 在《学习之道(A Mind for Numbers)》里把学习明确分成两种模式:发散模式负责"灵感潜行",适合构思方向、发现新联系;聚焦模式负责"硬啃",适合解方程、记事实、验证步骤。健康的解题周期,是先发散地想清楚"往哪走",再聚焦地"走完",卡住了就切回发散、换个思路。今天用同样的眼光看 AI,会发现惊人的同构:纯扩散的模型会"喷"出一大堆可能性但不保证正确,纯推理的模型会"死磕"一条路却又少了发散带来的转角。于是头部产品的共识开始浮现——先生成多种候选方案,再推理择优与校验,本质上就是把人体早已验证过的那条认知回路,迁移到了机器身上。


柒 · 主要应用场景:生成的世界 vs 思考的世界

扩散的疆域:一切"从乌有到有形"

  • 文生图 / 图像创作:DALL·E、Stable Diffusion、Midjourney、Imagen、FLUX,画家、设计师与普通用户的美术生产力被重写。
  • 文生视频 / 视频创作:OpenAI Sora、Google Veo、Runway、Adobe Firefly,以及国内快手可灵(Kling)、字节即梦/Seedance、阿里通义万相(Wan)、MiniMax 海螺(H3)——从 5 秒的镜头到几分钟的叙事,视频工业被重新定义。
  • 音频与语音:扩散被用于音乐、音效、TTS 的自然度提升。
  • 科学发现:AlphaFold 在蛋白质结构预测上的突破虽是 2021 年的故事,但其"从序列到结构"的生成式思路,正是扩散/生成式方法影响力的注脚;材料、药物分子生成也大量用扩散。
  • 超分 / 修复 / 3D / 4D:超分辨率、图像补全、多视角生成,几乎每个视觉任务都能套上扩散。

落地成具体案例,四个就足以看清"从乌有到有形"是怎么变成真金白银的生产力的。

案例一 · AI 长剧《后西游记》:扩散把"短片"推进到"长叙事"。 2026 年 8 月 31 日上星的芒果TV《后西游记》,是首部全程由 Seedance 视频生成大模型完成画面与人物演绎的全 AI 长剧(事件细节与市场反应见本系列引子篇)。它真正的产业意义在于:把扩散(视频生成)从过去"5–15 秒的素材片段",一把推进到"以集为单位的工业化长叙事"——过去扩散只能做镜头,现在它能撑起一部 40 分钟一集的剧。一个扩散应用,同时点燃了消费侧的观看与产业侧的估值想象。

案例二 · 文生图的"个人民宿"生态:一张 4090 就是一个摄影棚。 2022 年 8 月 Stable Diffusion 开源后,ComfyUI / A1111 + LoRA + ControlNet 垒出一个庞大的平民创作层:设计师做电商主图、广告 KV、小说封面,不再需要约摄影棚、约模特、约后期,改为一台本地显卡批量出图。LoRA 让"一个人的风格/角色/IP"用几十张图、几十分钟就能定制出来,催生"千人千模"的素材经济;ControlNet 让"画面严格跟着骨骼走",撑起电商模特换装、动画角色一致性这类结构性需求。这是扩散生态最早跑通的变现路径——起量靠开源普惠,变现靠 LoRA/ControlNet 构成的差异化工序。

案例三 · 视频进入工业工具链:从"猎奇片段"到"批量素材"。 快手可灵、字节即梦/Seedance、OpenAI Sora、Google Veo 等把生成剪辑从"玩具"变成"工具":广告短视频用它批量产出创意素材、替换动辄数万元一支的外拍成本;影视工业用它做分镜预演(previz)和动态脚本,先低成本"看一眼效果"再决定实拍投入;游戏与影视资产生成则把 3D/4D 扩散推向"可交互、物理一致的世界"。到 2026 年,"2–15 秒可控短片"已成为短视频与广告中小团队的标配——成本与实拍相比降到了"数量级"的级别。

案例四 · 科学发现的生成式底子:AlphaFold 与分子材料设计。 严格讲,AlphaFold"从序列到结构"的生成式建模证明了这套思路能改写一门学科,扩散则把它铺进药物分子、催化剂、晶体与合金材料设计——在候选空间里一天生成海量结构,再交给计算或实验筛选,把过去以"月/年"计的试错枚举压成"天"级的初筛。扩散擅长在巨大空间里"造出合理候选",这恰恰是科学搜索里最贵、也最需要想象力的一环。

推理的疆域:一切"从问题到结论"

  • 数学 / 编程 / 科学难题:o1/o3、DeepSeek-R1、Gemini Thinking 在 AIME、FrontierMath、SWE-bench 上的成绩,已经逼近甚至超过人类的竞赛选手与中级工程师水平。
  • Agent / 工具使用:推理模型把"想清楚再调用工具"内化为能力,让 AI 从"答一句"进化到"盯完一条任务线"(详见案例二)。
  • 决策与规划:长链推理、回溯搜索、世界模型推演,是智能体做复杂决策的核心。
  • 代码与升级迭代:SWE-bench 上 Claude Opus 4.x 突破 80%,"会推理的代码模型"正在取代"只会补全的代码模型"。

把"思考"落到具体场景,四个案例讲清它贵在哪、又值在哪。

案例一 · 竞赛级数学与代码:用思考 token 换"顶配"的正确率。 基于思维链的推理模型在 AIME 竞赛数学、FrontierMath,以及 SWE-bench 这类代码基准上,把正确率推进到逼近甚至超过人类竞赛选手与中级工程师的水平;代价是看不见的思考 token——o3-pro 做硬题时可能先想 3 万–6 万 token、最后只给出 400–600 字的答案。它用"慢且贵"换来了"准且可审计"。

案例二 · 自主 Agent:从"聊一句"到"盯完一件任务"。 推理能力把"想清楚再调工具"内化成系统能力——Claude 的模型能维持 30 小时以上的聚焦自主运行(自我暂停、恢复、多轮工具调用),o4-mini 首次把完整工具使用纳入推理循环。于是"AI 员工"从"答你一句"进化到"替你跑完一条任务线":订行程、跨系统整理数据、改写代码修 bug,人只在中途验收。真正让 Agent 敢"放手干"的,是它的思考链让每一步都可被回溯。

案例三 · 投研与决策:可审计的思考链,正是金融想要的形态。 在专业分工里,推理模型的思维链天然适配"过程要能被复核"的决策场景:把一份研报的论点拆成可核验的假设链、对财报做多步拆解、在"多空框架"里逐步证伪。这类需求要的不是"快",而是"每一步为什么"——而推理模型把"为什么"作为思考链一并交付。这是生成(给一张好看的图)永远替代不了的一层。

案例四 · 教育与科研:分步解法本身就是交付物。 数学辅导、程序设计的"分步讲解"正是推理模型的强项——它不急着给结论,而是给出"能被一点点检验"的过程;科研侧则用它做文献推导、假设生成与实验方案的逻辑审查。"过程即输出"这个属性,让推理在教育与专业分析里有一块稳定的一亩三分地。

一句话分界:扩散擅长"生成没有标准答案的新内容",推理擅长"解决有标准逻辑的复杂问题"。前者服务想象力,后者服务正确性。


捌 · 运行成本:两种"计价货币"

对部署者来说,这话最实在——两者的成本结构完全不同,就像用"件"计价和用"token 计价"。

扩散的账单:按"一次生成"计价

扩散的成本大头在采样步数 × 模型体量。成图单价低、并发高、可本地化,是典型的"一次性渲染"成本模型。Native 本地跑 4090 几张图只要几秒到十几秒,几乎可以当免费的工具用;云上的图像 API 也通常是"一次/每张图"计费。它的成本天花板受限于生成的分辨率、步数、时长(视频按秒数累计算力),但整体上仍是"最亲民"的生成范式。

推理的账单:按"思考的时间"计价

推理的成本模型是"每次回答你偷偷想了多少"。账单上写的是输出 token 单价,但真正烧钱的是那些用户看不见的思考 token

  • 官方口径下,GPT-4 级普通输出约每百万 token 数十美元,而 o1 的输入 15 美元 / 输出 60 美元(每百万 token)、o3-pro 输入 20 美元 / 输出 80 美元,单价只是表象;更真实的成本是 o3-pro 在做硬题时可能产生 3 万–6 万思考 token 后只给你 400–600 字答案。
  • 有研究统计,同样的题目,推理模型的实际 token 开销可达可见输出的 5 到 45 倍;甚至有人测算单条 7B 模型在代码基准上的能耗放大可达 113 倍(arXiv:2505.14733)。
  • 所以 2025 年之后厂商都在给 think 分层定价:Want 想得少(Instant)、想得多(Thinking/Pro/Deep Think),把"思考预算"这一维度和价格捆绑成商品。

两条扩展曲线的经济学

对比维度 扩散(生成) 推理(思考)
计价方式 按生成量(张/秒/分辨率) 按 token 量 + 思考预算
单位成本趋势 持续下探,本地近乎免费 随思考深度非线性上涨
主要成本杠杆 采样步数、模型体积、分辨率 思考 token 量、模型体积
面向用户的观感 便宜、快、可批量 贵、慢、但更"准"
未来方向 少步/单步采样、模型蒸馏 自适应 effort、思考 token 压缩(Sketch-of-Thought 可省 84% 用量)

一句话:扩散的钱花在"画得多精细",推理的钱花在"想得多周全"。 前者是可预见的固定成本,后者是可调节的变量成本——这也是为什么"测试时计算(inference-time compute)"会从技术名词变成一个商业定价概念。

还有一个容易被低估的成本维度——延迟带来的人心成本。扩散成图通常是一到几秒的"等待即惊艳",用户觉得是"在等一幅画";推理模型在思考链上动辄几十秒、甚至几分钟,新手用户会误以为是"卡住了"。为了不让等待显得失控,2025 年起的产品都在做"思考可视化"——把不可见的思维链以节点、文字流的形式放给用户看,把"贵与慢"重新包装成"它正认真在想"的信任感。这本质上是把推理的成本结构,转化成体验的一部分。


玖 · 从业人员、知名公司与产品:生态版图

市场盘子:两个赛道都在爆发

  • 全球:Gartner 预测 2026 年全球 AI 平台与模型市场支出约 6425 亿美元,同比增长约 63.4%;其中生成式 AI 模型支出预计 2026 年增长 117%
  • 中国:2025 年中国大模型市场规模约 495 亿元,2026 年预计突破 700 亿元、同比增长约 49%;中国 AI 核心产业规模 2025 年已超 1.2 万亿元
  • 人才:工信部有口径称 2025 年中国 AI 技能型人才缺口已突破 500 万,而高校每年供给不足 40 万;AI 岗位人才供需比约 0.97(极度供不应求)。薪资上,AI 新发岗位平均月薪约 6 万元,LLM 算法研究员年薪中位数约 120 万元(P90 约 280 万元),AI 算法工程师中位数约 65 万元。

落到人才侧,两个方向的技能栈正在分野。扩散/生成方向,价值点集中在模型压缩与蒸馏(LoRA、一致性/HGD)、采样加速(少步、流匹配)、多模态对齐,以及 ComfyUI 等工程化落地;推理/RL 方向,价值点集中在强化学习与奖励建模、长序列推理优化、测试时算力调度,以及与工具调用、世界模型的结合。招聘热词里,"LLM 微调与推理优化""Agent 框架""提示词工程"明显偏向推理侧,"多模态/图像模型""视频生成"则贴近扩散侧。真正稀缺、也最能拿高薪的,是能同时听懂两套语法、在两种范式之间做架构取舍的复合型工程师——这正是这篇文章想帮你建立的那张全景图。

扩散/生成侧的名角

公司 代表产品 亮点
OpenAI DALL·E / gpt-image、Sora 图像权威度 + 视频叙事标杆(Sora 2,2025-09)
Stability AI Stable Diffusion 开源生态的旗手
Black Forest Labs FLUX.1 / FLUX.2 单体最强文生图之一,12B 级(参数未公开),支持 FP8
Midjourney V7 / V8α 消费级美学天花板,最高 2048×2048
Google Imagen 4 / Veo 3.1 图像 + 4K 60fps 视频、原生竖屏
Runway Gen-4.5 电影级工具链,估值约 50–53 亿美元
Adobe Firefly 商业化、版权安全的生成工具
快手 可灵 Kling 国产视频一哥,2.1/3.0 多次登顶视频榜
字节 即梦 / Seedance 音视频一体(Seedance 2.0,2026-02)
阿里 通义万相 Wan 2.5/2.6/2.7,音画同步、2–15 秒视频
MiniMax 海螺 H3 4–15 秒、768P/2K 多模态

推理/思考侧的名角

公司 代表产品 亮点
OpenAI o1 → o3/o4-mini/o3-pro、GPT-5/5.5 显式思考范式的开创者,effort 分层定价
DeepSeek R1、V3.2/V4 MIT 开源、万亿级蒸馏生态,R1 拉开"开源推理"大幕
Anthropic Claude Opus 4/4.5/4.7 adaptive thinking、SWE-bench 87%+、自主运行 30h+
Google Gemini 2.5/3 Thinking、Deep Think 默认 thinking,1500+ Elo
阿里 Qwen QwQ、Qwen3 混合推理 GRPO 强化学习、开源混推
xAI Grok 3/4 Think/Big Brain 模式,LMArena 登顶
智谱 GLM-4.6 355B MoE,推理/agentic/长上下文
月之暗面 Kimi K2 Thinking 1T MoE、32B active
Meta Llama 4 开源多模态 MoE,支持思考

公司估值:钱往哪烧

估值能说明资本市场怎么投票。2026 年上半年:OpenAI 投后估值一度报约 8520 亿美元(2026-03);Anthropic 有报道称投后超 9000 亿美元;xAI 约 2300 亿美元(2026-01);DeepSeek 曾报 450 亿美元估值、首轮融资超 500 亿元人民币;月之暗面投后 超 200 亿美元;智谱按近 640 亿美元估值被报道;MiniMax 2026-01 上市后市值约 186 亿美元;阶跃星辰约 100–120 亿美元。扩散/生成侧的老兵 Stability AI 累计融资约 2.32 亿美元、Runway 估值约 50–53 亿美元。

发人深省的一点:估值榜首和钱烧最猛的地方,几乎都压在"推理/智能"这条线上;而扩散这条更"平民"的线,贡献了被最多普通用户使用的日常产品。 生成创造流量与体验,推理承载能力与智能——资本市场为后者付了更高的溢价,而日常世界里前者更常被人直接触摸。


拾 · 未来展望:走向融合

判断未来,最好看两条线正在交汇的几处信号。

1. 扩散学会思考(写文字、做推理)。 DiffusionGemma、Mercury 证明了扩散可以并行地生成自然语言,且更快、更便宜;2026 年的扩散语言模型研究(Scheduling Thoughts、Escaping Confidence Trap 等)正在攻"让扩散理解语言与逻辑"。若扩散真能解决语言与长程一致性,它就同时冲击了自回归的成本上限。

2. 推理学会生成(更"涌现")。 推理模型越来越强地依赖长思维链的"软涌现",o3/Gemini 把思考当成前向放大的连续过程;而世界模型(Runway 等方向)正在把"推理"与"生成"合二为一——先推理世界怎么演化,再生成世界的画面。这是理解物理世界意义上的终极融合点。

3. 两者的商业边界会模糊成"能力分层",而非"技术阵营"。 未来一个成熟产品,很可能同时内置:一个扩散或生成式的干将负责"灵感/首稿/画面",一个推理式的军师负责"校验/规划/攻坚",再配一个自回归或混合的调度器在两者间切换——这正像人脑的发散—聚焦随时切换。技术进步的方向,不是二选一,而是让机器在"发散生成"与"聚焦推理"之间,像人一样自如切换

这套"多引擎协同"在产品里已经能看到雏形——未来一个成熟的系统,会像一支分工明确的团队:一个扩散或生成式的主笔,负责从剪影到草稿、从灵感涌现到首版画面;一个推理式的主审,负责把目标拆成清单、校验每个环节的逻辑与风险、必要时驳回重画;一个自回归或混合式的调度官,负责读懂用户意图,决定这一单该让谁先上、谁收尾、花多少成本。这条"发散出题—聚焦解题—中枢调度"的流水线,正在从实验室的前沿论文,向各行业的真实工作流快速渗透。对工程师而言,学会编排这支"多模型团队",将比只精通单一范式更值钱。

4. 成本与扩展律继续分化,但会互相制衡。 训练时扩展(把模型训得更大)与测试时扩展(让模型想得更久)会形成一对供给与需求的螺旋;token 压缩、少步采样、自适应 effort 会同时压低两边的边际成本。真正稀缺的,将不再是"能生成"或"能推理",而是谁能在"质量 × 速度 × 价格"的三角上找到最优的调度


结语

扩散模式与推理模式,表面上是两套技术,底层是两种关于"智能从哪来"的世界观:一个相信涌现——结构会从噪声与经验的统计中自己浮现;一个相信演绎——结论必须由扎实的步骤一步步推理而来。而人脑早就告诉我们答案:真正的智能,既会发散,也会聚焦;既敢想象,也肯验证。

对 AI 技术人来说,这两套引擎不是要站队的对立面,而是两张都要拥有的工具箱。理解扩散,就理解了生成式潮水的来势;理解推理,就理解了智能引擎下一程的方向。掌握二者之间如何切换、如何按成本与质量调度,才是在 2026 年这个节点上,真正值钱的能力。

如果一定要用一句话来权衡两套引擎的取舍,可以这样收拢:当问题是"给我一个起点,帮我想象无数种可能"时,用扩散;当问题是"给我一个目标,帮我严谨地走到底"时,用推理。 而 2026 年之后的进阶玩家,比的早已不是二选一,而是谁能在同一个系统里,把"发散"与"聚焦"调度得行云流水——这才是真正稀缺、也最可持续的工程能力。


附 · 数据来源与参考

数据收集于 2026-09-04,均来自公开来源;个别估值/引用数/星级为第三方口径,使用时应以官方披露为准。

  • Diffusion-Research-Timeline(引用统计):https://github.com/jeffreybarry/Diffusion-Research-Timeline
  • AI Wiki — Reasoning Models / Text to Image / Stable Diffusion:https://www.aiwiki.ai/wiki/reasoning_models
  • awesomeagents — Reasoning Model Pricing:https://awesomeagents.ai/pricing/reasoning-model-pricing/
  • llm-stats — DeepSeek-R1 vs o1:https://llm-stats.com/models/compare/deepseek-r1-vs-o1-2024-12-17
  • 迁移研究 — Energy Cost of Reasoning:https://arxiv.org/html/2505.14733v2
  • Inference Scaling Laws:https://arxiv.org/pdf/2408.00724 ;Kinetics:https://arxiv.org/pdf/2506.05333v2.pdf
  • DeepSeek-R1 论文:https://arxiv.org/pdf/2501.12948
  • Google — DiffusionGemma:https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/
  • Mercury(扩散语言模型):https://arxiv.org/pdf/2506.17298
  • NVIDIA — FLUX.2:https://blogs.nvidia.cn/blog/rtx-ai-garage-flux-2-comfyui/
  • Stable Diffusion 训练成本:https://www.aiwiki.ai/wiki/stable_diffusion/raw ;Anyscale:https://www.anyscale.com/blog/scalable-and-cost-efficient-stable-diffusion-pre-training-with-ray
  • Gartner — 2026 AI 平台与模型市场:https://www.gartner.com/en/newsroom/press-releases/2026-07-20-gartner-forecasts-worldwide-ai-platforms-and-models-market-to-grow-63-percent-in-2026
  • 中国日报网 — AI 人才供给:http://cn.chinadaily.com.cn/a/202603/11/WS69b14058a310942cc49a2a17.html
  • 薪智 — LLM 算法人才薪酬:https://www.suntzuchina.com/china-ai-llm-talent-compensation-2026/
  • 36 氪 / Cosmos — 智谱估值:https://m.36kr.com/p/3845847971858696
  • 可灵 / 即梦 / 通义万相 / 海螺 详情见正文表格对应产品官网与阿里云帮助中心、多模态行业研报。

本文为技术科普与行业观察,数据以发布时间为准,不完全代表任何投资建议。

分享此文

评论 (0)

还没有评论,来抢沙发。

发表评论