Stanford CS153: Frontier Systems · 课程录像
潜空间扩散、多模态与 Flux 反馈飞轮
讲者:Andreas Blattmann — Black Forest Labs 联合创始人
时间:2026 年春季 · 时长:约 61 分钟
TL;DR
Andreas Blattmann 回顾了前沿视觉系统如何从单模态图像生成,走向更广义的多模态视觉智能。核心判断是:模型真正有用,不是因为它能生成漂亮图片,而是因为它能在更自然的表示上学习、闭合用户反馈回路,并逐步统一图像、视频、音频与文本之间的理解。
核心概念
从 Heidelberg 小实验室到潜空间扩散
Black Forest Labs 的研究文化来自一个现实约束:2019 年,Andy 所在的计算机视觉团队规模很小,却要与算力充足的大型实验室竞争。直接在像素空间训练图像生成模型成本太高,他们没有超大云厂商级别的资源。
这推动了一个关键思路:如果像素空间过于浪费,就不要直接建模像素。先学习一种经过压缩、同时保留感知意义的潜在表示,再在潜空间里训练生成模型。这成为 latent diffusion 的基础。
结果是显著的计算杠杆:他们用少得多的算力,训练出了能与资金更充足的团队竞争的模型。
Stable Diffusion 让视觉 AI 变得可感知
生成建模早已存在,但 Stable Diffusion 跨过了一条重要门槛:非研究人员也能立即看出能力发生了跃迁。
这种「人人看得懂」的变化不仅是技术事件,也是社会和生态事件。视觉 AI 从小众研究方向,变成开发者、创作者和普通用户都能实验、讨论与构建产品的前沿能力。
因此 Stable Diffusion 的意义不只在模型本身,它也是视觉系统正式进入前沿基础设施栈的时刻。
自然表示与人工表示
Andy 把数据表示分成两类:
- 自然表示:图像、视频、音频
- 人工表示:文本
这并不是说文本不重要。文本是人类为了高效沟通创造的高度压缩、低冗余抽象;图像、视频和声音则具有更高带宽与冗余,也更接近世界本身。
由此可以得到一条学习假设:
- 人类先从看、听和互动中学习
- 更高层智能建立在这些自然信号之上
- 如果模型只从语言开始,它可能从错误的抽象层起步
这直接挑战了「语言是智能唯一入口」的观点。
为什么真正的视觉智能必须是多模态的
文本生成图像是重要阶段,但它主要仍是内容生产工具:生成艺术图片、风格转换和营销素材,并不等于通用视觉智能。
下一阶段需要共同利用:
- 图像
- 视频
- 音频
- 文本
原因在于因果理解。当模型同时看到两个物体碰撞并听到对应声音时,它能学到比纯视觉更丰富的世界结构。跨模态相关性会把系统从表面生成推向更有根基的理解。
应用也会从内容创作扩展到机器人、计算机操作、物理 AI、世界建模与模拟。
Flux 飞轮:用户需求改变模型路线
Black Forest Labs 用真实部署数据决定下一步研究方向。
Flux 1 最初是文本生成图像模型。上线后,团队发现大量用户并不只想通过 prompt 生成新图片,而是需要精确编辑,尤其是保持人物一致性。
反馈循环是:
- 发布一个强基础模型
- 观察用户在真实环境中尝试什么
- 找出反复出现、摩擦最大的需求
- 围绕这个需求做后训练或扩展
这条路径最终产生了 Flux 1 Context,并显著改善了可扩展图像编辑和身份一致性。
人物一致性为什么是前沿问题
早期图像模型可以生成漂亮画面,却很难服从精确控制。「给这个人戴一顶帽子」常常会直接生成另一个人。
Andy 不把这种失败视为问题无解,而是把它看作下一项关键能力已经变得清晰。只要观察到足够多的真实使用行为,解决方向就会逐渐显现。
这也是创业上的提醒:大型竞争对手发布亮眼产品时,不必立刻恐慌。更重要的是阅读自己的数据,找到仍未被解决的问题,然后持续投入。
开放权重也是学习优势
开放模型可以被用户带入许多不同环境,因此公司能够看到更多边缘案例、偏好、工作流与失败模式。
课程并没有把开放与封闭当成纯粹意识形态问题,而是把它视为市场与产品设计选择:
- 当偏好高度分散、呈长尾分布时,开放模型尤其有价值
- 当需求集中且较标准化时,封闭系统可能更合适
对 Black Forest Labs 来说,开放分发帮助团队发现了最值得投入后训练的上下文。
Self-flow 与多模态推理
课程最后介绍了 self-flow:让视觉生成模型内部表示与更丰富的语义结构对齐,为多模态学习做准备。
过去的对齐工作通常局限于单一模态,例如把生成模型的表示拉近 DINO 等图像表征模型。当目标变成共享的多模态表示空间后,这种方法就不够了。
Self-flow 的目标不是只生成连贯像素,而是让系统在多个自然数据流之间理解正在发生什么。
防护标准与组织文化
Andy 把视觉 AI 公司视为基础设施提供者。要成为可信标准,防护规则就必须对所有客户一致,包括:
- 强内容过滤
- 满足欧盟合规要求
- 提供用户数据删除路径
- 不因大客户要求就降低保护标准
这与 Lecture 1 的判断相呼应:成熟基础设施最终需要可信标准与制度,而实验室自己也要开始承担这种制度角色。
行业观察
- 算力受限迫使团队把效率变成战略优势,而不是只把它视为缺点。
- Stable Diffusion 证明,开放分发可以同时放大采用率和反馈量。
- Flux 1 Context 来自对用户重复行为的观察,而不是纯抽象研究路线。
- 视觉模型公司可以成为基础设施公司,而不只是 Demo 实验室。
- 课程提到 Black Forest Labs 在团队仍然精简的情况下,实现了快速收入增长。
- 开放与封闭更适合作为商业设计选择,而不是简单的价值立场。
印象深刻的片段
- 课程继续保持「AI Coachella」氛围,以 Bella Napoli 和 CS153 Spotify 播放列表开场。
- Anjney 把每一讲称为一次进入「前沿工厂」的实地参观,Black Forest Labs 是视觉智能工厂。
- Andy 最初选择机械工程,因为那是典型的德国教育路径,后来才进入 AI。
- 访谈多次回到一个组织原则:竞争对手发布产品后别慌,重新画出前沿边界,然后继续交付。
代表性观点
资源有限迫使我们发明更高效的算法。
自然模态会成为未来更高层智能的基础。
应该回到第一性原理,看看人类自己是如何学习的。
用户真正需要的,不只是生成,而是编辑。
如果要成为值得依赖的基础设施,就不能对不同客户执行不同标准。
延伸阅读
- Latent Diffusion / Stable Diffusion:理解高效图像生成路线的基础。
- DINO 与图像表征学习:理解生成表示与语义结构对齐的背景。
- Self-flow:课程推荐继续追踪的多模态对齐方向。
关联
- 本文属于 CS153: Frontier Systems 课程笔记。
- 上一讲:CS153 第 2 讲:语音系统的未来
- 下一讲:CS153 第 4 讲:统一智能系统