Stanford CS153: Frontier Systems · 课程录像
从 3D 捕捉到端到端多模态工作
讲者:Amit Jain — Luma AI 联合创始人
时间:2026 年春季 · 时长:约 58 分钟
TL;DR
Amit Jain 认为,图像模型和视频模型都只是通往统一智能系统的中间阶段。最终系统需要同时处理文本、图像、视频、音频与行动轨迹。Luma 的路线也因此从 3D 捕捉转向生成视频,再转向统一多模态模型:目标不只是生成素材,而是完成端到端的创意与物理世界工作。
核心概念
Luma 最初是一套 3D 世界模拟假设
Amit 曾在 Apple 参与 lidar 相关系统,并接触汽车项目与后来的 Vision Pro。这段经历让他意识到,未来计算界面需要比普通二维媒体更丰富的世界捕捉、建模和生成方式。
最初,3D 看起来是自然起点:
- 它比图像承载更多信息
- 更接近对世界的结构化理解
- 可微分 3D 似乎提供了学习世界模型的路径
因此 Luma 最早的目标是构建「世界模拟器」:从丰富的 3D 观察中学习,并最终生成这样的世界表示。
第一个重大教训:互联网上的视频远多于 3D
Luma 发布过 3D 捕捉产品,也证明用户喜欢结果,但数据规模很快成为硬约束。互联网没有可以与海量图像和视频相比的 3D 捕捉数据。
这迫使团队修正基本路线:
- 3D 在语义上很优雅
- 视频才是可扩展学习世界结构的现实路径
这是 Lecture 1 原则的典型案例:前沿策略受真实数据供应约束,而不是只由理论上最优雅的想法决定。
生成视频是学习世界的下一个代理
NVIDIA Hopper 世代出现后,Luma 认为大规模视频建模的算力窗口终于打开。视频包含两个空间维度和时间维度,比稀缺的 3D 捕捉更适合作为世界表示。
Dream Machine 于 2024 年 3 月发布,并在数周内吸引数百万用户。此前市场已经听说生成视频,但大多数人还没有真正用过它。
不过 Dream Machine 不是终点,而是帮助 Luma 建立部署与反馈回路的启动步骤。
前沿飞轮需要产品埋点
一个前沿实验室不只有数据、算力和算法,还需要:
- trainer
- tutor
- 标注人员
- 能捕获有效信号的产品系统
Dream Machine 暴露了一个具体问题:用户会同时下载好视频和坏视频,因此「下载」本身不是可靠偏好信号。团队必须建立偏好系统、标注系统和人工评审流程,区分真正的质量认可、猎奇行为与失败结果。
实验室和产品必须共同设计,部署才能为下一代模型产生可学习的反馈。
为什么视频仍然不够
视频可以展示发生了什么,却不一定表达为什么重要、什么意图产生了这个结果,也无法自然把结果继续串成更深入的工作。
Luma 因此转向 unified intelligence:
- 使用语言模型的上下文推理与记忆
- 使用图像和视频模型的视觉与物理 grounding
- 最终加入音频和行动轨迹
只要任务比代码更接近真实世界,这种统一能力就会变得必要。
从模态塔走向统一主干
Luma 的架构变化可以分成两代。
早期架构:
- 语言塔
- 图像塔
- 视频塔
- 音频塔
- 在后期把各塔融合
新架构:
- 一个更深的共享 backbone
- 不同模态被编码到共同空间
- 在共同空间中完成联合推理
类比人脑:不同感觉系统负责输入编码,但推理最终汇聚到共享认知结构。Luma 试图为机器构建类似机制。
更进一步的目标,是不再把「理解模型」和「生成模型」彻底分开,而是在同一架构中同时完成两者。
统一模型是为了完成工作
统一模型不是「变漂亮的图像模型」。它的目标是跨模态完成端到端工作,例如:
- 生成整套营销活动素材,而不是一段孤立视频
- 帮助影视团队根据复杂指令持续修改镜头
- 为机器人提供更丰富的世界表示
- 直接从推理过程生成幻灯片、图表和视觉解释
智能应该能够以最适合人的媒介表达。文本只是一种输出,图片、幻灯片和视频也是。
端到端工作与多模态 REPL
Amit 用 REPL 描述部署循环:读取、评估、输出、重复。如果目标是完成工作而不是只输出 token,模型必须反复检查上下文、生成中间结果、判断质量并继续。
有两条主要路线:
- 多个专用模型加编排层组成的联邦式系统
- 使用深层共享推理结构的大型统一系统
Luma 押注第二条路线,认为具有共享 backbone 的大模型最终会在复杂多模态工作上超过松散连接的专用系统。
高敏感客户环境中的部署
大型影视公司希望获得前沿能力,却不能允许未发布素材进入通用训练数据。
Luma 把数据分成两类:
- 敏感客户素材:禁止被重新用于训练
- 交互轨迹:仍可以为产品学习提供信号
这个区分在保护客户资产的同时,保留了模型改进所需的反馈回路。
算力、规模与后训练
课程中透露了几组量级:
- 约 30 PB 可训练多模态数据
- 当前使用 H100,并逐步转向 GB300 级别系统
- 模型尚未达到万亿参数,但规模仍在上升
更重要的是,后训练已经成为持续运行的循环:
- 客户数据
- 用户偏好数据
- 人工标注
- 部署后的强化学习与持续学习
所谓「工厂」不再只负责一次预训练,而是长期连接使用与改进。
版权、架构与创意劳动
Amit 认为版权与能力问题相互独立:生成系统降低了侵权门槛,但并没有取消法律责任。
在模型架构上:
- GAN 在蒸馏和部分实时任务中仍有价值
- diffusion 是重要阶段,但未必是最终形态
- 自回归与 diffusion 的混合路线,可能更适合统一系统扩展
他对创造力的判断也很值得注意:模型不一定以人的方式「变得有创造力」,但会给具有品味与判断力的人提供杠杆。创作者可以像程序员一样,把判断教给系统一次,再让成果被规模化复用。
行业观察
- Amit 最早找到 Anjney,是因为听说对方拥有大量 3D 数据;这后来成为 Luma 初始路线的线索。
- Dream Machine 在数周内达到约 600 万用户,为视频模型建立了第一轮大规模偏好回路。
- Luma 把多模态创意工作视为覆盖数亿专业工作者的大市场。
- 高敏感度娱乐客户迫使公司很早就建立数据隔离和部署控制。
- 统一多模态系统本身已经是足够大的战略类别,专注比无限横向扩张更重要。
- 市场可能出现一批在单一重大领域做深的前沿公司,而不是所有公司都追求无限通用化。
印象深刻的片段
- Amit 最早联系 Anjney 的话几乎就是:「听说你有很多 3D 数据,可以给我吗?」
- 他用很直白的方式解释「可微」:如果不能用梯度下降优化,深度学习就无法工作。
- 课堂先开玩笑说程序员可能成为「濒危物种」,随后把角色重新定义为 trainer、tutor 与 orchestrator。
- 他对创作者的判断更乐观:艺术家终于可能获得软件式杠杆,把「什么叫好」教给系统并规模化复用。
代表性观点
必须围绕数据现实设计整个系统。
视频仍然不够。
下一步需要统一智能。
Transformer 并不在意输入究竟来自哪一种模态。
选择做什么,本身就是一种创造。
延伸阅读
- NeRF 与可微 3D:理解 Luma 最初世界模拟路线的基础。
- 生成视频与 Dream Machine:理解视频为什么成为可扩展世界表示。
- 统一多模态架构:本讲核心,即从模态专用塔转向共享推理主干。
关联
- 本文属于 CS153: Frontier Systems 课程笔记。
- 上一讲:CS153 第 3 讲:前沿视觉智能系统
- 语音侧的架构取舍:CS153 第 2 讲:语音系统的未来