Stanford CS153: Frontier Systems · 课程录像

从 3D 捕捉到端到端多模态工作

讲者:Amit Jain — Luma AI 联合创始人
时间:2026 年春季 · 时长:约 58 分钟


TL;DR

Amit Jain 认为,图像模型和视频模型都只是通往统一智能系统的中间阶段。最终系统需要同时处理文本、图像、视频、音频与行动轨迹。Luma 的路线也因此从 3D 捕捉转向生成视频,再转向统一多模态模型:目标不只是生成素材,而是完成端到端的创意与物理世界工作。


核心概念

Luma 最初是一套 3D 世界模拟假设

Amit 曾在 Apple 参与 lidar 相关系统,并接触汽车项目与后来的 Vision Pro。这段经历让他意识到,未来计算界面需要比普通二维媒体更丰富的世界捕捉、建模和生成方式。

最初,3D 看起来是自然起点:

  • 它比图像承载更多信息
  • 更接近对世界的结构化理解
  • 可微分 3D 似乎提供了学习世界模型的路径

因此 Luma 最早的目标是构建「世界模拟器」:从丰富的 3D 观察中学习,并最终生成这样的世界表示。

第一个重大教训:互联网上的视频远多于 3D

Luma 发布过 3D 捕捉产品,也证明用户喜欢结果,但数据规模很快成为硬约束。互联网没有可以与海量图像和视频相比的 3D 捕捉数据。

这迫使团队修正基本路线:

  • 3D 在语义上很优雅
  • 视频才是可扩展学习世界结构的现实路径

这是 Lecture 1 原则的典型案例:前沿策略受真实数据供应约束,而不是只由理论上最优雅的想法决定。

生成视频是学习世界的下一个代理

NVIDIA Hopper 世代出现后,Luma 认为大规模视频建模的算力窗口终于打开。视频包含两个空间维度和时间维度,比稀缺的 3D 捕捉更适合作为世界表示。

Dream Machine 于 2024 年 3 月发布,并在数周内吸引数百万用户。此前市场已经听说生成视频,但大多数人还没有真正用过它。

不过 Dream Machine 不是终点,而是帮助 Luma 建立部署与反馈回路的启动步骤。

前沿飞轮需要产品埋点

一个前沿实验室不只有数据、算力和算法,还需要:

  • trainer
  • tutor
  • 标注人员
  • 能捕获有效信号的产品系统

Dream Machine 暴露了一个具体问题:用户会同时下载好视频和坏视频,因此「下载」本身不是可靠偏好信号。团队必须建立偏好系统、标注系统和人工评审流程,区分真正的质量认可、猎奇行为与失败结果。

实验室和产品必须共同设计,部署才能为下一代模型产生可学习的反馈。

为什么视频仍然不够

视频可以展示发生了什么,却不一定表达为什么重要、什么意图产生了这个结果,也无法自然把结果继续串成更深入的工作。

Luma 因此转向 unified intelligence:

  • 使用语言模型的上下文推理与记忆
  • 使用图像和视频模型的视觉与物理 grounding
  • 最终加入音频和行动轨迹

只要任务比代码更接近真实世界,这种统一能力就会变得必要。

从模态塔走向统一主干

Luma 的架构变化可以分成两代。

早期架构:

  • 语言塔
  • 图像塔
  • 视频塔
  • 音频塔
  • 在后期把各塔融合

新架构:

  • 一个更深的共享 backbone
  • 不同模态被编码到共同空间
  • 在共同空间中完成联合推理

类比人脑:不同感觉系统负责输入编码,但推理最终汇聚到共享认知结构。Luma 试图为机器构建类似机制。

更进一步的目标,是不再把「理解模型」和「生成模型」彻底分开,而是在同一架构中同时完成两者。

统一模型是为了完成工作

统一模型不是「变漂亮的图像模型」。它的目标是跨模态完成端到端工作,例如:

  • 生成整套营销活动素材,而不是一段孤立视频
  • 帮助影视团队根据复杂指令持续修改镜头
  • 为机器人提供更丰富的世界表示
  • 直接从推理过程生成幻灯片、图表和视觉解释

智能应该能够以最适合人的媒介表达。文本只是一种输出,图片、幻灯片和视频也是。

端到端工作与多模态 REPL

Amit 用 REPL 描述部署循环:读取、评估、输出、重复。如果目标是完成工作而不是只输出 token,模型必须反复检查上下文、生成中间结果、判断质量并继续。

有两条主要路线:

  1. 多个专用模型加编排层组成的联邦式系统
  2. 使用深层共享推理结构的大型统一系统

Luma 押注第二条路线,认为具有共享 backbone 的大模型最终会在复杂多模态工作上超过松散连接的专用系统。

高敏感客户环境中的部署

大型影视公司希望获得前沿能力,却不能允许未发布素材进入通用训练数据。

Luma 把数据分成两类:

  • 敏感客户素材:禁止被重新用于训练
  • 交互轨迹:仍可以为产品学习提供信号

这个区分在保护客户资产的同时,保留了模型改进所需的反馈回路。

算力、规模与后训练

课程中透露了几组量级:

  • 约 30 PB 可训练多模态数据
  • 当前使用 H100,并逐步转向 GB300 级别系统
  • 模型尚未达到万亿参数,但规模仍在上升

更重要的是,后训练已经成为持续运行的循环:

  • 客户数据
  • 用户偏好数据
  • 人工标注
  • 部署后的强化学习与持续学习

所谓「工厂」不再只负责一次预训练,而是长期连接使用与改进。

版权、架构与创意劳动

Amit 认为版权与能力问题相互独立:生成系统降低了侵权门槛,但并没有取消法律责任。

在模型架构上:

  • GAN 在蒸馏和部分实时任务中仍有价值
  • diffusion 是重要阶段,但未必是最终形态
  • 自回归与 diffusion 的混合路线,可能更适合统一系统扩展

他对创造力的判断也很值得注意:模型不一定以人的方式「变得有创造力」,但会给具有品味与判断力的人提供杠杆。创作者可以像程序员一样,把判断教给系统一次,再让成果被规模化复用。


行业观察

  • Amit 最早找到 Anjney,是因为听说对方拥有大量 3D 数据;这后来成为 Luma 初始路线的线索。
  • Dream Machine 在数周内达到约 600 万用户,为视频模型建立了第一轮大规模偏好回路。
  • Luma 把多模态创意工作视为覆盖数亿专业工作者的大市场。
  • 高敏感度娱乐客户迫使公司很早就建立数据隔离和部署控制。
  • 统一多模态系统本身已经是足够大的战略类别,专注比无限横向扩张更重要。
  • 市场可能出现一批在单一重大领域做深的前沿公司,而不是所有公司都追求无限通用化。

印象深刻的片段

  • Amit 最早联系 Anjney 的话几乎就是:「听说你有很多 3D 数据,可以给我吗?」
  • 他用很直白的方式解释「可微」:如果不能用梯度下降优化,深度学习就无法工作。
  • 课堂先开玩笑说程序员可能成为「濒危物种」,随后把角色重新定义为 trainer、tutor 与 orchestrator。
  • 他对创作者的判断更乐观:艺术家终于可能获得软件式杠杆,把「什么叫好」教给系统并规模化复用。

代表性观点

必须围绕数据现实设计整个系统。

视频仍然不够。

下一步需要统一智能。

Transformer 并不在意输入究竟来自哪一种模态。

选择做什么,本身就是一种创造。


延伸阅读

  1. NeRF 与可微 3D:理解 Luma 最初世界模拟路线的基础。
  2. 生成视频与 Dream Machine:理解视频为什么成为可扩展世界表示。
  3. 统一多模态架构:本讲核心,即从模态专用塔转向共享推理主干。

关联