Stanford CS153: Frontier Systems · 课程录像
从 AI 配音到实时语音 Agent
讲者:Mati Staniszewski — ElevenLabs CEO
时间:2026 年春季 · 时长:约 66 分钟
TL;DR
Mati Staniszewski 讲述了 ElevenLabs 如何从一个很窄的文本转语音切口,发展成覆盖配音、语音识别、本地化与实时语音 Agent 的音频平台。核心经验是:前沿语音系统的胜负不取决于单一模型,而取决于是否选对系统边界、是否足够贴近用户,以及能否在情感表达、延迟和可靠性之间取得平衡。
核心概念
从糟糕配音中发现系统机会
ElevenLabs 的起点非常具体:波兰引进的外国电影经常由一个语调平淡的旁白读完所有角色。创始团队想解决的不是抽象的「更好 AI 声音」,而是让任何内容都能以任何语言呈现,同时保留人物的声线、表演和情绪。
这个起点让公司从第一天起就同时是一家研究实验室和产品公司。他们需要回答两个问题:语音研究是否还有足够大的突破空间?用户的痛点是否强到愿意立即采用产品?
音频配音是一套系统,不是一个模型
完整的语音本地化至少包含三层:
- 语音转文本 / 转录
- 翻译 / 语言转换
- 文本转语音 / 声音生成
理论上三层缺一不可,但 2022 年的模型还不足以支撑稳定的端到端产品。ElevenLabs 因此没有一开始就解决整个栈,而是先找到价值最高、系统复杂度最低的切口:把英文文本转语音做得显著自然、富有情感。
这个选择很快覆盖了更多场景:修复录错的台词、脚本旁白、有声书、文章朗读和创作者工具。
为什么首先选择文本转语音
早期语音系统有两个明显缺陷:
- 无法稳定保留说话人的声线特征
- 无法根据长文本的上下文控制语气、节奏与情绪
自然朗读不只是局部 token 预测。模型需要理解整段内容:开心的句子应该听起来开心,对话要有对话感,停顿和速度也应反映文本结构。
ElevenLabs 的方法,是结合更强的序列建模与更抽象的声音表示。与其手工编码年龄、口音、性别等属性,不如让模型直接学习更高层的潜在特征,从而获得更自然、更灵活的声音。
产品增长也是上下文反馈回路
Lecture 1 的「上下文反馈回路」在这里有一个具体版本。Discord 社区、创作者和开发者不仅是分发渠道,也是早期需求的传感器。
用户最初认可 AI 配音的愿景,但真实使用很快暴露了更近的需求:
- 修补录制错误
- 从脚本生成旁白
- 朗读文章和书籍
- 保留创作者自己的声音
因此研究目标保持长期野心,产品路线却始终与真实工作流紧密连接。公司缩短了用户行为与模型迭代之间的距离。
从 TTS 走向语音 Agent
- 2022:更懂上下文的文本转语音
- 2023:长篇朗读、多语言声音、用户自建声音与声音市场
- 2024:语音识别、翻译和生成共同成熟,AI 配音与本地化开始可用
- 2025:实时语音 Agent 进入可用阶段
- 2026:级联系统与融合架构进一步结合
Javier Milei 的演讲、Lex Fridman 的多语言访谈等案例展示了一个规律:只有每个系统层都逐步成熟后,完整产品才真正具有说服力。
级联架构与融合架构
实时语音 Agent 有两种主要路线。
级联式(cascaded):
- 语音转文本
- 语言模型推理
- 文本转语音
融合式(fused):
- 由更统一的模型直接理解语音并生成回应
Mati 并不把它看成路线之争,而是不同优化目标之间的选择:
- 融合模型在延迟上更有潜力
- 级联系统目前更适合企业所需的可靠性、工具调用、可观测性和防护机制
客服、预约、支付和身份验证等业务中,可靠完成流程往往比再减少几十毫秒更重要。因此 ElevenLabs 继续在生产环境中使用大量级联系统,同时探索统一模型。
情绪理解是数据与控制问题
今天的语音 Agent 往往只听见文字,却没有真正利用愤怒、紧张、兴奋或犹豫等情绪信号。Mati 认为,这个差距很大程度上来自数据标注和控制接口,而不只是模型规模。
系统需要在转录阶段推断情绪元数据,把它交给推理层,再生成匹配的回应。困难包括:
- 为足够多的语音标注情绪与表达方式
- 让模型能够富有表现力地回应
- 让表现力可以被产品控制,而不是随机发生
这说明前沿能力不仅来自更大的模型,也来自标注系统、偏好收集和可控的产品界面。
企业部署的真正标准
对企业来说,「听起来像人」不是最终基准。系统能否安全完成多步任务才是:
- 验证用户身份
- 获取账户信息
- 正确执行工具调用
- 为整个过程保留可追踪记录
客服 Agent 不能幻觉出一个不存在的预订修改,也不能在支付失败时悄悄继续。这也是模块化、可观测系统仍会长期存在的原因。
安全、授权与声音认证
音频系统还需要处理:
- 追踪生成内容的来源
- 在生成前拦截诈骗用途
- 水印与 AI 内容检测
- 合法的声音授权和收益分配
最明确的安全结论是:声音不应继续被当成可靠的身份认证因素。当高质量声音克隆足够便宜时,声纹认证在结构上就会失效。
相同技术也能用于防御。例如,有公益组织部署语音 Agent 与疑似诈骗者长时间通话,消耗对方的时间。
行业观察
- ElevenLabs 最初依靠创始人的积蓄,并在大规模融资前持续贴近用户迭代。
- Tortoise TTS 等开源项目证明,前沿音频能力并不只会来自超大云厂商。
- Discord 和创作者生态不仅负责传播,也直接参与研究反馈。
- 实时语音 Agent 同时受情感能力、可靠性和延迟三个移动目标约束。
- Mati 的定价原则很清楚:从用户获得的价值倒推价格,而不是从模型成本加价。
- 他预计五年后会出现少数占主导地位的「对话平台」,类似今天的云计算平台。
印象深刻的片段
- 创始团队曾尝试完全在 Discord 上经营公司,因为他们讨厌会议,也想从头设计协作方式。
- 创业想法来自波兰电影由一个单调旁白读完所有角色的荒谬体验。
- Mati 设想,企业未来会像使用网站和 App 一样,通过语音 Agent 与客户交互。
- 有组织用语音 Agent 拖住诈骗者,把系统变成反诈骗的「时间黑洞」。
代表性观点
必须极度专注于问题本身。
先做潜力最大的基础版本,而不是一开始解决整个栈。
不要从成本定价,要从价值出发再倒推。
未来几年,级联架构仍然是大量生产系统的正确选择。
用声音做身份认证,已经不是一个可靠方向。
延伸阅读
- Tortoise TTS(James Betker):高质量开源文本转语音的重要早期项目。
- AI 配音与本地化案例:理解完整语音栈何时跨过可用门槛。
- 级联与融合语音架构:这场访谈中最值得继续追踪的工程权衡。
关联
- 本文属于 CS153: Frontier Systems 课程笔记。
- 上一讲:CS153 第 1 讲:前沿系统导论
- 下一讲:CS153 第 3 讲:前沿视觉智能系统