公众号文章系列 · 13 · 读 ElevenLabs 的 Mati

胜负手不在模型
在架构

最懂端到端的 ElevenLabs,为什么押注「级联」?
Author姚光华 Colin
Role声网 ConvoAI 产品负责人
一手源Cheeky Pint #32 · Mati Staniszewski
Date2026.07.09
13
上一篇说「胜负手不在模型」。那在哪?这一篇给答案:在架构。
而最有资格做端到端的公司,给出了一个反方向的选择 —— 也正好和我押注了两年的判断,撞了个满怀。
他的答案是:在架构。而且是一个几乎所有人都以为会被淘汰的架构。
开场 · 先放几个数字垫底03
一家「最有资格做端到端语音」的公司

而它的选择,正好和主流叙事相反

01估值ElevenLabs 现在是 110 亿美金估值的 AI 音频领导者,最近融了约 5 亿美金。
02收入2025 年底 ARR 约 3.5 亿美金;刚有一个季度净新增 ARR 首次破 1 亿,推算量级已到 4.5 亿。
03客户Deutsche Telekom、Revolut、Klarna、Meta、IBM 这一批。
04团队470 人;STT 支持 100+ 种语言,benchmark 领先。
上一篇我拆了 6 件反共识;这一篇,我同样给你 6 件。像三角形先架起的两条边:能不能立得住,还得看第三块。
既然不在模型,那到底在哪?
ACT I / VI
CASCADE
最懂端到端的人押注级联
级联(cascaded):STT → LLM → TTS,一环扣一环地编排起来。
端到端 / 语音到语音(S2S):语音直接进、语音直接出,中间不落文字。
I 级联II 延迟III 鸿沟IV 图灵V 参数VI 数据
ACT I · 级联05
两条路线,一次摊开

级联 vs 端到端:差的是可见性

CASCADED · 级联 语音入 VAD 谁在说话 ASR 转写对不对 LLM 模型答了什么 TTS 动作执行没有 语音出 每一步都看得见、可插桩、可替换 —— 企业要的正是这个「可见性和可控性」。 END-TO-END S2S · 端到端 语音入 一个模型 · 中间不落文字 语音出 丢可靠性,丢对管线每一环的可见性 —— 中间那一段,你看不见也插不进去。
ACT I · 级联06
先插一段私货:这条路我已经公开鼓吹了两年

早在 2024 年,我就是个级联鼓吹者

012024不折不扣的「级联鼓吹者」—— 这条路不是今天读了 Mati 才信的。
022025 底「人人都是产品经理」大会,专门放了一页 slide:敢商用,才是架构的底线
03同场还有一页叫「生死线」—— 对话式智能体的生死线只有三条。
04AMA读者在社交媒体上直接问「到底选级联还是 S2S」,我的回答很干脆:级联
05摇摆后来在一次 RTE 社区圆桌上,我当场承认了那一丝摇摆。它很快被拽了回来。
那页 slide 的原话:可观测、可调优、可兜底;出问题时系统不会整体失控;ASR、LLM、TTS 可以独立替换、独立升级;每一段延迟、每一个失败点,都能被定位和优化。
MONEY QUOTE · 01
敢商用 才是架构的底线
这是我写在 2025 年底那场大会 slide 上的标题。为什么选级联,不选端到端 —— 可观测、可调优、可兜底;出问题时,系统不会整体失控。
ACT I · 级联08
同一场,还有一页叫「生死线」

对话式智能体的生死线,只有三条

别听错 Don't mishear. —— 转写、理解、grounding,错一个字就换一个答案 别失控 Don't break. —— 护栏、监督、回退,出问题时系统不能整体失控 别让人等 Don't make people wait. —— 延迟要压到对话节奏之内
三条都守住,才谈得上「敢商用」。
MONEY QUOTE · 02
在人机对话里 稳定性本身 就是一种用户体验
这句同样写在 2025 年底那页 slide 上。它不是一个技术偏好,是一个体验判断 —— 一通会突然失控的电话,再自然的语气也救不回来。
ACT I · 级联10
原句照抄 · Cheeky Pint #32

作为最有能力做 S2S 的人,他这么说

MATI Today, we are optimizing heavily on a cascaded approach. 我们今天在大力优化级联
理由 企业要的是可见性和可控性 —— 转写对不对、模型答了什么、动作执行没有 每一步可插桩、可替换
S2S 的位置 留给陪伴类、低复杂度场景 —— hallucinations are even a feature 在那里幻觉甚至是特性
理由和我那页 slide 几乎一字不差。所以我的感受不是「我被验证了」,而是一种英雄所见略同的踏实。
ACT I · 级联11
Mati 把终局划得很清楚

终局是混合架构,不是二选一

低复杂度 陪伴 · 娱乐 走 S2S:更快、更丝滑 「在那里幻觉甚至是一种特性」 高复杂度 客服 · 交易 走级联:可见、可控、可回退 一通不能出错的电话,只能这样 HYBRID · 混合架构 两者并存 级联不该再被叫「过渡方案」—— 它就是面向生产可靠性的主力架构,S2S 是陪伴娱乐的可选模式。
当最有资格做 S2S 的人也押注级联,这条线就清楚了。
ACT II / VI
LATENCY
S2S 确实更笨,走它只为延迟
主持人问得很直接:端到端听起来是不是「更笨」?
Mati 没绕。而这句话,正好是我那点「摇摆」的解药。
I 级联II 延迟III 鸿沟IV 图灵V 参数VI 数据
ACT II · 延迟13
原句照抄 · Cheeky Pint #32

"They are definitely dumber."

MATI They are definitely dumber. You need a smaller model. 确实更笨,且必须更小
代价 you lose reliability. You lose like all visibility into the parts of the pipeline. 丢可靠性,丢可见性
走 S2S 的唯一理由是延迟 —— 少了转写和生成两道工序,它更快。但代价写在上面那一行。
我当初会动摇,就是被那种「更快、更丝滑」的低延迟诱惑住了。 毕竟延迟是「活人感」里最要命的一环。
ACT II · 延迟14
但 Mati 把账算清楚了

你为几百毫秒,付了什么

你省下的 几百毫秒 少了转写和生成两道工序 它确实更快 你付出的 可靠性 + 可见性 丢掉对管线每一环的观察能力 出问题时,你不知道错在哪一段 对陪伴场景也许划算 对一通不能出错的客服电话,这笔账算不平 摇摆,就此结束。
MONEY QUOTE · 03
延迟从来不是 唯一的北极星指标
你为它省下的那几百毫秒,付出的是可靠性、是对每一环的可见性。对陪伴场景也许划算,对一通不能出错的客服电话,这笔账算不平。
ACT III / VI
GAP
不是落后十年,是部署鸿沟
John 抛了个暴论:为什么 LLM 已经这么好用,语音体验却像停在 10 年前 ——
Siri 还是听不懂、车机语音还是难用、想让手机念个 PDF 都费劲。Mati 不同意这个前提。
I 级联II 延迟III 鸿沟IV 图灵V 参数VI 数据
ACT III · 鸿沟17
好用的语音模型,是最近三年才有的事

不是模型不行,是落地没跟上

3 年前 能异步念文本 2 年前 有了实时版本 约 1 年前 真正能进生产 今天 大公司还没落进产品 瓶颈是集成还没做完 —— 真正卡住的地方,是把它跑进生产的那段工程,不是模型跑分。
Bret 说的和 Mati 说的,其实是同一件事。
ACT III · 鸿沟18
原句照抄 · Cheeky Pint #32

"there's a deployment gap"

MATI there's a deployment gap... The quality of voice models for them to actually sound good, this is only a last three years thing. 好用的语音模型,只有三年
他的判断 问题不是模型落后,是大公司还没把它落进产品、集成还没做完 不是模型不行,是落地没跟上
原文旁注:btw 今天 OpenAI 发了新模型 GPT-Live,瑟瑟发抖 ing,但是我们实际体验完再说。
真正卡住的,是集成、可观测、评测、护栏、交付那段工程。 不是模型跑分。
ACT III · 鸿沟19
放到中国,这道鸿沟只会更宽

胜负手有一大块压在集成与交付上

01部署私有化部署 —— 模型再好,进不了客户机房就等于没有。
02合规行业合规要求,比美国只高不低。
03存量要和存量的呼叫中心 / IVR / 工单系统对接,一个都不能少。
04语言方言、口音、中英混说 —— 真实通话里的常态,不是极端条件。
在中国,语音 Agent 的胜负手,有很大一块压在「集成与交付」上。这既是门槛,也是护城河。
别人翻不过去的那道墙,就是你的墙。
ACT IV / VI
TURING
图灵测试是按场景一个个过的
Mati 承认一个残酷现实:编排这一层,还没通过真正的「对话 Agent 图灵测试」。
但关键在后面 —— 它不是一个笼统的「过 / 没过」,而是按场景分层。
I 级联II 延迟III 鸿沟IV 图灵V 参数VI 数据
ACT IV · 图灵21
原句照抄 · Cheeky Pint #32

整体没过,但客服场景已经过了

整体 this orchestration side has not passed a true conversational agent Turing test. 编排层还没通过
客服场景 In customer support calls, passes the voice Turing test. It works well. 已经过了,跑得很好
开放场景 而开放式的交互游戏那种,「太难、太远,我们还没过」 同一套系统,两种结论
它不是一个笼统的「过 / 没过」。而是按场景分层:同一套系统,在客服里像人,在开放闲聊里立刻露馅。
ACT IV · 图灵22
这条我特别有底气接一句一手数据

客服场景通过率,已经做到 96.5%

客服电话 · PASSED 96.5% 我们最新产品的线上真实生产数据 不是实验室刷出来的分,是一通一通跑出来的 开放式交互游戏 · NOT YET 太难、太远,还没过 同一套系统,换个场景就露馅 所以笼统的「像不像人」分数没有意义 「活人感」必须分场景设计 正好落在 Mati 说的「客服已经能过」那一档里。
这也是我们做评测体系时的底层思路。
ACT IV · 图灵23
为什么不能憋一个笼统的分数

一个客服高分的 Agent,换场景就露馅

错误做法
憋一个笼统的「像不像人」
一个总分,覆盖所有场景。看起来很干净,但它测的东西在真实业务里不存在。
正确做法
按场景分层设计基准
客服、外呼、陪伴、开放闲聊,各有各的通过条件;一个场景一条线,分别定义什么叫好。
既然图灵测试是「按场景分层」过的,那体验基准也必须分场景设计。
在客服场景拿高分,不代表它在开放闲聊里还站得住。
ACT V / VI
SIZE
语音模型会一直小下去
问到参数量,Mati 给的数字很有意思:前沿语音模型大约数十亿到数百亿参数,
而前沿 LLM 已经是数千亿量级;训练成本明显更便宜、模型显著更小。
I 级联II 延迟III 鸿沟IV 图灵V 参数VI 数据
ACT V · 参数25
级联路线里,语音模型不会剧烈变大

纯语音这一侧,会一直小下去

PARAMETERS 前沿语音模型 · 数十亿到数百亿 前沿 LLM · 数千亿 融合 fused 架构 · 涨到几百亿 只有「融合」架构才会把 LLM 和语音揉在一起。你本来就想要语音那一环又快又可靠。
"in a cascaded approach, you probably will not see dramatic size changes... on the just voice, I think it will keep being small."
MONEY QUOTE · 04
语音侧的竞争 不是堆参数堆算力 的军备竞赛
而是架构、编排、数据、可靠性、延迟的比拼。对不做万亿大模型的玩家反而是结构性利好 —— 赢面在系统工程和产品化,不在算力军备。
ACT VI / VI
HOW
壁垒是「怎么说」的数据
那护城河到底在哪?Mati 指向一个很少被谈的地方:数据标注。
音频数据到处都是,但大多只标了「说了什么」,没标「怎么说的」。
I 级联II 延迟III 鸿沟IV 图灵V 参数VI 数据
ACT VI · 数据28
原句照抄 · Cheeky Pint #32

标了 what,没人标 how

MATI Some of the 'what' is annotated, but the 'how' isn't. What's the emotions... the accents... 情绪 · 口音 · 韵律
他们的做法 自建标注团队;因为市面上的转写模型不够好,自己做了一个 STT 壁垒是自己挖出来的
兑现成能力 撑起最新的 expressive mode:听出对方在紧张,然后用安抚的语气回应 不只答对内容,是用对情绪
这一条我读的时候,就像自己的心里话被念出来 —— 因为它正好是我们新产品在做的事。
ACT VI · 数据29
我们搭了一套 Loop Engineering 的迭代飞轮

每一通电话,都是下一通的燃料

LOOP 越转越快 真实通话 数据回流 复盘与重训 效果提升 「怎么说」的数据,就是这套飞轮的燃料 通过过往的数据回流,自我学习、自我迭代。 真实通话一通一通回流进来、被复盘、被重训, Agent 的效果是肉眼可见地往上走的。
ACT VI · 数据30
而中文世界的这块地,几乎还没被认真做过

中文的情绪、语气、方言标注体系

Mati 讲的
为什么这类数据是壁垒
音频到处都是,但「怎么说」没人标。ElevenLabs 为此自建标注团队,甚至自己做了一个 STT。
我们做的
把壁垒变成一条飞轮
让「怎么说」的数据持续回流、复盘、重训 —— 壁垒不是一次挖成的,是越转越深的。
当然,这一切的一切都建立于合规之上。
谁把「中文怎么说」这套数据资产建起来、再接上飞轮, 谁就握住了中文语音 Agent「活人感」的底座。
MONEY QUOTE · 05
音频数据到处都是 但大多只标了说了什么 没标怎么说的
什么情绪、什么口音、什么韵律 —— 这一层才是真正的壁垒。而中文世界的情绪、语气、方言标注体系,几乎还是一块没被认真做的地。
必须单独说的一条32
ElevenLabs 把官网的「填注册表单」换成「和 Agent 语音对话留资」

语音,是能拿到更多真话的入口

Willingness
更愿意留资
同一个位置,从表单换成语音对话,留资意愿直接上来了。
Open-ended
说得更开放
会主动透露更丰富的用例和复杂度 —— 表单永远问不出这些。
Bonus
跨语言且免费
天然跨语言,还顺带省了钱。现在全世界的 leads 都用说的留下线索。
还有那个很出圈的 Guinndex —— 一个开发者用 ElevenLabs 打电话给爱尔兰 3000 家酒吧,挨个问健力士啤酒的价格,自动汇总成一个「健力士指数」。
语音不是「表单的替代 UI」,是一个能拿到更真实信息的新入口。
MONEY QUOTE · 06
先进很性感 但可控才上牌桌
两个顶级创始人,站在产业链的两端,独立得出了同构的结论:Bret 站在应用层说胜负手不在模型,Mati 站在基础模型层说架构的胜负手不在「先进」,在「可控」。2026 年的赢家,是把可控性做到能上生产的人。
谢谢

先进很性感
但可控才上牌桌

最有资格做端到端的人,把宝押在了级联 —— 这种所见略同,比任何单方观点都踏实
Author姚光华 Colin · 2026.07
一手源Cheeky Pint #32 · Mati / ElevenLabs
已核验110 亿估值 · 3.5 亿 ARR · 100+ 语言 · 96.5%
立场提示讲者是 ElevenLabs 联合创始人;96.5% 为我方一手数据