公众号文章系列 · 12 · 读 Bret Taylor 与 Sierra

客服 Agent 的
胜负手不在模型

从 Bret Taylor 和 Sierra 身上,我验证与补全的 6 件事
Author姚光华 Colin
Role声网 ConvoAI 产品负责人
一手源Cheeky Pint #27 · Bret Taylor
Date2026.07.08
12
Sierra 两年做到 1.65 亿美金 ARR,靠的不是更强的模型。
Bret Taylor:Google Maps 共同创造者、Like 按钮发明者、Salesforce 前联席 CEO、OpenAI 董事长。
他现在的主业 Sierra,做的是一件离我最近的事 —— 给企业做客服 / 销售的 AI Agent。
开场 · 先把量级放这儿03
做这行的人,应该能直接感到量级

两年,1.65 亿美金 ARR

01规模Sierra 两年做到约 1.65 亿美金 ARR;7 个季度破 1 亿,8 个季度破 1.5 亿。
02客户1/3 的客户年收入超过 100 亿美金,过半超过 10 亿美金。
03定价按结果收费(outcome-based)—— 解决一个 case 收一次钱,转人工则免费。
04素材Cheeky Pint #27,101 分钟。而 Bret 反复戳中的,只有一条主线。
这不是一个「又快又猛的 SaaS」故事。让我反复回看这一期的,是那条主线。
客服 Agent 的胜负手,从来不在模型。
MONEY QUOTE · 01
客服 Agent 的胜负手 从来不在模型
这条主线上的每一个判断,几乎都踩在我每天在做的事情上。所以这篇不是「一个海外播客的读后感」,是把 Bret 说的每一条,和我在一线看到的对照一遍。
ACT I / VII
PSTN
自然语言就是协议
Sierra 服务很多医疗公司:保险付款方、医疗提供方、中间做账单结算的。
这些机构每天要互相打电话核对 —— 现在,是两个 Agent 在电话里用自然语言对话。
I 电话网II 可靠性III 防幻觉IV 按结果V 按流程VI 护城河VII 二阶
ACT I · 电话网06
最通用的 Agent 互操作层,长什么样

两个 Agent,直接在电话里说人话

语义层 · SEMANTICS 保险付款方 Payer · AI Agent 接电话 医疗提供方 Provider · AI Agent 打电话 自然语言 就是普通人打电话那种说话方式 传输层 · TRANSPORT PSTN 公共电话交换网 · 一张跑了 100 年的既有轨道 TCP/IP 之上 自然语言是所有大模型的母语,电话网是跑了 100 年的既有轨道,两者一叠加,last mile 就通了。
最好的协议,往往就是那个早就存在、且所有人都会的老东西。
ACT I · 电话网07
原句照抄 · Cheeky Pint #27

"English over PSTN"

BRET TAYLOR You have TCP/IP and English over PSTN... 自然语言 over 电话网
同一段 You have all these fancy MCP things, and we're doing English over PSTN. 花哨的新协议 vs 说人话
Bret 甚至直说他对 MCP 越来越怀疑 —— 不是说它不能用,而是「这些 Agent 需要的上下文,远比 MCP 能给的多」,他更看好像 OpenClaw 那样「一堆 markdown / harness」的方式喂上下文。
我们这行太容易陷进「协议崇拜」。 总觉得下一代 Agent 协作,得有一套全新的、结构化的、机器对机器的标准。
ACT I · 电话网08
那句轻描淡写的「over PSTN」背后

最难最脏的活,全在看不见的那一层

听上去只是接个 SIP 接个 SIP 端到端延迟 要压到对话节奏之内 慢一点,活人感就没了 自然打断 barge-in 要接得住 该停就停,该说就说 丢包与抖动 真实线路不是实验室 要在坏网络上保持稳 一条把「带语义的语音」稳稳送上电话网、再稳稳收回来的实时水管 恰好是我每天在打交道的东西。所以这一条我不是隔岸鼓掌,是在船上点头。
「让一个 Agent 真的能上电话、像人一样说话」,听上去只是接个 SIP。
ACT I · 电话网09
放到中国,这条只会更成立、也更复杂

让 Agent 上电话,是个三体问题

Technology
技术
延迟、打断、丢包抖动下的活人感 —— 这一层全世界都一样难。
Compliance
合规
号码标记与骚扰电话治理、隐私号(AXB)、外呼合规与频次管控。
Carrier
线路
运营商线路资质 —— 美国那条轨道上没有叠这一层。
Bret 顺口提了一句他们为一个香港客户做广东话语音支持「特别难」。这恰恰是中国团队的日常:方言、口音、中英混说,才是真实通话里的常态。
中国的电话客服体量巨大,但轨道上叠了一层美国没有的东西。
ACT II / VII
GUARDRAILS
胜负手在可靠性工程
主持人问了一个好问题:代码天然适合 AI —— 上下文都在 repo 里、是文本、有编译与测试反馈。
可客服对话根本不是这个性质,你怎么把它塞进一个 Agent 能处理的形态?
I 电话网II 可靠性III 防幻觉IV 按结果V 按流程VI 护城河VII 二阶
ACT II · 可靠性11
Constellation of models · 模型星座

两个 90%,叠出一个 99%

REASONING 90% 主推理系统,一步一步往下走 SUPERVISOR 90% 审查每一步,越界就打回重做 EFFECTIVENESS 99% 串起来,逼近 99% 的整体有效性 客户配置的是「目标与护栏」,不是步骤序列 "you want agency but you want guardrails around it" —— 而这套复杂度,对客户是抽象掉的。
不需要客户自己去 prompt engineering、去「把关键词写成全大写」求模型听话。
ACT II · 可靠性12
原句照抄 · Cheeky Pint #27

a reasoning system is right 90%...

BRET TAYLOR a reasoning system is right 90%... a supervisor that's right 90%... you get 99% effectiveness. 可靠性是架构出来的
同一段 you want agency but you want guardrails around it 目标与护栏,不是步骤
这套打法真正聪明的地方在于:把可靠性做上去,靠的不是换一个更聪明的模型,而是用两层各自只有 90% 的系统,叠出一个逼近 99% 的整体。
可靠性是「架构」出来的,不是「大模型」直接给的。
MONEY QUOTE · 02
可靠性是「架构」出来的 不是「大模型」直接给的
这几乎是对我们做引擎架构的一次背书。级联(VAD→ASR→LLM→TTS)常被质疑「不如端到端优雅」,但它最大的价值恰恰是每一环都可观测、可插桩、可回退 —— 这正是 supervisor / 护栏范式能落地的前提。
ACT II · 可靠性14
我越来越确信的一件事

活人感与可靠性,是两个正交的目标

活人感 · HUMANNESS 可靠性 · RELIABILITY 交互工程 延迟 · 韵律 · 打断 护栏工程 监督 · 取证 · 回退 不能指望同一个大模型 同时把两件事都给你 把它们拆开,分别用工程去解
这才是客服 Agent 真正能上生产的路。
ACT III / VII
GROUNDING
越是大品牌越要防幻觉
Bret 有两个特别精彩的观察。第一,真正的突破不是 ASI,是「基础的、人一样的推理」。
第二,LLM 自带的通用知识是个意外的壁垒 —— 但它反过来会咬人。
I 电话网II 可靠性III 防幻觉IV 按结果V 按流程VI 护城河VII 二阶
ACT III · 防幻觉16
一个客户并购了三家公司,三套身份系统、三套 CRM

你为什么不直接让 AI 像人一样想一想

原计划
砸一个大 IT 项目去统一
三套身份系统、三套 CRM,先合并、再迁移、再上线。经典的确定性工程解法。
BRET 的反问
让 Agent 进这三套系统
然后像人一样想一想 —— 人类客服本来就是这么干的,只是没人把它当成一个方案。
"The basic humane, basic reasoning, not superhuman ASI, turns out to be the huge breakthrough in customer experience."
真正的突破不是 ASI,是「基础的、人一样的推理」。
ACT III · 防幻觉17
最反直觉的一条:grounding 难度是反过来的

模型对大品牌「太自信」,于是张口就来

直觉:越冷门越难 GROUND 深海钻井的钻头 互联网上查无此名,模型没见过 → 老老实实照着你给的资料答,特别好 ground 现实:越知名越难 GROUND 一个非常知名的大品牌 模型觉得「这个我知道」 → 张口就来,最难 ground 难度反转 Sonos 音箱坏了「永远是 Wi-Fi 问题」—— 你不用把整部 Wi-Fi 历史喂给 Agent,因为大模型见过人类几乎所有的疑难杂症。 但真正要做的,是在 reasoning 之上加约束和取证,而不是去追一个更大的模型。
"Ironically, the harder challenge is when it's a very well-known brand..."
MONEY QUOTE · 03
越是知名的大品牌 越难 grounding
原句:"Ironically, the harder challenge is when it's a very well-known brand... 'No, you don't. You got to go look it up.'" —— 越是大 B 客户,越需要强 grounding 和防幻觉,而这恰恰是产品化能力,不是 prompt 技巧。
ACT III · 防幻觉19
放到中国,这条只会更硬

「自信地说错一句」可能就是合规事故

01大 B 场景银行、运营商、政务 —— 对话术合规、可追溯、零容错的要求,比美国只高不低。
02产品重点在 reasoning 之上加约束和取证,而不是去追一个更大的模型。
03能力归属这是产品化能力,不是 prompt 技巧 —— 不能寄希望于客户自己写好提示词。
一个金融外呼 Agent「自信地说错一句」,在中国可能直接是合规事故。
越是大 B 客户,越需要强 grounding 和防幻觉。
ACT IV / VII
OUTCOME
定价升维:从用量到结果
Bret 特意把两个经常被混为一谈的东西掰开:
outcome-based ≠ usage-based,而且前者对齐得多。
I 电话网II 可靠性III 防幻觉IV 按结果V 按流程VI 护城河VII 二阶
ACT IV · 按结果21
outcome-based ≠ usage-based

省 token 的压力,该落在谁身上

USAGE-BASED · 按用量 按分钟 · 按 token 计价对象 = 用量 用得越多,你付得越多 省 token 的压力,落在客户身上 升维 OUTCOME-BASED · 按结果 解决一个 case 收一次钱 计价对象 = 业务结果 转人工,则免费 省 token 的压力,留给自己 Bret 的类比:广告业从「按曝光 impression」到「按点击 CPC」的那次迁移 "success has a thousand fathers, failure is an orphan" —— 客户没拿到结果,你就收不到钱。
软件公司自然就有动力,陪客户走完最后一公里。
ACT IV · 按结果22
原句照抄 · Cheeky Pint #27

你的 token 用量,不是客户的问题

BRET TAYLOR reducing your token utilization for the same outcomes is your problem, not your customer's. 把压力留给自己
他举的例子 「我用你百分之一的 token 做到同样的结果,你根本不会在意 —— 你在意的是对你营收的价值。」 以 Stripe 拉新增 GMV 为例
这里的关键是:token 用量和客户价值之间,其实没有强相关。大部分人默认「用得多 = 值钱」,但真正该计价的,是「这个 Agent 被设计来产生什么业务结果、它到底产生了没有」。
把 token 优化的压力留给自己,是驱动效率的好激励。
ACT IV · 按结果23
对偏基础设施的人,最直接的一记提醒

评测会变成计费的基础设施

01底座基础设施天然是「按分钟、按 token」计费的 —— 这没问题,是底座该有的样子。
02加一层在结果可度量的场景上,理论上可以往上叠一层「按结果」:解决率、成单、约访成功。
03前置条件你得先有一套能把「结果」讲清楚、并且能归因的评测体系。这个条件很硬。
换句话说,评测不再只是一个技术资产,它会变成计费的基础设施。这件事怎么做、要不要做,是另一篇文章的话题 —— 这里先埋一个点。
谁来认定这个 case 算解决了?这个问题就是计价的地基。
ACT IV · 按结果24
我最近越想越清楚的一点

价值曲线和计价曲线之间,有一道缝

时间 · TIME 真实业务基本面 Agent 真的在解决问题,单位价值肉眼可见地涨 计价与定价惯性 市场、采购、甚至资本,还在用「按坐席、按分钟、按调用量」量它 这道缝 短期看是摩擦,长期看恰恰是机会:谁先把「按结果」这套计价基础设施搭起来,谁就先站到了缝的正确一侧。
这是一道很典型的「剪刀差」。
ACT IV · 按结果25
但要泼一盆冷静的水

outcome 定价在中国,难度比美国大

现实摩擦
计费习惯是成熟的旧尺子
中国的客服 / BPO 市场按坐席、按分钟、按线路计费;甲方采购流程、对「结果归因」的信任、谁来认定一个 case 算解决了,都是现实摩擦。
我的判断
方向对,但要渐进
分场景、分行业地推进,先在归因清晰的场景试水 —— 例如成功约访、成功回款提醒。
Bret 自己也承认:不是所有场景都能 outcome,你永远可以退回 usage-based。
先站到缝的正确一侧,不等于一步跨过去。
ACT V / VII
PROCESS
按流程重构,而不是按人
Bret 有一句我想裱起来的话,也甩了一个「咖啡测试」:
"No matter of AGI, short of robotics, will get you a cup of coffee."
I 电话网II 可靠性III 防幻觉IV 按结果V 按流程VI 护城河VII 二阶
MONEY QUOTE · 04
AI 生产力的原子单位 是「流程」,不是「人」
"the atomic unit of productivity in AI is a process, not a person." —— 他反对「AI 替代人」的框架。大多数公司之所以用不起来 AI,是因为 "we ship our org charts"。
ACT V · 按流程28
一个「新供应商 onboarding 要 17 天」的流程

没有一个人为这条端到端流程负责

WE SHIP OUR ORG CHARTS 法务 采购 IT 一条流程被切碎在各个部门,17 天,无人负责端到端 JOURNEY · 端到端旅程 一条端到端的客户旅程 Agent 需要什么工具、什么信息、什么能力 —— 都挂在这条线上 域切得越窄,越能用现有技术搭出一个 harness 把它整条自动化 —— 把科学问题变成工程问题。 对内也一样:按「流程负责人 + KPI」去组织,而不是按部门发一圈 Copilot 然后宣布「我们 AI 化了」。
Sierra 内部用 journeys(客户旅程)作为设计隐喻。
ACT V · 按流程29
Agent 即 UI,harness 取代 API

这条直接改我们写 PRD 的方式

过去
一张功能清单
鉴权、查单、改签、通知 —— 几个孤立的功能点,各自验收、各自上线。
现在
一条端到端的客户旅程
「用户来电改预约」从鉴权、查单、改签到通知闭环,是一条要打通的线。
未来 SaaS 除了给「极少数要登录的人」留个 web app,更重要的是给 Agent 提供一套 harness(技能、文档、规则)—— "something more than the APIs"
Agent 产品设计的单位,是旅程,不是功能清单。
ACT VI / VII
MOAT
技术会被商品化,所以要敢扔
Bret 讲了个很诚实的故事:他们为一个香港客户做了全市场最好的广东话语音支持,
是个巨大卖点。然后他话锋一转。
I 电话网II 可靠性III 防幻觉IV 按结果V 按流程VI 护城河VII 二阶
ACT VI · 护城河31
原句照抄 · Cheeky Pint #27

我们写的很多东西,本来就打算以后扔掉

BRET TAYLOR It's a technology that will certainly be commoditized in three years. 指广东话语音支持
同一段 so much of what we write, we plan to throw out later 押注动能与迭代速度
做 applied AI 公司,你没有「等模型追上我的愿景」的奢侈,但你知道它一定会追上。所以押注的是动能和迭代速度,而不是把某段代码当成珍贵 IP。
「如果我们现在暂停模型开发,都还有数万亿美元的经济价值没被释放。」 阻碍 AI 落地的瓶颈之一,不是模型不够强,是做这些无聊但重要的流程 Agent 的应用公司还不够多。
ACT VI · 护城河32
Bret 的一个更犀利的分层

越靠近交互层,越容易被掀桌

Engagement · 交互层 很有价值,但最容易被颠覆、被掀桌 最易被颠覆 Workflow · 流程层 谁把流程整条打通,谁就把交付关系握在手里 System of Record · 账本 ledger 数据库本身就是价值 —— 越接近这里越耐久 最耐久
护城河得往下扎到实时基础设施、交付和数据 / 评测上。
ACT VI · 护城河33
给护城河做一次校准

别把单点技术优势当城墙

01
速度
动能和迭代速度,比任何一段代码都耐久。
02
场景 know-how
客户买的不是模型、也不是软件,是对他们具体问题的解决方案。
03
交付关系
陪客户走完最后一公里,这件事本身沉淀关系。
04
数据飞轮
真实流量回流,越转越快,别人抄不走。
任何单点技术优势 —— 某个模型选型、某段自研能力 —— 都会被商品化。
你在做的 engagement 层很有价值,但也最容易被掀桌。
ACT VII / VII
SECOND
反直觉的二阶效应
Bret 全程最「爽」的部分,是那些反直觉的二阶效应。
它们合在一起,讲的是同一件事。
I 电话网II 可靠性III 防幻觉IV 按结果V 按流程VI 护城河VII 二阶
ACT VII · 二阶效应35
一通电话的成本,塌了两个数量级

量级不是省钱,是「终于负担得起」

COST PER CALL $10–20 · 一通人工电话 10–20 美分 · AI 做到 1–2 美分 · 乃至 你终于负担得起给每一个客户好的服务 —— 包括那些过去你根本不敢接电话的低价值客户。
成本坍缩改变的不是账单,是你敢服务谁。
ACT VII · 二阶效应36
四条最反直觉的二阶效应

简单的都被解决了,剩下的全是难 case

01AHT客服自动化后,平均处理时长(AHT)不降反升 —— 因为转到人工的全是难 case。
02坐席坐席满意度反而上升:解决一个真问题,比一天到晚说「您试试重启」有成就感得多。
03Jevons一个零售客户上了 Agent,总对话量涨了 2–3 倍,成本没怎么降,但 CEO 特别高兴。
04锚点SoFi 的 NPS 涨了 33 分;Ramp 自动化了 90% 的 case。
那位 CEO 高兴的理由不是省钱,是一句 ——「我们终于在倾听客户了。
谁只把它当成本中心去砍,谁就看漏了被释放出来的需求。
MONEY QUOTE · 05
客服 Agent 不是 一个「降本」故事 是重新定义关系的故事
成本坍缩、AHT 反升、Jevons 效应、NPS 与自动化率的锚点战绩 —— 这些数字合在一起,讲的是同一件事:它重新定义了你和客户的关系。
CODA · 我为什么想写这一篇38
当模型能力变成人人可得的基础设施

胜负手落在不性感、但决定生死的地方

Take 01
可靠性是架构出来的
两层 90% 叠出 99%,靠的不是换一个更聪明的模型。活人感与可靠性正交,要分开解。
Take 02
计价要跟上价值
从 token 到结果,缝里就是机会。而评测,会先变成这套计价的基础设施。
Take 03
护城河要往下扎
技术一定会被商品化。真正沉淀的是速度、场景 know-how、交付关系和数据飞轮。
立场提示:Bret Taylor 是 Sierra CEO 兼 OpenAI 董事长,所有判断均与其位置一致;数字为公司自报,未经第三方审计。
说明书的前半本已经摊开,剩下半本得在自己的电话网上打出来。
谢谢

胜负手落在
那些不性感的地方

2026 是 Agent 被规模采用的一年,客服和外呼会最先被重写
Author姚光华 Colin · 2026.07
一手源Cheeky Pint #27 · Bret Taylor / Sierra
已核验1.65 亿 ARR · 90%×90%→99% · 33 分 · 90%
立场提示讲者是 Sierra CEO 兼 OpenAI 董事长