公众号文章系列 · 23

一通客服结束 72 小时后
AI 才决定这笔钱能不能收

评测系统,正在变成计费基础设施
Speaker姚光华 Colin
Role声网 ConvoAI 产品负责人
SourcesCheeky Pint #27 / #11 · Zendesk 官方文档与公告
Date2026.07
00
一通客服结束了。按过去的口径,这已经算一次自动解决
Agent 没有转人工,客户也没再追问。
Zendesk 现在还不认。
72 小时
它会再等 72 小时,然后让一个 LLM 读完整段对话,确认客户的问题是否被满意地解决。
通过,才进入 Verified Resolution;没有通过,只能算 Contained Resolution。两者看起来只差一个名字,账单上的待遇却完全不同 —— Zendesk 只对 Verified Resolution 收费。 (Zendesk 于 2026 年 5 月调整 Automated Resolution 口径。)
ACT I / IV
VERDICT
一个 AI 判另一个 AI
一个 AI 完成工作,另一个 AI 决定这份工作能不能收钱。
走到这一步,eval 已经不是发布前的一张质量报表了。
I 一次判定II 同一个单位III 什么叫解决IV 进入账单
ACT I · 一次判定05
Automated Resolution 的新口径

不再把「没有转人工」一概算作成功

01协助升级Assisted Escalation —— Agent 做了一部分工作,最终由人工解决。不收。
02仅是收敛Contained Resolution —— 客户没有继续追问,但评测没有确认问题已解决。不收。
03已验证Verified Resolution —— 72 小时内没有追问,且 LLM 确认问题得到满意解决。收。
这张表最重要的不是三档,而是中间那一档。过去很多客服机器人把 containment 当成绩:客户没有转人工、没有继续发消息,指标就算漂亮。
ACT I · 一次判定06
这条时序,决定账单上有没有这一笔

通话结束 → 等 72 小时 → 判定 → 计费

T0 通话结束 没转人工 等待 72 小时 客户有没有再追问 T+72H LLM 读完整段对话 另一个 AI 判断,不是执行的那个 Verified Resolution 收费 Contained Resolution 不收费 同一通电话,唯一的差别是那一次判定 —— 一个 AI 完成工作,另一个 AI 决定这份工作能不能收钱。
ACT I · 一次判定07
客户不再说话,有两种可能

沉默不是一种答案

可能一
问题解决了
这是所有 containment 指标默认的假设,也是过去客服行业常用的口径。
可能二
他放弃了
同样表现为不再追问、不再转人工。指标漂亮,问题还在。
Zendesk 没有假装自己能直接读懂客户的沉默。它只是增加了一道判断:等待 72 小时,再由评测模型检查对话内容。这不是第三方审计 —— 裁判仍由 Zendesk 提供。
MONEY QUOTE · 01
响应结束 不等于问题解决 自动化完成 也不等于可以收费
它至少把这件事,写进了产品机制。
ACT II / IV
CONVERGE
三家公司,同一个计价单位
它们原本可以继续卖席位、卖套餐、卖调用量,
却都把 resolution 推到了价格表的中心。
I 一次判定II 同一个单位III 什么叫解决IV 进入账单
ACT II · 同一个单位10
三段原话

办成了才收钱,说法几乎一样

Bret · Sierra “If the AI agent resolves the case, no human intervention, there’s a pre-negotiated rate for that. If we do have to escalate to a person, that’s free.” Cheeky Pint #27
Des · Intercom Every time we do work, we charge them. When we don’t, we don’t.” Cheeky Pint #11 · Fin 定价
Zendesk · 官方 每一笔收费的 resolution,都要由完成任务的 Agent 之外,一个专门的 AI evaluation model 再确认一次 Zendesk 官方公告 · 2026-05
Sierra:Agent 独立解决就按约定费率收费,一旦转人工这次免费。Intercom:每办成一件事收一次钱,没办成就不收。 三段均为公司方口径,不是独立审计结论。
ACT II · 同一个单位11
起点完全不同

三条路,收敛到同一个词

SIERRA 高价值大企业,带队进场交付 INTERCOM 标准化客服 SaaS ZENDESK 成熟的坐席与工单生意 RESOLUTION 被推到价格表中心的单位
这不是因为「按结果收费」听起来更先进。是因为 Agent 正在替代一部分劳动。
ACT II · 同一个单位12
它们原本可以卖别的

三种旧计价单位,都被绕开了

01席位按人头卖使用权 —— 卖的是「你有几个坐席」
02套餐按功能分层打包 —— 卖的是「你买了哪一档软件」
03调用量按 token 或消息条数 —— 卖的是「你消耗了多少」
04解决按 resolution —— 卖的是「这件事到底有没有办完」
Sierra 服务高价值的大企业客户,带着团队进场交付;Intercom 是标准化客服 SaaS;Zendesk 则背着一套成熟的坐席与工单生意。 三家并不相同,价格表的中心却相同。
MONEY QUOTE · 02
客户开始问的不再是 「我用了多少软件」 而是「这件事到底有没有办完」
计价单位跟着这个问题一起换了。
ACT II · 同一个单位14
Bret 在访谈里举的极端例子

Token 是成本,不是客户买到的东西

假设一个 AGENT 替 STRIPE 拉来新客户 方案 A 1% TOKEN 消耗 1/10 新增交易额 客户会因为它更省 token 而选 A 吗?不会。 两种账 Token 决定供应商的成本 结果决定客户得到的价值 按结果收费时,模型多绕的那几步由供应商承担;要多挣钱,只能提高解决率,或者把同一个结果做得更便宜。
ACT II · 同一个单位15
Bret Taylor 的原话

省 token 是你的问题,不是客户的

Bret · Sierra “Reducing your token utilization for the same outcomes is your problem, not your customer’s.” Cheeky Pint #27
按 token 收费
模型多绕几步,客户多付几分钱
供应商的成本波动,直接转嫁到客户账单上。
按结果收费
多绕的那几步由供应商承担
要多挣钱,只能提高解决率,或者把同一个结果做得更便宜。
$0.99
Fin 最早按每次解决 0.99 美元收费。有客户嫌贵。
Des 追问之后发现,很多人并不知道自己一次人工解决到底花多少钱。按结果收费也在逼客户补一门课 —— 先算清楚现在这件事值多少钱,再判断 AI 的报价贵不贵。
MONEY QUOTE · 03
先算清楚现在这件事值多少钱 再判断 AI 的报价贵不贵
按结果收费,也在逼客户补一门课。
ACT III / IV
DEFINE
什么才叫「解决了」
价格表可以一下午改完,
「什么叫解决」可能半年都定不下来。
I 一次判定II 同一个单位III 什么叫解决IV 进入账单
ACT III · 什么叫解决19
客服为什么最早采用这种模式

因为它有几个容易观察的信号

01转人工这通对话有没有被交给人
02工单工单有没有被重新打开
03追问客户有没有在短期内继续追问
但这些都只是代理指标。Zendesk 的 72 小时窗口和 LLM 评测,比「没有追问就算解决」多走了一步, 仍然不是事实本身 —— 它只是一个更审慎的判断器。
ACT III · 什么叫解决20
同一个信号,两种解释

每条代理指标都会分叉

没有转人工 Agent 解决了问题 转人工入口藏得太深 工单没重开 客户满意 他换了一家公司 72 小时没追问 问题解决了 他换渠道去投诉了 它们都只是代理指标 更审慎的判断器,仍然不是事实本身
ACT III · 什么叫解决21
Bret 自己也承认

按结果收费不可能覆盖所有场景

能结算的
客服问题还能问「解决了没有」
一次会话结束,就有可观察、可归因的落点。
结算不了的
浏览房产网站,最后没买房
他也许完成了研究、缩小了选择范围,甚至过几个月才成交。这样的价值很难在一次会话结束时结算。
缺一项,月底对账就会从商业合作变成辩论赛
MONEY QUOTE · 04
结果必须能被观察、被归因 并且被买卖双方 用同一套规则复核
这是 outcome-based pricing 一个很硬的前提。
ACT IV / IV
BILLING
当分数进入账单
研发团队做 eval,允许它暂时不完美。
计费系统没有这么宽松。
I 一次判定II 同一个单位III 什么叫解决IV 进入账单
ACT IV · 进入账单24
同一个 90%,两种命运

研发的 eval,和计费的 eval

在研发后台
90% 一致率,够用了
一个自动裁判和人工有 90% 的一致率,可以先用于版本对比;少量误判,后面再校准。
在计费系统
那 10% 会变成钱
以前只是看板上几个百分点的误差,现在会直接进入应收账款。
评测集定义产品质量,评测规则开始定义收入。
ACT IV · 进入账单25
两个方向都在流血

误判不再是看板上的百分点

FALSE POSITIVE · 假阳性 对一件没办成的事收了钱 客户会在对账时把它翻出来 FALSE NEGATIVE · 假阴性 明明办成了,却拿不到收入 供应商自己吃掉,还不容易被发现 同一条评测规则,同时决定质量、账单和责任。
一个 scorer 不能只返回 0 或 1。 它还要留下证据:依据了哪段对话、用了哪版规则、置信度是多少、发生争议时能不能回放。
ACT IV · 进入账单26
一条规则,三种责任

同时面对三拨完全不同的人

同一条评测规则 一个 scorer,三种责任 工程团队 判断版本有没有变好 客户 确认自己为什么被收费 财务与法务 对账、争议与审计
不是在发票旁边接一个模型,而是把一套原本服务研发的判断机制,升级到足以承受金钱和责任。
MONEY QUOTE · 05
评测集定义产品质量 评测规则 开始定义收入
这就是「评测系统是计费基础设施」的准确含义。
ACT IV · 进入账单28
绕不过去的那个问题

裁判和选手,属于同一家公司

同一家公司 · 收钱的那一方 执行 Agent 完成这通客服 评测模型 决定能不能收钱 官方说 independently confirmed 更准确的理解是:由区别于执行 Agent 的 专用评测模型复核 不是外部独立机构 也不是双方共同控制的审计系统
这并不说明它有意放宽标准。但只要一个指标开始决定收入,系统就会自然地向那个指标优化 —— 「没有转人工」可能被优化成让转人工更难;「评测模型判定满意」也可能把礼貌的错误答案判成成功。
ACT IV · 进入账单29
真正进入合同的 outcome metric

至少需要这五样配套

01双方确认规则由双方确认,不能由供应商单方面改
02持续校准自动裁判持续和人工样本校准
03假阳性单独监控「看似解决、实际失败」的那一类
04留痕保留原始对话、评分理由和版本记录
05申诉给争议结果留下复核与申诉入口
没有这些,按结果收费只是把过去的「账单争议」,换成了更难解释的「模型争议」
ACT IV · 进入账单30
不是所有公司都适合按结果收费

看得见结果,控制得了过程,扛得住失败

SIERRA · INTERCOM · ZENDESK 直接站在客服任务这一层 看得见完整对话 决定 Agent 怎么回答、什么时候转人工 能把一次失败的成本留在自己账上 INFRASTRUCTURE 基础设施公司离结果更远 没听清 / 推理错了 / 客户的 CRM 超时 也可能是业务流程本身设计得有问题 大部分不在你的控制范围内 定价边界应该和责任边界重合:你控制到哪一层,就为哪一层的结果负责
ACT IV · 进入账单31
更现实的做法往往是混合

哪一段按用量,哪一段按结果

按用量
连接、容量和基础推理
这些你控制得了,但离最终结果还隔着好几层。
按结果
真正由产品控制、也能可靠归因的增量价值
承诺你控制不到的结果并不勇敢,只是把无法定价的风险吞进自己肚子里。
这不是退而求其次。 再往外,是合作条款,不该靠一句「对齐客户价值」含混过去。
MONEY QUOTE · 06
你敢按什么收费 取决于你敢为 哪一个判断负责
一张按结果收费的账单,不是从财务系统开始的。它从一条 eval case 开始。
带走33
如果只带走三件事

回去可以立刻检查的三件事

01
给定价
先验三个前提
结果能不能被观察、被归因、被买卖双方用同一套规则复核。缺一项就别谈按结果收费。
02
给评测
让 scorer 留下证据
依据哪段对话、用了哪版规则、置信度多少、争议时能不能回放。0 或 1 已经不够用。
03
给合同
把两条边界对齐
定价边界和责任边界必须重合。控制不到的那一层,写成合作条款,不写成承诺。
按席位卖使用权,按 token 卖消耗量,按结果卖的是一个判断。
谢谢 · 来源与证据边界

一通客服结束 72 小时后
AI 才决定这笔钱能不能收

你敢按什么收费,取决于你敢为哪一个判断负责
Author姚光华 Colin · 2026.07
一手源Zendesk 官方文档与 Relate 2026 公告 · Cheeky Pint #27 / #11
已核验Automated Resolution 三档口径与 72 小时窗口来自 Zendesk 官方文档
立场提示Sierra / Intercom / Zendesk 三段表述均为公司方口径,非独立审计结论