公众号文章系列 · 18 · 评测三部曲 · 第二篇

每一轮都对
整段却错了

单轮 100%,整段 0%:客服 Agent 的四种死法
Author姚光华 Colin
Role声网 ConvoAI 产品负责人
一手源Braintrust · 2026-05-14 / 06-26
Date2026.07
18
上一篇结尾我留了个数字,说这篇讲它 ——每一句都对,合起来全错。
第一篇讲单句:听没听对、错了有没有改变答案。这一篇讲对话 ——
一个 Agent,每一轮单独打分轮轮满分;整段拉出来看,任务完成率为零。
开场 · 那个数字03
一个客服 Agent 的两张成绩单

每一轮满分,整段却是零分

TURN-LEVEL 100% 100% 100% 100% 100% 100% 切题、礼貌、专业、符合公司策略要求 —— 每一轮都是满分 CONVERSATION-LEVEL 只问质检一个问题:客户的问题解决了吗? 整段拉出来看 0% 任务完成率为零 没有。零分。
每一句单看都无可挑剔,连起来什么也没发生。
0%
每一轮单独打分,切题、礼貌、专业、符合公司策略 —— 轮轮 100%
整段对话拉出来,只问一个问题:客户的问题解决了吗?没有。零分。
这是 Braintrust(上一篇那家评测公司)在讲多轮评测时,白纸黑字描述的一种真实状态:它把客户困在一个礼貌、专业的循环里,整整十分钟,什么也没解决。
开场 · 一手引语05
原文怎么写这件事

礼貌地兜圈子,整整十分钟

MULTI-TURN if it kept the customer in a polite, professional loop for ten minutes without ever solving anything Jess Wang · 2026-05-14
CORE CLAIM An app can nail every individual reply on benchmarks like tone and politeness while still failing to resolve a customer's problem 同一篇 · 核心论点
DES TRAYNOR 上个系列的读者应该觉得耳熟 —— 客服可以很礼貌,却什么都没解决 上个系列终章 · 一个观察
区别在于,Des 说的是一个观察;这一篇要讲的,是怎么把这个观察变成一个可以量、可以盯、可以修的标准。
礼貌地兜圈子。 每一句单看都无可挑剔,连起来什么也没发生。
MONEY QUOTE · 01
每一句单看都无可挑剔 连起来什么也没发生
它把客户困在一个礼貌、专业的循环里,整整十分钟,什么也没解决。
这也是最难被发现的一种行为 —— 因为你的单轮质检报表上,它全是绿的。
ACT I / V
FRAME
拆成单帧就看不见剧情
为什么「每轮满分、整段零分」这种事能发生?
因为有一整类失败,根本不发生在「某一句话」里 —— 它发生在句与句之间。
I 粒度不在一层II 双层对抗III 有状态IV 四种死法V 路径审计
ACT I · 粒度不在一层08
你打分的粒度,和失败发生的粒度

把电影拆成单帧去审

FRAME BY FRAME 构图漂亮 构图漂亮 构图漂亮 构图漂亮 构图漂亮 构图漂亮 每一帧的构图都非常漂亮 你却看不出电影剧情根本没按剧本往下推进 你把对话拆成一句一句(一个 Turn)去打分,等于把一部电影拆成单帧去审
单轮评测对这些看起来非常正确的单轮对话,天生失明。
ACT I · 粒度不在一层09
有一整类失败,不在「某一句话」里

三类失败,都在句与句之间

01问三遍Agent 把同一个信息问了三遍 —— 每一遍单看,问得都很礼貌。
02自相矛盾Agent 第五轮说的话,和第二轮自相矛盾 —— 两句单看,各自都对。
03原地踏步Agent 绕着问题打转,始终不推进 —— 每一步都「切题」,整体在原地踏步。
你把对话拆成一句一句去打分,等于把一部电影拆成单帧去审 —— 每一帧的构图都非常漂亮。
这些失败,根本不发生在「某一句话」里。
ACT I · 粒度不在一层10
Braintrust 那篇的判断

唯一的办法:整段一起打分

只给单轮打分
对句与句之间的失败失明
礼貌的兜圈子,在你的单轮报表上永远是绿的。
在单轮之外加一层
把整段对话当成一个整体打分
原文的说法是:这是唯一的办法 —— 在给单轮打分之外,再给整段打一次。
原文:"The only way to know if a multi-turn AI product is working as intended is to score conversations as a whole, in addition to scoring individual turns."
想知道一个多轮 AI 产品到底行不行,唯一的办法是整段一起打分。
MONEY QUOTE · 02
单轮评测对这类失败 天生失明
因为有一整类失败,根本不发生在「某一句话」里 —— 它发生在句与句之间。
你把一部电影拆成单帧去审,每一帧都漂亮,剧情却根本没往下推。
ACT II / V
LAYERS
双层打分,两层对抗
它给的方案结构非常简单:单轮层每条回复打一次,多轮层整段只打一次。
关键在于 —— 两层分数会对抗,而这种对抗恰恰是信息量最大的地方。
I 粒度不在一层II 双层对抗III 有状态IV 四种死法V 路径审计
ACT II · 双层对抗13
一层评句,一层评局

双层打分的结构

LAYER 1 · 单轮层 单轮层 · Brand Alignment 每条回复打一次,只看三条:可执行的下一步 / 语气共情专业 / 符合公司政策 整段取平均 A=100% B=50% C=0% 整段取平均 LAYER 2 · 多轮层 多轮层 · Conversation Quality 整段对话只打一次,而且是道是非题:这次交互,解决客户的问题了吗? 只要问题最后解决了,中间某几句生硬一点、笨拙一点,多轮层不扣分 Yes = 100% No = 0%
没有中间过渡的分数 —— 只要问题最后解决了,多轮层就不扣分。
ACT II · 双层对抗14
Brand Alignment · 每条回复打一次

单轮层:只看三条

01下一步有没有给出可执行的下一步
02语气语气是否共情、专业
03公司政策是否符合公司政策
打分标准:A = 100%、B = 50%、C = 0%,整段取平均。这一层,原文叫 Brand Alignment。
这一层测的是「每一句像不像话」,不是「这件事办没办成」。
ACT II · 双层对抗15
对抗,才是信息量最大的地方

两层分数,会对抗

单轮低 · 多轮高
糙但能干的 Agent
每轮只有 50 分,磕磕绊绊,但问题解决了 —— 先得能用,再变优雅。
单轮高 · 多轮低
礼貌的兜圈子小能手
每轮 100 分,整段 0 分 —— 也是最难被发现的一种,因为单轮质检报表上它全是绿的。
原文:"every turn can score 100% on brand alignment while conversation quality lands at 0% because the bot was polite and professional but never actually fixed the problem."
真正该盯的,不是两层分数本身,是两层的差异或者相悖程度。
ACT II · 双层对抗16
剪刀差一拉开,就是告警

该盯的是剪刀差,不是分数

TWO LAYERS · SCISSORS GAP 多轮高 多轮低 单轮低 单轮高 糙但能干 50 分 / 100 分 先能用,再优雅 理想状态 100 分 / 100 分 两头都差 至少一眼看得出 礼貌的兜圈子 100 分 / 0 分 报表上全是绿的 剪刀差 单轮平均分很高 多轮解决率上不去 一拉开,就是告警
这个剪刀差,比客诉来得早得多。
MONEY QUOTE · 03
只看单轮平均分的报表 是在自欺欺人
真正该盯的指标,不是两层分数本身,是两层的差异或者相悖程度。
单轮平均分很高、多轮解决率上不去 —— 这个剪刀差一拉开,就是告警。
ACT III / V
STATEFUL
它不只是聊天,它有状态
到这儿,讲的还只是「聊天」。但一个真正的客服 Agent 比聊天复杂得多。
Braintrust 另一篇(作者 Izzy Hurley)把「有状态」拆成三个特征。
I 粒度不在一层II 双层对抗III 有状态IV 四种死法V 路径审计
ACT III · 有状态19
逐条对一下自己的系统

有状态:三个特征,一条不落

MEMORY 跨轮累积记忆 记得你三轮前说过什么 它自己试过什么、得出过 什么中间结论 上下文是一张活的工作台 SIDE EFFECTS 真实的副作用 不是记录一下触发了任务 是真的新建一个任务 并且执行出来 不是建议退款,是真退了 INTEGRATION 依赖动态外部系统 CRM、工单库、支付系统 它们有自己的状态 两次运行之间还会变 周一和周四,结果可能不同 对号入座:一个接电话的客服 Agent,三条全占 —— 一条不落
跨轮记忆、真实的执行动作、依赖外部系统的集成 —— 一条不落。
ACT III · 有状态20
The agent changes the world

坏答案,和坏后果

无状态系统
坏决策产生的是坏答案
只是影响客户听到的当下的体验,让人不舒服。
有状态系统
坏决策产生的是坏后果
基于一个错误的判断,执行了一个撤不回来的动作。
原文:"The agent changes the world. It creates tickets, runs database migrations, and sends emails. It doesn't just draft an email, it sends it."
它不只是起草一封邮件 —— 它把邮件发出去。
MONEY QUOTE · 04
无状态的坏决策产生坏答案 有状态的坏决策产生坏后果
"A stateful agent that gives a bad answer might also have already executed an irreversible action based on that bad answer."
它可能已经基于那个坏答案,执行了一个不可逆的动作。
ACT IV / V
DEATHS
有状态的四种死法
有状态带来四种独特的失败模式。我把它们叫四种死法 ——
因为每一种,我都在真实通话里见过对应的影子。而每一种,单轮评测都抓不到。
I 粒度不在一层II 双层对抗III 有状态IV 四种死法V 路径审计
ACT IV · 四种死法23
每一种,都要在多步之后才暴露

四种死法,一种一种看

FOUR WAYS A STATEFUL AGENT DIES 死法一 自洽却错误的叙事 Wrong but consistent 早期某一步总结错了 之后每一步都建在 这个错误的总结上 逐句审,每句都有道理 死法二 中途失忆 Mid-context amnesia 长程任务里,早期的 一个关键事实悄悄丢了 完成了略微不同的目标 没有报错,没有失败信号 死法三 过时假设 Stale assumptions 它记住了一条旧策略 策略变了它还在遵守 行为和记忆完全一致 只是和当前环境不符 死法四 状态污染 State corruption 并发任务或有 bug 的工具 悄悄污染了它的记忆 很多轮之后才给结论 甚至查不到是什么失效 共同点:都不在「某一句话」里,都要在多步之后才暴露
四种死法的共同点:都要在多步之后才暴露。
ACT IV · 四种死法24
四种死法,写成四行

每一种,单轮评测都抓不到

01叙事错了Wrong but consistent narrative —— 早期某一步总结错了,之后一路自洽并且闭环地错下去,看起来逻辑严密、深思熟虑。
02中途失忆Mid-context amnesia —— 早期一个关键事实悄悄丢了,最后完成的是一个略微不同的目标,没有报错、没有失败信号。
03过时假设Stale assumptions —— 它记住了一条旧策略,策略变了它还在遵守;行为和记忆一致,和当前环境不符。
04状态污染State corruption —— 并发任务或一个有 bug 的工具污染了记忆,矛盾结论很多轮之后才出现。
这四种死法的共同点:都不在「某一句话」里,都要在多步之后才暴露。
你用单轮评测去抓它们,就像医生用一个体温计去给病人量身高。
MONEY QUOTE · 05
用单轮评测抓它们 就像用体温计量身高
四种死法的共同点:都不在「某一句话」里,都要在多步之后才暴露。
无状态的 Agent 给个坏答案只是让人不舒服;有状态的,可能已经执行了不可逆的动作。
ACT V / V
PATH
路径和答案一样重要
那有状态 Agent 的评测,到底该测什么?
原文举了个内部 IT 的例子,我把它换成客服的语境:客户来电要求改配送地址。
I 粒度不在一层II 双层对抗III 有状态IV 四种死法V 路径审计
ACT V · 路径审计27
客户来电要求改配送地址

有状态的评测,要验整条链

无状态的评测:只看 Agent 的回复听起来对不对 STATEFUL EVAL · 验整条链 01 查的是不是 这个客户 02 调的是不是 改地址的接口 03 参数填的是不是 新地址 04 改的是不是 这一张订单 05 最后的确认 有没有说准 以及:它有没有在走向正确答案的路上,顺手干了一件有害的事
在有状态系统里,答案对了,事故照样可以成立。
ACT V · 路径审计28
原文放在「怎么给工具调用打分」里说

用错的路径,到达对的答案

TOOL CALLS This is how you catch the case where an agent arrives at the right answer through the wrong path Izzy Hurley · 2026-06-26
WHY IT MATTERS for a stateful agent with potential side effects, matters as much as the answer itself 同一篇 · 工具调用打分
在无状态系统里无所谓,反正答案对了;在有状态系统里,那条错的路径上每一步都可能留下真实的错误执行动作 —— 多查了一个不该查的账户,多发了一条不该发的短信。
答案对了,事故照样成立。 对一个有副作用的有状态 Agent 来说,路径和答案本身一样重要。
MONEY QUOTE · 06
答案对了 事故照样成立
「用错的路径到达对的答案」,在无状态系统里无所谓;
在有状态系统里,那条错的路径上每一步,都可能留下真实的错误执行动作。
ACT V · 路径审计30
给真要动手搭这套评测的人

工程上,还有三条提醒

THE CHALLENGE IS STATE 难的是状态,不是打分 团队卡住时总想找更花哨的 打分器,通常诊断错了 真正难的是把测试环境 的状态搞对 MAKE IT RESETTABLE 环境要可重置 两次运行之间不重置 上一次的残留会很快 让结果不可信 DO NOT CHASE REPLAY 别想着一步不差复现 工具调用一多,路径的 组合就爆开了 盯结果和关键决策点 别去还原每一步顺序 要测「查订单、发退款」,你就得有一个真的订单库和一个能重置的退款系统
难的是状态,不是打分。
96.5%
我们线上真实生产数据里的图灵测试通过率
放到这一篇的框架里,它的位置就清楚了:这是一个多轮层的数字。
判的不是「某一句像不像人」,而是一整通电话下来,对面有没有察觉这是个机器 —— 一道整段级的是非题,和「解决了没有」在同一层。为什么坚持在这一层给?因为单轮层太容易好看。
MONEY QUOTE · 07
穿帮从来不发生在单句里 发生在轮与轮之间
音色可以调到很像人、每句话都可以很得体 ——
然后在第六轮,把客户三轮前说过的车牌号再问一遍,一切穿帮。
收尾 · 三个问题33
拿去问你自己的质检报表

三个问题,问你自己的报表

01整段分数你有整段级的分数吗?还是只有单轮平均分?如果只有后者,「礼貌的兜圈子」在你的报表上永远是绿的。
02剪刀差你盯两层分数的关键差异吗?单轮分和解决率的剪刀差,是最早的告警信号 —— 比客诉来得早得多。
03路径审计你会关注对话过程中执行路径的 audit 吗?还是只测最终答案?
下一篇 · 评测三部曲收官(#19):单句会测了,整段会测了。但还剩一个更根本的问题 —— 这些「什么叫好」的标准,是谁定的?该由谁定?AI 时代,PM 的核心交付物正在从一份文档变成 EVALs。
对一个能下工单、能退款、能发短信的 Agent, 「答案对了」和「没闯祸」,是两件事。
谢谢

每一轮都对
整段却错了

穿帮从来不发生在单句里,发生在轮与轮之间
Author姚光华 Colin
一手源Braintrust · 2026-05-14 / 2026-06-26
已核验双层设计 100%/0% · 四种死法英文原名
立场提示Braintrust 是一家做 AI 评测的公司