公众号文章系列 · 04 · 评测这条线的起点
VoiceAgentEval
重做 AI 外呼的 Benchmark
把评测从理想化的能力展示,拉回真实业务的约束里
Author
姚光华 Colin
Role
声网 ConvoAI 产品负责人
一手源
arXiv:2510.21244 · xbench 报告
Date
2026.07
04
在真正参与这个项目之前,
我自己并不完全确定:
AI 外呼的
「智能」
,到底该如何被定义和评估。
作为 VoiceAgentEval 项目的参与者之一,我想借这篇文章系统讲清一件事 ——
为什么我们认为,AI 外呼的 Benchmark,必须重做。
一 · 通用 Benchmark 评不出什么
03
一道长期被忽视的错位
评估停在能力层,业务在约束里
ACADEMIC BENCHMARK
MMLU / C-Eval 这类榜单
衡量基础语言能力非常有效
但本质仍是单轮问答
或弱目标导向的评测体系
默认一个理想且配合的用户
鸿沟
长期被忽视的错位
REAL OUTBOUND CALL
真实外呼场景
高度流程化、目标导向
且充满不确定性
强流程 · 强约束 · 强结果
对话开始承担业务结果
行业内对「智能」的评估,仍高度停留在通用模型能力层面。这两者之间,存在着一道长期被忽视的
鸿沟
。
一 · 通用 Benchmark 评不出什么
04
强流程 · 强约束 · 强结果导向
外呼里,三种当场失败
01
少走一步
哪一步没走,
业务直接失败。
02
漏个信息
哪个关键信息漏掉,
整通电话失效。
03
说错一句
哪句话说错,
用户可能当场挂断。
这类问题,并不能通过「回答是否聪明」「表达是否自然」来判断。
AI 外呼恰恰不是一个「自由生成」的问题。
在真实外呼中,对话是一种强流程、强约束、强结果导向的系统。
现有的 MMLU、C-Eval 在衡量基础语言能力上非常有效,但它们本质上仍是「单轮问答」或弱目标导向的评测体系。
MONEY QUOTE · 01
一个「聊得很像人」的 Agent
如果无法稳定完成关键节点
在业务上反而是
危险的
正是这种评测与真实应用之间的脱节,促使我们开始思考:
是否需要一套真正为 AI 外呼而设计的评测体系。
01
目标只有一个 ——
尽可能把模型,放进
真实业务的约束条件
里测试。
VoiceAgentEval 从三个维度搭建评测框架:基准测试构建、用户模拟器、交互质量评估方法。
二 · 三大核心支柱
07
构建真实世界的试炼场
三根支柱,一座试炼场
真实世界的「试炼场」
BENCHMARK
基准测试构建
源于真实外呼业务数据
6 领域 · 30 子场景 · 5 画像
USER SIMULATOR
用户模拟器
规模化、可复现的数字人类
五种人格原型,覆盖不同策略
EVALUATION
交互质量评估
文本 + 语音 双维度体系
TFC · GIC · 15 项语音指标
三根支柱指向同一件事:把模型放进真实业务的约束条件里去测。
二 · 基准测试构建
08
源于真实业务数据的场景定义
六大领域,六种交互范式
业务领域
核心交互范式
关键能力要求
客服服务
情绪修复导向
将对抗情绪转化为合作关系
市场销售
防御突破表达
应对拒绝、质疑,传递价值
人力资源
双向评估动态
专业、平等、信息对称
金融风控
合规约束导向
高精度、
零容错
调研与数据收集
敏感性维护导向
中立、克制、避免诱导
主动关怀与通知
温暖传递导向
传递关怀而非机械通知
它们并非简单分类,而是代表了外呼中
不同的交互范式与能力边界
。在此基础上,我们进一步细分出 30 个子场景,并为每个子场景构建 5 种用户画像。
150
6 大业务领域 → 30 个子场景 → 每个子场景 5 种用户画像,
最终形成 150 组测试数据,兼顾广度与深度。
评测语料库基于真实外呼业务数据构建。目标只有一个:尽可能把模型,放进真实业务的约束条件里测试。
二 · 用户模拟器
10
外呼系统最大的不确定性,来自真实用户
从理想用户,到五种人格
ASSUMED USER
一个理想且配合的用户
真实用户会插话、怀疑、
犹豫、突然改变态度
许多评测体系默认的,
却是一个配合的对手
抽象为系统工程
FIVE PERSONAS
高度合作型
强抗拒型
覆盖不同沟通策略与行为模式
这不是简单的角色扮演,而是
从真实交互数据中抽象出的系统工程
—— 用 AI 在受控环境中模拟真实用户行为。
二 · 用户模拟器
11
三种评估方式,验证「数字人类」的真实性
数字人类,像不像真的?
01
拟人度
AI 生成对话在 0–9 分制中获得
8.27 分
,接近真实对话的 8.50 分。
02
AI 检测
150 条对话中,有
149 条
被大模型判定为「人类对话」。
03
配对比较
57.33%
的情况下,AI 对话被认为「更像人类」。
用户模拟器足以在可复现环境中,逼近真实外呼的不确定性。
不确定性不是回避掉的噪声,而是要被造出来、量出来的测试条件。
MONEY QUOTE · 02
外呼智能体首先要「把事办成」
然后才谈「办得是否让人舒服」
这是我们在设计评测指标时逐渐形成的共识。
因此 VoiceAgentEval 采用了「文本 + 语音」的双维度评估体系。
二 · 双维度评估
13
文本定成败,语音定去留
一个公式,加一条独立维度
TEXT · 参与线性合成
TFC 任务流程遵循度
关键节点是否完成 · 流程顺序是否正确
0.55
GIC 通用交互能力
自然度 / 连贯性 / 幻觉处理 / 意图理解
0.45
FINAL SCORE
0.55 × TFC + 0.45 × GIC
VOICE · 独立维度
语音 15 项指标
多轮 · ASR · TTS
响应延迟 / 打断率
音质 / 交互体验
不参与线性合成得分
体验不决定成败
Final Score = 0.55 × TFC + 0.45 × GIC;语音评估作为独立维度进行多项指标量化,不参与线性合成得分。
二 · 文本维度
14
TFC 与 GIC 各管一件事
流程不对,再自然也没用
TFC · 权重 0.55
关键节点是否完成,顺序是否正确
在真实外呼中,漏掉一个关键节点,往往意味着整通电话失败 —— 因此覆盖分数占 70% 权重。
GIC · 权重 0.45
自然度、连贯性、幻觉处理、意图理解
用于区分「能用」与「好用」。流程正确,体验才决定能否规模化。
流程不对,再自然也没有业务价值;流程正确,体验才决定能否规模化。
二 · 语音维度
15
体验不决定成败,但会放大成败
三个节点,十五项指标
多轮对话
ASR 语音识别
TTS 语音合成
15
项指标
响应延迟
打断成功率
音质
整体交互体验
语音评估作为独立维度进行多项指标量化
不参与文本评估的线性合成得分
我们的判断是克制而明确的:
语音本身不决定任务是否完成,但它会决定用户是否还愿意继续听你说下去。
MONEY QUOTE · 03
语音本身不决定任务是否完成
但它决定用户还愿不愿意继续听
在语音评估中,我们从多轮对话、ASR、TTS 三个关键节点出发,构建了 15 项指标,
评估响应延迟、打断成功率、音质与整体交互体验。
02
我们对当前主流大模型
做了一次贴近真实业务场景的
摸底考
结果比直觉更清晰。
下面三个发现,都不是「谁最强」的排名问题,而是「强在哪一维」的选型问题。
三 · 值得关注的发现
18
综合性能前三名(按原文列举顺序)
任务完成能力都很稳定
综合前三
doubao-1.5-32k
复杂外呼场景中任务完成能力非常稳定;在语音交互体验相关指标上表现尤为突出。
综合前三
GPT-4.1
任务完成能力同样稳定;在语音交互体验相关指标上表现尤为突出。
综合前三
Claude-4-Sonnet
TFC 上表现非常稳健,GIC 上略逊一筹 —— 更适合流程合规性要求极高的标准化场景。
这三款模型在复杂外呼场景中的任务完成能力都非常稳定,
但它们在不同维度上的「强项」并不完全一致
—— 这正是选型该看的地方。
三 · 值得关注的发现
19
参数规模并非性能的唯一决定因素
参数更大,不等于表现更好
PART OF GIC METRICS
原文未给出具体分值,此处仅示意相对高低
Gemini-2.5-Flash
略优
Gemini-2.5-Pro
在部分 GIC 指标上,Flash 甚至略优于 Pro 版本
说明模型架构、数据质量与对齐策略,在特定场景下并不亚于模型规模
参数规模并非性能的唯一决定因素。
三 · 值得关注的发现
20
TFC 与 GIC 的取舍具有明确业务指向性
取舍本身,就是选型答案
TFC 稳健 · GIC 略逊
更适合标准化场景
Claude-4-Sonnet 在 TFC 上表现非常稳健,但在 GIC 上略逊一筹 —— 使其更适合对流程合规性要求极高的标准化场景。
两个维度更均衡
更适合高情商交互
而在两个维度上表现更均衡的模型,则更适合客服、销售等高情商交互场景。
语音体验开始成为真实分水岭。
高性能的基座模型 + 成熟稳定的实时语音工程,是打造极致 AI 外呼体验的关键组合。
MONEY QUOTE · 04
VoiceAgentEval
不是一个最终答案
它更像一次纠偏
把 AI 评测,从理想化的能力展示,拉回到真实业务系统的约束之中。
当对话开始承担结果,当流程开始比文采更重要 —— 我们才真正开始讨论 AI 外呼的「智能」。
带走三件事
22
如果只记三条
带走三件事
01
DATASET
评测集要长得像业务
学术榜单衡量基础语言能力有效,但外呼是强流程、强约束、强结果导向的系统。
02
ORDER
先办成,再谈舒服
TFC(0.55)+ GIC(0.45)构成文本得分;语音作为独立维度量化,不参与线性合成。
03
UNCERTAINTY
不确定性要造出来测
用户模拟器用五种人格原型,在可复现环境里逼近真实用户的不确定性。
当对话开始承担结果,评测就必须回到业务约束里。
而这件事,才刚刚开始。
延伸阅读与系列导航
23
来源与这条线的去向
延伸阅读,与后来的三部曲
01
论文原文
arxiv.org/abs/2510.21244
02
评测报告
xbench.org/reports/zmbbhdtfc5ui5qx5xjgquusj
03
开源代码
github.com/LVYUERLVR/OutboundEval-Xbench
系列导航(deck 补注,非原文内容):
这条线后来长成了「评测三部曲」——
#17
数据层,一句话听没听对;
#18
对话层,整段解决了没有;
#19
组织层,谁来定义「什么叫好」。
现在就可以对号入座:你手上的评测集,长得像你的真实业务吗?
谢谢
不是最终答案
而是一次纠偏
把 AI 评测,拉回到真实业务系统的约束之中
Author
姚光华 Colin
一手源
arXiv:2510.21244 · xbench 评测报告
已核验
TFC 0.55 / GIC 0.45 · 150 组测试数据
立场提示
作者为 VoiceAgentEval 项目参与者
EDIT
浅底