公众号文章系列 · 04 · 评测这条线的起点

VoiceAgentEval
重做 AI 外呼的 Benchmark

把评测从理想化的能力展示,拉回真实业务的约束里
Author姚光华 Colin
Role声网 ConvoAI 产品负责人
一手源arXiv:2510.21244 · xbench 报告
Date2026.07
04
在真正参与这个项目之前,我自己并不完全确定:AI 外呼的「智能」,到底该如何被定义和评估。
作为 VoiceAgentEval 项目的参与者之一,我想借这篇文章系统讲清一件事 ——
为什么我们认为,AI 外呼的 Benchmark,必须重做。
一 · 通用 Benchmark 评不出什么03
一道长期被忽视的错位

评估停在能力层,业务在约束里

ACADEMIC BENCHMARK MMLU / C-Eval 这类榜单 衡量基础语言能力非常有效 但本质仍是单轮问答 或弱目标导向的评测体系 默认一个理想且配合的用户 鸿沟 长期被忽视的错位 REAL OUTBOUND CALL 真实外呼场景 高度流程化、目标导向 且充满不确定性 强流程 · 强约束 · 强结果 对话开始承担业务结果
行业内对「智能」的评估,仍高度停留在通用模型能力层面。这两者之间,存在着一道长期被忽视的鸿沟
一 · 通用 Benchmark 评不出什么04
强流程 · 强约束 · 强结果导向

外呼里,三种当场失败

01少走一步哪一步没走,业务直接失败。
02漏个信息哪个关键信息漏掉,整通电话失效。
03说错一句哪句话说错,用户可能当场挂断。
这类问题,并不能通过「回答是否聪明」「表达是否自然」来判断。AI 外呼恰恰不是一个「自由生成」的问题。
在真实外呼中,对话是一种强流程、强约束、强结果导向的系统。 现有的 MMLU、C-Eval 在衡量基础语言能力上非常有效,但它们本质上仍是「单轮问答」或弱目标导向的评测体系。
MONEY QUOTE · 01
一个「聊得很像人」的 Agent 如果无法稳定完成关键节点 在业务上反而是危险的
正是这种评测与真实应用之间的脱节,促使我们开始思考:
是否需要一套真正为 AI 外呼而设计的评测体系。
01
目标只有一个 ——尽可能把模型,放进真实业务的约束条件里测试。
VoiceAgentEval 从三个维度搭建评测框架:基准测试构建、用户模拟器、交互质量评估方法。
二 · 三大核心支柱07
构建真实世界的试炼场

三根支柱,一座试炼场

真实世界的「试炼场」 BENCHMARK 基准测试构建 源于真实外呼业务数据 6 领域 · 30 子场景 · 5 画像 USER SIMULATOR 用户模拟器 规模化、可复现的数字人类 五种人格原型,覆盖不同策略 EVALUATION 交互质量评估 文本 + 语音 双维度体系 TFC · GIC · 15 项语音指标
三根支柱指向同一件事:把模型放进真实业务的约束条件里去测。
二 · 基准测试构建08
源于真实业务数据的场景定义

六大领域,六种交互范式

业务领域核心交互范式关键能力要求
客服服务情绪修复导向将对抗情绪转化为合作关系
市场销售防御突破表达应对拒绝、质疑,传递价值
人力资源双向评估动态专业、平等、信息对称
金融风控合规约束导向高精度、零容错
调研与数据收集敏感性维护导向中立、克制、避免诱导
主动关怀与通知温暖传递导向传递关怀而非机械通知
它们并非简单分类,而是代表了外呼中不同的交互范式与能力边界。在此基础上,我们进一步细分出 30 个子场景,并为每个子场景构建 5 种用户画像。
150
6 大业务领域 → 30 个子场景 → 每个子场景 5 种用户画像,
最终形成 150 组测试数据,兼顾广度与深度。
评测语料库基于真实外呼业务数据构建。目标只有一个:尽可能把模型,放进真实业务的约束条件里测试。
二 · 用户模拟器10
外呼系统最大的不确定性,来自真实用户

从理想用户,到五种人格

ASSUMED USER 一个理想且配合的用户 真实用户会插话、怀疑、 犹豫、突然改变态度 许多评测体系默认的, 却是一个配合的对手 抽象为系统工程 FIVE PERSONAS 高度合作型 强抗拒型 覆盖不同沟通策略与行为模式
这不是简单的角色扮演,而是从真实交互数据中抽象出的系统工程 —— 用 AI 在受控环境中模拟真实用户行为。
二 · 用户模拟器11
三种评估方式,验证「数字人类」的真实性

数字人类,像不像真的?

01拟人度AI 生成对话在 0–9 分制中获得 8.27 分,接近真实对话的 8.50 分。
02AI 检测150 条对话中,有 149 条被大模型判定为「人类对话」。
03配对比较57.33% 的情况下,AI 对话被认为「更像人类」。
用户模拟器足以在可复现环境中,逼近真实外呼的不确定性。 不确定性不是回避掉的噪声,而是要被造出来、量出来的测试条件。
MONEY QUOTE · 02
外呼智能体首先要「把事办成」 然后才谈「办得是否让人舒服」
这是我们在设计评测指标时逐渐形成的共识。
因此 VoiceAgentEval 采用了「文本 + 语音」的双维度评估体系。
二 · 双维度评估13
文本定成败,语音定去留

一个公式,加一条独立维度

TEXT · 参与线性合成 TFC 任务流程遵循度 关键节点是否完成 · 流程顺序是否正确 0.55 GIC 通用交互能力 自然度 / 连贯性 / 幻觉处理 / 意图理解 0.45 FINAL SCORE 0.55 × TFC + 0.45 × GIC VOICE · 独立维度 语音 15 项指标 多轮 · ASR · TTS 响应延迟 / 打断率 音质 / 交互体验 不参与线性合成得分 体验不决定成败
Final Score = 0.55 × TFC + 0.45 × GIC;语音评估作为独立维度进行多项指标量化,不参与线性合成得分。
二 · 文本维度14
TFC 与 GIC 各管一件事

流程不对,再自然也没用

TFC · 权重 0.55
关键节点是否完成,顺序是否正确
在真实外呼中,漏掉一个关键节点,往往意味着整通电话失败 —— 因此覆盖分数占 70% 权重。
GIC · 权重 0.45
自然度、连贯性、幻觉处理、意图理解
用于区分「能用」与「好用」。流程正确,体验才决定能否规模化。
流程不对,再自然也没有业务价值;流程正确,体验才决定能否规模化。
二 · 语音维度15
体验不决定成败,但会放大成败

三个节点,十五项指标

多轮对话 ASR 语音识别 TTS 语音合成 15 项指标 响应延迟 打断成功率 音质 整体交互体验 语音评估作为独立维度进行多项指标量化 不参与文本评估的线性合成得分
我们的判断是克制而明确的:语音本身不决定任务是否完成,但它会决定用户是否还愿意继续听你说下去。
MONEY QUOTE · 03
语音本身不决定任务是否完成 但它决定用户还愿不愿意继续听
在语音评估中,我们从多轮对话、ASR、TTS 三个关键节点出发,构建了 15 项指标,
评估响应延迟、打断成功率、音质与整体交互体验。
02
我们对当前主流大模型做了一次贴近真实业务场景的摸底考结果比直觉更清晰。
下面三个发现,都不是「谁最强」的排名问题,而是「强在哪一维」的选型问题。
三 · 值得关注的发现18
综合性能前三名(按原文列举顺序)

任务完成能力都很稳定

综合前三
doubao-1.5-32k
复杂外呼场景中任务完成能力非常稳定;在语音交互体验相关指标上表现尤为突出。
综合前三
GPT-4.1
任务完成能力同样稳定;在语音交互体验相关指标上表现尤为突出。
综合前三
Claude-4-Sonnet
TFC 上表现非常稳健,GIC 上略逊一筹 —— 更适合流程合规性要求极高的标准化场景。
这三款模型在复杂外呼场景中的任务完成能力都非常稳定,但它们在不同维度上的「强项」并不完全一致 —— 这正是选型该看的地方。
三 · 值得关注的发现19
参数规模并非性能的唯一决定因素

参数更大,不等于表现更好

PART OF GIC METRICS 原文未给出具体分值,此处仅示意相对高低 Gemini-2.5-Flash 略优 Gemini-2.5-Pro 在部分 GIC 指标上,Flash 甚至略优于 Pro 版本 说明模型架构、数据质量与对齐策略,在特定场景下并不亚于模型规模
参数规模并非性能的唯一决定因素。
三 · 值得关注的发现20
TFC 与 GIC 的取舍具有明确业务指向性

取舍本身,就是选型答案

TFC 稳健 · GIC 略逊
更适合标准化场景
Claude-4-Sonnet 在 TFC 上表现非常稳健,但在 GIC 上略逊一筹 —— 使其更适合对流程合规性要求极高的标准化场景。
两个维度更均衡
更适合高情商交互
而在两个维度上表现更均衡的模型,则更适合客服、销售等高情商交互场景。
语音体验开始成为真实分水岭。 高性能的基座模型 + 成熟稳定的实时语音工程,是打造极致 AI 外呼体验的关键组合。
MONEY QUOTE · 04
VoiceAgentEval 不是一个最终答案 它更像一次纠偏
把 AI 评测,从理想化的能力展示,拉回到真实业务系统的约束之中。
当对话开始承担结果,当流程开始比文采更重要 —— 我们才真正开始讨论 AI 外呼的「智能」。
带走三件事22
如果只记三条

带走三件事

01
DATASET
评测集要长得像业务
学术榜单衡量基础语言能力有效,但外呼是强流程、强约束、强结果导向的系统。
02
ORDER
先办成,再谈舒服
TFC(0.55)+ GIC(0.45)构成文本得分;语音作为独立维度量化,不参与线性合成。
03
UNCERTAINTY
不确定性要造出来测
用户模拟器用五种人格原型,在可复现环境里逼近真实用户的不确定性。
当对话开始承担结果,评测就必须回到业务约束里。 而这件事,才刚刚开始。
延伸阅读与系列导航23
来源与这条线的去向

延伸阅读,与后来的三部曲

01论文原文arxiv.org/abs/2510.21244
02评测报告xbench.org/reports/zmbbhdtfc5ui5qx5xjgquusj
03开源代码github.com/LVYUERLVR/OutboundEval-Xbench
系列导航(deck 补注,非原文内容):这条线后来长成了「评测三部曲」—— #17 数据层,一句话听没听对;#18 对话层,整段解决了没有;#19 组织层,谁来定义「什么叫好」。
现在就可以对号入座:你手上的评测集,长得像你的真实业务吗?
谢谢

不是最终答案
而是一次纠偏

把 AI 评测,拉回到真实业务系统的约束之中
Author姚光华 Colin
一手源arXiv:2510.21244 · xbench 评测报告
已核验TFC 0.55 / GIC 0.45 · 150 组测试数据
立场提示作者为 VoiceAgentEval 项目参与者