Voice Agent 闭门会(北京)· Voice Agent Camp

Voice Agent 2026
Vibe SOTA

从 Vibe Check 到 Vibe SOTA:2026 的体验天花板在哪
场合Voice Agent 闭门会 · Camp
日期2026.01.25 / 03.07
讲者姚光华 Colin
形式闭门会 / Camp 分享
全场主线 · THE ARC02
这场在讲什么

2026 的对话体验,天花板到底在哪。

01 · 对话 Conversation 它本来是什么 02 · 现场 Reality 生产环境的真问题 03 · 生死线 Survival 别听错别失控别让人等 04 · SOTA Vibe SOTA 2026 的天花板在哪
Vibe Check 问的是「过没过」,Vibe SOTA 问的是「最好能到哪」。这场是闭门版,铺垫全部略过,直接进产品和体验的细节。
开场 · WARM-UP03
先问在座两个问题

不从技术开始,从你手上的东西开始。

开场提问 · 01
2026 你最期待的硬件是什么?
下一页给出的三个:妙控麦克风 · Typeless · 闪电说。三个都不靠屏幕,都是拿嘴用的。
开场提问 · 02
2026 你养🦞了吗?养了几只?
注意问法:不是「有没有」,是「养了几只」。
讲者:姚光华 Colin · 声网 AI 产品线负责人 · ex 阿里巴巴。在做的事:Engine · Robotics · Benchmark · Agents,围绕规模化、稳定性、商业化,回答 AI 如何真正「跑在生产环境」。方法论一句话:用运行代替讨论,让系统先跑起来。
这两个问题不用回答。它们只是把今天的坐标先立在这儿。
ACT 01
CONVERSATION
对话是什么
在谈「体验天花板」之前,先把对话本身拆开:它是什么,由什么构成,为什么它会成为交互的终点。
01 对话 02 现场 03 生死线 04 SOTA
先退一步
?
什么是对话
HUMANS ARE BORN TO CONVERSE对话,是我们与生俱来的能力。不用教,不用学,不用说明书。
它从来不止「语言」真正让人觉得「聊得下去」的,大部分不在字面内容里。
先别急着回答接下来两页,把它拆成可以被工程处理的东西。
现场问一句:你上一次觉得「这人真会聊」,是因为他说了什么?
对话的本质 · MEHRABIAN06
梅拉宾法则 ·《沉默的信息 Silent Messages》

对话,从来都不止「语言」。

BODY LANGUAGE
55%身体语言 —— 表情、姿态、眼神。语音场景里这一层直接消失。
TONE OF VOICE
38%声音语调 —— 语速、停顿、语气。这一层是 Voice Agent 唯一能补的。
WORDS
7%语言内容 —— 字面上说了什么。今天大部分产品只做对了这一层。
只把文字做对,最多只做对了 7%。
对话的本质 · 四层07
一场真正的对话,由四件事构成

被听到、被理解、被接纳、被共鸣。

LISTENING / UNDERSTANDING / ACCEPTANCE / RESONANCE 被听到 LISTENING 被理解 UNDERSTANDING 被接纳 ACCEPTANCE 被共鸣 RESONANCE
四层是递进的:没有被听到,后面三层根本不成立。
对话即交互 · THE INTERFACE08
交互的终点,是回到我们最原始的能力

界面演进了七代,最后转回了对话。

API/SDK 开发者 和代码 Console 产品经理 和界面 Graph 设计师 和画板 Text 受教育者 和模型 Voice 自然语言使用者 和智能体 Video 孩童 和虚拟生命体 Face2Face 我们 和具身智能 交互的终点,是回到我们最原始的能力 —— 对话
七代界面越走越像人,最后一代干脆就是人本来的样子。
MONEY QUOTE · 01
对话不仅仅是界面, 它本来就是人类 最古老的操作系统。
Conversation is not an interface — it is humanity's oldest operating system.
01 → 02
对话式智能体,是第一次 让计算以「人类方式」展开的接口。
The Voice Agent is the first interface where computation unfolds in a truly human way.
ACT 02
REALITY
真实世界的问题
道理讲完了,接下来全是现场。这一幕的每个问题都来自真实的生产环境,不是实验室。
01 对话 02 现场 03 生死线 04 SOTA
现场 · FROM AN AMA12
这些问题来自我最近一次 AMA

真实世界的问题,往往不是模型问题。

它们不是「实验室里的问题」,而是一旦进入生产环境就一定会遇到的问题。三个方向,下面三页各拆一页。
问题一 · 延迟
对话感,死于等待
人机对话普遍停在 ≥ 1s。人不是在对话,而是在等系统反应。
问题二 · 噪声
听到的不都该听
嘈杂环境 ≠ 单一噪声。最致命的那一类,降噪根本处理不了。
问题三 · 稳定
敢不敢拿去商用
出问题时能不能定位、能不能兜底,决定它能不能上生产。
模型每几个月强一次。这三个问题,模型再强也不会自己消失。
现场 · 延迟13
人类对「对话」的延迟感知,存在明确区间

对话感,死于等待。

≈ 0-200 ms FACE-TO-FACE 面对面 · 临场反馈扑面而来 ≈ 400 ms REMOTE 远程在线交流 · 可接受的 人会主动等一下对方 心理上做了延迟补偿 ≥ 1 s HUMAN-AGENT 人机对话 · 新常态 需要等,需要确认,需要容忍 人不是在对话, 而是在等系统反应 0-200MS / 400MS / 1S+
人类对延迟的容忍,并不是无限的,而是与对话对象息息相关。
MONEY QUOTE · 02
人不是在对话, 而是在等系统反应。
≥ 1s 的区间:需要等,需要确认,需要容忍。
现场 · 噪声15
嘈杂环境 ≠ 单一噪声

真正毁掉对话的,不是噪声。

稳态噪声 STEADY 空调声、风噪、机械持续运行 瞬态噪声 SUDDEN 敲击、碰撞、犬吠 来得快,去得也快 非对话人声 BACKGROUND VOICES 最容易被忽略,但最致命 降噪帮不上忙 因为那也是「人在说话」 STEADY / SUDDEN / BACKGROUND VOICES
前两类基本被工程解决了,砸掉对话的是第三类。
现场 · 注意力16
我们把这类能力称为

选择性注意力锁定 Selective Attention Locking

DE-NOISE 把不该听的减掉 这是过去十年信号处理的成果:稳态噪声已解决,瞬态噪声基本可控。但它的前提是「噪声不是人声」。
ATTENTION LOCKING 知道该听谁在说 选择性注意力 + 语境判断 + 音频分离。三件事凑齐,Agent 才算真的会「听」,而不只是会「收音」。
真正成熟的 Agent,不是把听到的都当输入,而是具备选择性注意力 + 语境判断 + 音频分离能力。
现场 · 架构17
为什么选级联,不选端到端

敢商用,才是架构的底线。

CASCADED · 可观测 / 可调优 / 可兜底 ASR LISTEN LLM THINK TTS SPEAK 可观测 延迟与失败点可定位 可调优 三段可独立替换升级 可兜底 系统不会整体失控 端到端 BLACK BOX 一处失败 整体失控
在人机对话里,稳定性本身,就是一种用户体验。
ACT 03
SURVIVAL
三条生死线
把前面三页收成一句话。这三条不是加分项,是能不能被叫做「对话」的准入线。
01 对话 02 现场 03 生死线 04 SOTA
MONEY QUOTE · 03
别听错, 别失控, 别让人等。
A conversation lives or dies by three rules. Don't mishear. Don't break. Don't make people wait.
生死线 · THE 3 RULES20
对话式智能体的生死线只有三条

三条线,各自对应一件必须做对的工程。

RULE 01别听错选择性注意力锁定 —— 在一屋子人声里锁定对话对象,而不是把听到的都当输入。
RULE 02别失控可观测的级联架构 —— 每一段延迟和失败点都可定位、可替换、可兜底。
RULE 03别让人等延迟预算 —— 把响应压回人还愿意把它当「对话」的那个区间。
三条里破一条,前面所有的人设和能力都白搭。
ACT 04
SOTA
2026 的天花板
活下来只是及格线。这一幕看的是:2026 年最好的那一版长什么样,以及我们离它还差几格。
01 对话 02 现场 03 生死线 04 SOTA
SOTA · JAN 202622
VOICE AGENTS SOTA · JAN 2026

Where Latency Outweighs Intelligence

TOLAN'S NORTH STAR
P90 < 1.5s整个产品的北极星指标是一个延迟数字:90 分位的响应必须落在 1.5 秒以内。
LATENCY IS PARAMOUNT
延迟压过智能
2026 年 1 月,行业最好的那一版把赌注押在「更快」上,而不是「更聪明」。一个更聪明但更慢的 Agent,用户不会等它。
SOURCE · openai.com/index/tolan
当 SOTA 把北极星定在延迟上,比赛的赛道就已经换了。
SOTA · 能力阶梯23
2026 VIBE SOTA

体验的天花板,长在这四个维度上。

LISTEN / LATENCY / STABILITY / MEASURABLE 听清 LISTEN 选择性注意力锁定 不等待 LATENCY P90 < 1.5 s 理想区间 0-200 ms 不崩 STABILITY 可观测的级联架构 可调优 · 可兜底 可衡量 MEASURABLE VoiceAgentEval Vibe & Action 的图灵测试 还在建
前三条决定它能不能上生产,第四条决定它能不能被比较。
SOTA · 已解决 / 未解决24
盘一遍

哪些已经解决,哪些还没有。

01稳态噪声空调声、风噪、机械持续运行 —— 已解决,这是过去十年信号处理的成果
02瞬态噪声敲击、碰撞、犬吠 —— 基本可控,工程上有成熟兜底
03非对话人声最容易被忽略,但最致命。降噪帮不上忙,要靠选择性注意力锁定 —— 仍是开放问题
04架构稳定级联给出了可观测、可调优、可兜底的答案 —— 有解,区别只在做不做
05延迟人机对话仍普遍停在 ≥ 1s;SOTA 已经把线画到 P90 < 1.5 s —— 差距是明确的
06体验评测Vibe 与 Action 还没有公认的尺子 —— VoiceAgentEval 正在建这把尺子
能靠工程解决的基本都在解决。剩下标红的两格,才是 2026 的真正战场。
SOTA · VOICEAGENTEVAL25
BEYOND SURVIVAL

Beyond Survival —— 给 Vibe 建一把尺子

SURVIVAL 别听错 别失控 别让人等 VoiceAgentEval THE TURING TEST FOR VIBE & ACTION VIBE ACTION 我们的主张 我们不只是在做 Agent 我们在定义人机 交互的物理规律
承认 vibe 是物理的,它就能被定义、被打分、被比较。
MONEY QUOTE · 04
We are not just building Agents. We are defining the Physics of Human-Agent Interaction.
Beyond Survival: The "VoiceAgentEval" Project · Building the "Turing Test" for Vibe & Action
TAKEAWAY27
带走三条

今天带走三条就够了。

01
先问生死线,再问人设
别听错、别失控、别让人等。三条过不去,再好的角色设定也没人听得下去。
02
延迟是可感知的物理量
0-200 ms 是活人感,≈400 ms 靠延迟补偿撑住,≥ 1s 就不再是对话了。
03
Vibe 可以被衡量
承认它是物理的,就能给它建尺子。这是 2026 最值得投入的一件事。
Vibe Check 是及格线,Vibe SOTA 是天花板。2026 该往天花板走了。
谢谢大家的时间 · Thanks for your time!

Voice Agent 2026
Vibe SOTA

从 Vibe Check 到 Vibe SOTA
场合Voice Agent 闭门会 · Camp
日期2026.01.25 / 03.07
相关档案演讲档案 10
说明依原稿 22 页重构 · 已剔除 2 页空白页