公众号文章系列 · 20 · VAD · 打断 · 噪声鲁棒

它不停以为
自己被打断

OpenAI 董事长承认,现成语音方案扛不住真实噪声
Author姚光华 Colin
Role声网 ConvoAI 产品负责人
一手源Uncapped #42 · 24:22–28:21
Date2026.07.24
20
路边一声喇叭,后座孩子一句话,都可能让前沿语音 Agent 误判。
一个人站在路边,正在向客服 Agent 说明车辆问题。Agent 刚开始回答,旁边响了一声喇叭,它停了。
后座的孩子说了一句话,它又停了。用户其实没有打断 —— 但 Agent 连续两次把话轮让了出去。
开场 · 把那通电话还原出来03
一条真实话轮,被两次噪声抢走

用户没打断,话轮却让了两次

AGENT Agent 刚开始回答 重新开口 USER 用户其实没有打断 —— 这条轨道上什么都没发生 NOISE 一声喇叭 后座孩子说了一句话 DECISION 误判:被打断 → 停 又一次 → 又停 模型已经能推理复杂问题,却还不一定知道眼前这阵声音,究竟是不是用户在跟它说话。
这是语音 Agent 在 demo 之外,最容易断掉的那一层。
开场 · 原句04
原句照抄 · Uncapped #42 · 2026-02-19 · [24:29]

"it constantly thinks it's being interrupted."

BRET · 24:29 even in some of the advanced voice mode stuff, if you are in a noisy environment, it constantly thinks it's being interrupted 不停地以为自己被打断了
紧接着 you end up having to build proprietary voice activity detection, multiple speaker detection 于是只好自己做 VAD
今年 2 月,Uncapped 主持人问 Bret:客服 Agent 还有哪些问题没解决?他先提到汽车喇叭、背景噪声和旁边的小孩。
说出这件事的人,是 Sierra CEO,也是 OpenAI 董事长。
MONEY QUOTE · 01
只要环境够吵 它就不停地 以为自己被打断了
"it constantly thinks it's being interrupted." —— Uncapped #42,2026-02-19,[24:29]。于是 Sierra 最后不得不自己做 VAD(Voice Activity Detection)和多说话人检测。
ACT I / VII
NOISE
一声喇叭抢走一整轮
Bret 举的是 Sierra 客户 Safelite AutoGlass 的场景,接近道路救援或路边服务。
汽车喇叭、车流、后座小孩,并不是为了测试模型故意制造的极端条件。
I 噪声II 话轮III 证据IV 自建V 中文VI 评测VII 边界
ACT I · 噪声07
Safelite AutoGlass · 道路救援与路边服务

这类业务每天都会遇到的正常环境

很多人以为的问题
Agent 能不能过噪声测试
在实验室里放一条白噪声,跑一遍,通过。于是宣布这个能力已经具备了。
真正的问题
噪声本身就是业务现场
汽车喇叭、车流、后座小孩,不是为了测试模型故意制造的极端条件 —— 它们就是常态。
而这也不只是一段播客里的个案。Sierra 早在 2025 年的一篇语音工程博客里披露,他们分析了数百万次对话,发现系统偶尔会把繁忙街道、电视声,甚至用户对狗说的话当成「打断」。
也就是 Agent 应该立刻闭嘴的信号。
MONEY QUOTE · 02
问题不在于能不能 通过一次噪声测试 噪声本身就是业务现场
路边服务、道路救援、免提通话、公共场所 —— 在这些场景里,「安静房间」才是那个不存在的假设。
ACT I · 噪声09
于是 Sierra 做了四件事

这已经不是「检测到人声就停」

01自研 VAD语音活动检测握在自己手里 —— 不再依赖任何现成的通用方案。
02降噪把繁忙街道、电视声这类持续背景声压下去,再交给后面的判断。
03多说话人分清是来电用户、旁边的小孩,还是电视里的人在说话。
04上下文结合当前对话状态,判断这句话到底想不想拿走话轮。
它是一套关于谁在说、对谁说、这句话想不想拿走话轮的实时判断。
输入是音频,输出却不是简单的 0 或 1。
ACT I · 噪声10
系统必须区分三类完全不同的声音

同样是人声,三种截然不同的处理

「等等,不是那个」 用户真的在打断 · 声音很短,却必须立刻让 Agent 闭嘴 立刻停 「嗯,对」 用户只是附和 · 是用户说的,却未必要求 Agent 停下 继续说 「我去接一下孩子」 用户在和旁边的人讲话 · 不是在对 Agent 下指令 保持安静
它最终要决定的是:继续说、停下来、回应一下,还是保持安静。
ACT II / VII
TURN
打断不是开关,是四层判断
很多语音 Agent 的打断逻辑,最初都很朴素:
检测到用户侧出现人声 → 停止 TTS 播放 → 开始听用户说话。在安静房间里,这套逻辑很好用。
I 噪声II 话轮III 证据IV 自建V 中文VI 评测VII 边界
ACT II · 话轮12
一旦进入真实电话,几件完全不同的事被揉成一个信号

打断背后,是四层判断

1 有没有声音 是人声、喇叭、电视,还是线路噪声?传统 VAD 主要解决这一层。 2 谁在说话 是来电用户、旁边的小孩,还是电视里的人? 3 这句是不是说给 Agent 的 用户是在交代别人,还是在修正 Agent? 4 系统应该做什么 立刻停下、继续说、只「嗯」一声,还是等用户想完?
VAD 可以是整个判断链的入口,但不能独自替后面三层做决定。
ACT II · 话轮13
为什么「检测到人声就停」会变成灾难

四个场景,四种翻车方式

01喇叭不是人声,却可能触发错误检测 —— 声学阈值分不清语义。
02小孩是人声,却不该拥有这通电话的话轮。
03附和「嗯,对」是用户说的,却未必要求 Agent 停下。
04真插话「等等,不是这个订单」声音很短,却必须立刻让 Agent 闭嘴。
在安静房间里,「检测到人声就停」很好用。一旦进入真实电话,它就会把几件完全不同的事揉成一个信号。
所以,打断不是一个开关。
MONEY QUOTE · 03
打断不是一个开关 是一项独立的产品能力
它的输入是音频,输出却不是简单的 0 或 1。它最终要决定的是:继续说、停下来、回应一下,还是保持安静。
ACT III / VII
EVIDENCE
三份证据,同一个断点
如果这只是 Sierra 一家的工程选择,还不足以说明问题。
但把它和另外两份材料放在一起,证据链就完整了。
I 噪声II 话轮III 证据IV 自建V 中文VI 评测VII 边界
ACT III · 证据16
症状 · 机制 · 成本,三条线汇到同一个点

OpenAI 写症状,论文讲机制,Sierra 付账单

OPENAI · 症状 当成了「你说完了」 GPT-Live 公告:短暂停顿或背景噪声被误判 DUPLEXCASCADE · 机制 很难利用语义和意图 基于 VAD 的话轮切分,有根本限制 SIERRA · 成本 应用公司自己补 投入团队,自建 VAD 与多说话人检测 话轮判断不能只依赖声学触发 要把声音、说话人、语义和当前对话状态放在一起判断 三者共同指向的,不是「某一个 VAD 模型不够好」,而是一个更大的产品事实。
ACT III · 证据17
三份材料,逐条列出

声音消失了,不等于意思说完了

OPENAI 回顾 Advanced Voice Mode 这类回合制方案:一次短暂停顿或背景噪声,都可能被误判为用户已经结束当前话轮 GPT-Live 公告 · 厂商文档
论文 基于 VAD 的话轮切分有根本限制,因为它很难利用对话语义和意图 DuplexCascade · arXiv 2603.09180
SIERRA 不只看见问题,还为此投入团队,自建 VAD、多说话人检测和上下文判断 生产现场 · 数百万次对话
研究者解释了原因:声音消失了,不等于意思说完了;声音出现了,也不等于用户要抢话。
MONEY QUOTE · 04
话轮判断 不能只依赖声学触发
它需要把声音、说话人、语义和当前对话状态放在一起判断。OpenAI 写下症状,论文解释机制,Sierra 最后为它付了工程账单。
ACT IV / VII
BUILD
明知两年后会扔,今天也造
Bret 紧接着说了一段更值得做产品的人听的话。
Sierra 明知道,这些自研能力可能一两年后就会商品化,变成随手可买的基础能力。
I 噪声II 话轮III 证据IV 自建V 中文VI 评测VII 边界
ACT IV · 自建20
原句照抄 · Uncapped #42

"we need to be the best now."

BRET TAYLOR we need to be the best now. 我们现在就必须做到最好
他的补充 一支团队可能把两年的精力,投进一项所有人都知道只管用两年的技术里 Applied AI 最难受的一面
可客户不是两年后才打电话。银行现在就要粤语,路边服务现在就有喇叭,客服 Agent 今天就会因为一次误打断丢掉整轮对话。
一项技术是不是永久护城河,和它今天是不是核心能力,是两回事。
ACT IV · 自建21
今天搭桥,未来拆掉

敢补的前提,是敢扔

TODAY · 今天 自己造 VAD · 降噪 · 多说话人 · 上下文判断 因为现成能力现在不够用 一两年 LATER · 一两年后 随手可买 这些能力会被商品化,变成基础件 Bret 自己就是这么预期的 成熟的做法:今天敢补,明天也敢扔 接口留好、指标立住,等外部能力追上时可以随时替换 —— 而不是养一支昂贵的基础设施团队。
MONEY QUOTE · 05
是不是永久护城河 和今天是不是核心能力 是两回事
这就是 Applied AI 很难受、也很真实的一面。Sierra 明知这些自研能力一两年后会商品化,但仍然必须做 —— 因为客户不是两年后才打电话。
ACT IV · 自建23
但这不等于每家公司都该自研 VAD

是否值得自建,我会看三个条件

01业务打点这个失败是否直接打在业务指标上 —— 解决率、转人工率或任务完成率。
02可控性外部方案是否只能换供应商,不能观察、调优和回归。
03数据量自己是否有足够的真实流量,能把例外持续变成训练与评测数据。
反过来,如果只是为了「栈更完整」而自建,最后很可能得到一支昂贵的基础设施团队,却没有任何客户能感知的差异。
三个条件都成立,自建不是技术洁癖,而是产品责任。
ACT V / VII
LOCALE
到了中文世界只会更难
同一段访谈里,Bret 还提到粤语和他加禄语,并举了一家在香港有大量业务的银行。
这段是 Bret 在播客里的当事人口径,不能当成一份完整的市场排名。
I 噪声II 话轮III 证据IV 自建V 中文VI 评测VII 边界
5x
Mandarin transcription accuracy can be 5x worse than English.
Sierra 自己发布的 μ-Bench 给了一个更可核验的信号:普通话转写准确率,可能比英语差 5 倍。
而且没有一家 ASR 供应商在所有语言上都赢。
ACT V · 中文26
μ-Bench · an open multilingual transcription benchmark

这套基准是怎么搭的

250 通真实客服电话 4270 条人工标注语句 8kHz 单声道电话信道 5 种语言覆盖 英 / 西 / 土 / 越 / 普通话 没有一家 ASR 供应商,在所有语言上都赢 这意味着,「支持 70 种语言」和「70 种语言都能上生产」,中间隔着很远。
这不是一段厂商口径,是一套可核验的公开基准。
ACT V · 中文27
到了中文电话里,还会叠加更多东西

每个 locale 都要重新做一遍

中文客服电话 · 真实生产流量 方言 口音 中英混说 数字与专有名词 8kHz 信道压缩 免提回声 多人同处一室 多语言不是给同一个模型多传一个 language code 每个语言与地区组合(locale)都要重新做选型、评测和失败归因。
MONEY QUOTE · 06
如果你的测试集只有 朗读、干净麦克风 和完整句子
那它测到的不是中文客服,只是中文 demo。「支持 70 种语言」和「70 种语言都能上生产」,中间隔着很远。
ACT VI / VII
EVAL
真正该测的不是能不能打断
很多团队评测打断,只测一个数字:用户一开口,Agent 多久停下。
这个数字当然重要,但只测它会奖励一种很危险的系统 —— 谁都能让它闭嘴。
I 噪声II 话轮III 证据IV 自建V 中文VI 评测VII 边界
ACT VI · 评测30
一套能上生产的打断评测,至少要同时看五件事

五个指标,缺一个就会被奖励错

误打断率 背景噪声、电视、狗叫、旁人说话,有多少次让 Agent 错误停下? 漏打断率 用户明确说「等等」「不是这个」时,有多少次 Agent 仍在继续? 说话人混淆 系统会不会把旁边人的话,当成主用户的指令? 附和误判率 「嗯」「对」「好的」有多少次被错误当成抢话? 恢复质量 被打断后能不能记住说到哪、接住新意图,而不是把整轮重置?
ACT VI · 评测31
场景也不能只放一条白噪声

评测场里,至少要有这八种声学情境

01
突发噪声
喇叭、关门、掉东西
02
持续背景声
车流、电视、商场
03
侧边人声
旁人说话、小孩插嘴
04
真实插话
「等等,不是这个」
05
Backchannel
「嗯」「对」「好的」
06
长停顿
想事情、翻单据
07
电话压缩
8kHz 信道与编解码
08
丢帧
真实线路的丢包抖动
最后还要回到任务结果:在这些条件下,Agent 到底有没有把事情办完。Sierra 做 Voice Sims,把背景噪声、DTMF(电话按键音)和打断追踪放进 CI/CD,本质上就是承认这一点。
MONEY QUOTE · 07
你的评测集 长得不像生产流量 它就不在替你的产品工作
语音质量不是发布前听几通电话,而是一套必须持续回归的产品工程。
ACT VII / VII
BOUNDARY
这条证据的边界在哪
这篇不能写成「OpenAI 董事长亲口承认 OpenAI 的语音模型不行」。
Bret 在访谈里说的是 "some of the advanced voice mode stuff",并没有点名某一家厂商。
I 噪声II 话轮III 证据IV 自建V 中文VI 评测VII 边界
ACT VII · 边界34
立场提示与核验边界 · 这一节不能省

他不是中立观察者

01没点名Bret 说的是 "some of the advanced voice mode stuff",没明确说是 OpenAI 的 Advanced Voice Mode。
02有立场Sierra 正在卖企业 Agent。他越能证明噪声、打断和多说话人很难,越能证明自研的价值。
03厂商自报「自研 VAD 优于他们知道的其他模型」是厂商自报,没有第三方横评。
04口径粤语与他加禄语那段是播客里的当事人口径,不能当成完整的市场排名。
能证明的边界:在 Sierra 面向大企业的真实语音场景里,当时的现成能力不够用,因此它选择了自建。它不能证明所有厂商都不行,也不能证明 VAD 永远不会商品化 —— 恰恰相反,Bret 自己就认为它会商品化。
收个尾35
看那些最有条件使用现成方案的公司,最后还在自己造什么

走到路边,它还得先过一道更朴素的关

模型已经能理解复杂政策、调用企业系统、完成高价值任务 Sierra 不自研基础语音模型,也不自建电话网络 但它偏偏自研了 VAD、多说话人检测和上下文判断 因为一声喇叭抢走的,不只是几百毫秒 —— 它会让系统判断错谁拥有话轮 眼前这个声音,到底是不是在跟我说话?
这个判断一旦错了,后面的推理、工具调用和语音合成再强,也没有机会发挥。
谢谢

眼前这个声音
是不是在跟我说话

判断技术成熟与否,我越来越少看它最好的 demo
Author姚光华 Colin · 2026.07
一手源Uncapped #42 · 24:29 · Sierra 博客 · μ-Bench
已核验250 通 / 4270 条 / 8kHz / 5 语言 / 5x
立场提示讲者是 Sierra CEO 兼 OpenAI 董事长,非中立观察者