第十二届中国网络视听大会 · 分论坛主题演讲

对话式 AI 驱动音频体验革新

音频,是这一代人机交互的入口
Conversational AI · Next-Generation Audio Experience
Venue第十二届中国网络视听大会
Date2025.03.28
Speaker姚光华 Colin · 声网 AI RTE 产品线负责人
Deck4 幕 · 24 页
提要 · OVERVIEW02
这场在讲什么

四段话,把音频体验这条线讲完

PART 1 对话式 AI 是什么 三个要素的关系 PART 2 里程碑与落地 谁在用,交付什么价值 PART 3 引擎怎么做到 多、快、好、省 PART 4 音频体验革新 听得到到听得清
对视听行业来说,最值得关注的不是模型变强了。是音频这条通道,第一次从「传输介质」变成了「交互本身」。
PART 1
DEFINE
对话式 AI 是什么
三个词经常被混着说:生成式 AI、实时互动、AI 音频。它们不是并列关系,是三个不同的位置。
01 对话式 AI 是什么 02 里程碑与落地 03 引擎怎么做到 04 音频体验革新
PART 1 · 三个要素04
各自站在什么位置

核心技术、基础设施、关键驱动

生成式 AI 核心技术 · 提供内容生成与创造能力 实时互动 基础设施与应用形式 · 落地最快的一条路 AI 音频 关键驱动 · 提升人机交互的自然度 对话式 AI Conversational AI 智能价值 情绪价值 时间价值 FOR END USERS
MONEY QUOTE · 01
生成式 AI 提供能力,实时互动提供基建,AI 音频提供体验。
三者不是并列的技术名词。谁站在哪个位置,决定了一个团队该往哪儿投入。
PART 2
MILESTONES
里程碑与落地
从别人的一次演示,到今天已经有服务类和陪伴类两条真实的落地路径。
01 对话式 AI 是什么 02 里程碑与落地 03 引擎怎么做到 04 音频体验革新
PART 2 · 十个月07
2024.05 – 2025.03

两个原点,一次国内首发,三次开门

2024.05.13 GPT-4o 对话式 AI To C 的原点 2024.10.01 Realtime API 对话式 AI To B 的原点 2024.10.24 RTE 2024 国内首个 Realtime API 2025.01.28 Private Beta 除夕 2025.02.18 Public Beta 雨水 2025.03.06 正式发布 全球首个对话式 AI 引擎 三个星期前,声网对话式 AI 引擎正式发布。今天讲的所有能力,都已经在线上跑
PART 2 · 落地形态08
对话式智能体当前有哪些行业应用

目前只分两类:办事的,和陪着的

Service Agents服务类智能体目标是把事办成。衡量它的是任务完成率、处理时长、一次解决率——交付的是智能价值和时间价值。
Companion Agents陪伴类智能体目标是让对方愿意继续说下去。衡量它的是时长、回访、情绪反馈——交付的是情绪价值。
两类智能体对音频的要求完全不同。一类要求听得准,一类要求听得出情绪。这是音频算法接下来最大的分岔。
PART 2 · 用户价值09
对话式智能体提供哪些价值

三种感受,对应三种价值

用户感受 情感共鸣 问题解决 效率跃升 对话式 Agent 用户价值 情绪价值 智能价值 时间价值
PART 3
ENGINE
引擎怎么做到
模型选择多、智能响应快、对话体验好、用起来省心更省钱。四个字,每个字后面都有能被验收的数。
01 对话式 AI 是什么 02 里程碑与落地 03 引擎怎么做到 04 音频体验革新
PART 3 · 架构11
From Perception to Intelligence

引擎负责最下面两层,也是最难的两层

顶层智能层 Top-tier Intelligence Layer · 高级认知与学习能力,并具备超高情商 任务处理层 Task Processing Layer · 面向目标的行动与处理能力,具备超高智商 模态融合层 Modal Fusion Layer · 针对感知后的内容进行统一的多模态理解和透传 模态感知层 Modal Perception Layer · 基础的视觉与音频处理和转换 对话式 AI 引擎 Conversational AI Engine SERVICE AGENTS · 智能价值 COMPANION AGENTS · 情绪价值
PART 3 · 产品架构12
产品架构图

RTE + AI:两股能力合流,才有这个引擎

RTE 实时传输 · 音频算法 · 抗弱网 AI ASR · LLM · TTS · 多模态理解 对话式 AI 引擎 模态感知 模态融合 服务类智能体 陪伴类智能体 把现实世界的声音变成模型能用的输入,再把模型的输出变回自然的声音 —— 这就是音频这条通道的全部工作
PART 3 · 总览13
多、快、好、省

四个字,每个字后面都有硬指标

智能多、音色多
全球几乎所有大模型厂商 + 全球主流语音合成供应商,任意切换
响应快、打断快
响应延迟中位数 650ms,打断延迟中位数 340ms
情商高、真拟人
优雅打断、选择性注意力锁定、无惧噪声弱网
开发省心更省钱
2 行代码 + 15 分钟接入,一分钟不到一毛钱
对视听行业来说,这四个字里最关键的是「好」。内容行业最先感知到的,永远是体验的毛刺。
PART 3 · 多 & 快14
选择权交给开发者 · 由奢入俭难

模型都能选,而且换了也一样快

模型与音色,都不锁定
只要和 OpenAI 接口协议兼容的模型厂商,全部原生支持;全球主流语音合成供应商任意切换,客户自己定制、克隆的音色也能上线。
响应快,更要打断快
超低延时方案,中、美、欧、东南亚主要城市实测,响应延迟中位数 650ms;超高智能 + 超强表现力方案,全球主要城市实测低至 1s。
650MS · 响应延迟中位数
340MS · 打断延迟中位数(任意方案)
延时会根据不同供应商的选择而浮动。这条口径写在这里,是给客户拿去做验收标准的,不是拿去做宣传的。
PART 3 · 好15
好 · 情商高、真拟人、无惧噪声弱网

三件事决定了它像不像一个能聊的人

01
优雅打断
任意模型接入即可做到「嘘」、「等等」、「闭嘴」的对话体验。根据人的对话节奏与内容,做出最拟人化的打断响应——「更懂你」。
02
选择性注意力锁定
对话人声锁定。当对话人处于现实世界、身边有不同人声干扰时,模型必须准确识别谁在和自己讲话——「听谁的」。
03
抗丢包、抗抖动
人模对话场景,除了抗丢包 80% 外,断网 3–5s 依旧流畅对话。人人对话场景,抗上下行丢包已达到 80%。
音频算法在这一代产品里的任务变了。过去是让声音更干净,现在是让模型知道该听谁的、什么时候闭嘴。
MONEY QUOTE · 02
把话筒,交给 Agent。
优雅打断解决「它什么时候该停」,选择性注意力锁定解决「它该听谁的」。两件事做到了,话筒才敢递过去。
PART 3 · 省17
省 · 开发省心,用起来省钱

2 行代码 + 15 分钟,一分钟不到一毛钱

Console 登录 Playground LLM 填入 Key & URL TTS 填入 Key & URL 立即体验 实测智能与音色 View Code 生成服务端代码 Server API 复制 · 调用 · Debug 在你的服务器调用这些代码,就可以直接在任意 App 中商用
从 Console 到任意模型对你开口 Say Hi,只需要 2 行代码 + 15 分钟不是简单的文字游戏——这条路径的每一步都能在 Playground 里当场跑一遍。
PART 4
AUDIO
音频体验革新
最后回到这场的题目:对话式 AI 到底把音频体验推到了哪一步。
01 对话式 AI 是什么 02 里程碑与落地 03 引擎怎么做到 04 音频体验革新
PART 4 · 切题19
技术变革 × 体验革新

同一条线上,服务对象换了一次

听得到 Hearing QoS VAD · 2014–2019 听得清 Hearing Clearly QoE AI-VAD · 2020 AI QoE 2024 MM-AI QoE 2025 – 未来 对话式 AI 引擎 面向人类设计 面向模型设计 体验革新 技术变革
MONEY QUOTE · 03
从面向人类设计,到面向模型设计。
VAD 是为人听得到而生的,AI-VAD 是为人听得清而生的。到了对话式 AI 引擎这一代,音频算法第一次把模型当成用户。
PART 4 · 收束21
回归用户价值

技术往前走一步,是为了换回三种价值

情感共鸣
情绪价值
陪伴类智能体交付的东西,是对方愿意继续说下去。
问题解决
智能价值
服务类智能体交付的东西,是这件事真的办成了。
效率跃升
时间价值
把原本要等、要排队、要重复的过程压掉。
声网为客户创造的价值,最终只落在这三格里。音频体验革新不是目的,是抵达这三格的必经之路。
MONEY QUOTE · 04
对话式 Agent,创业者最好的选择。
模型和音色都能换,响应 650ms、打断 340ms,一分钟不到一毛钱。剩下的事,交给做内容的人自己去想。
带走 · TAKEAWAYS23
今天能带走的三件事

如果只记三句

01
音频是关键驱动
生成式 AI 提供能力,实时互动提供基建,AI 音频提供体验。对视听行业来说,第三个位置最值得投入。
02
两类智能体,两套尺子
服务类看任务办没办成,陪伴类看对方愿不愿意继续说。别用同一套指标验收。
03
音频算法换了用户
从让人听得清,到让模型知道该听谁的、什么时候闭嘴。这是这一代最大的变化。
对话式 AI 驱动的这轮音频体验革新,起点是听得到,今天走到听得清。往后每一步,都是在为模型和人共同设计。
第十二届中国网络视听大会 · 演讲结束

谢谢各位的时间

希望和大家一起持续学习,共同进步
Venue第十二届中国网络视听大会
Date2025.03.28
Archive演讲档案 04 · 原稿 25 页
Note本 deck 已剔除空页与致谢页,按主线重排