第十二届中国网络视听大会 · 分论坛主题演讲
对话式 AI 驱动音频体验革新
音频,是这一代人机交互的入口
Conversational AI · Next-Generation Audio Experience
Venue
第十二届中国网络视听大会
Date
2025.03.28
Speaker
姚光华 Colin · 声网 AI RTE 产品线负责人
Deck
4 幕 · 24 页
提要 · OVERVIEW
02
这场在讲什么
四段话,把音频体验这条线讲完
PART 1
对话式 AI 是什么
三个要素的关系
PART 2
里程碑与落地
谁在用,交付什么价值
PART 3
引擎怎么做到
多、快、好、省
PART 4
音频体验革新
听得到到听得清
对视听行业来说,最值得关注的不是模型变强了。
是音频这条通道,第一次从「传输介质」变成了「交互本身」。
PART 1
DEFINE
对话式 AI 是什么
三个词经常被混着说:生成式 AI、实时互动、AI 音频。它们不是并列关系,是三个不同的位置。
01 对话式 AI 是什么
02 里程碑与落地
03 引擎怎么做到
04 音频体验革新
PART 1 · 三个要素
04
各自站在什么位置
核心技术、基础设施、关键驱动
生成式 AI
核心技术 · 提供内容生成与创造能力
实时互动
基础设施与应用形式 · 落地最快的一条路
AI 音频
关键驱动 · 提升人机交互的自然度
对话式 AI
Conversational AI
智能价值
情绪价值
时间价值
FOR END USERS
MONEY QUOTE · 01
生成式 AI 提供能力,
实时互动提供基建,
AI 音频提供体验。
三者不是并列的技术名词。谁站在哪个位置,决定了一个团队该往哪儿投入。
PART 2
MILESTONES
里程碑与落地
从别人的一次演示,到今天已经有服务类和陪伴类两条真实的落地路径。
01 对话式 AI 是什么
02 里程碑与落地
03 引擎怎么做到
04 音频体验革新
PART 2 · 十个月
07
2024.05 – 2025.03
两个原点,一次国内首发,三次开门
2024.05.13
GPT-4o
对话式 AI To C 的原点
2024.10.01
Realtime API
对话式 AI To B 的原点
2024.10.24
RTE 2024
国内首个 Realtime API
2025.01.28
Private Beta
除夕
2025.02.18
Public Beta
雨水
2025.03.06
正式发布
全球首个对话式 AI 引擎
三个星期前,声网对话式 AI 引擎正式发布。今天讲的所有能力,都已经在线上跑
PART 2 · 落地形态
08
对话式智能体当前有哪些行业应用
目前只分两类:办事的,和陪着的
Service Agents
服务类智能体
目标是把事办成。衡量它的是任务完成率、处理时长、一次解决率——交付的是智能价值和时间价值。
Companion Agents
陪伴类智能体
目标是让对方愿意继续说下去。衡量它的是时长、回访、情绪反馈——交付的是情绪价值。
两类智能体对音频的要求完全不同。
一类要求听得准,一类要求听得出情绪。这是音频算法接下来最大的分岔。
PART 2 · 用户价值
09
对话式智能体提供哪些价值
三种感受,对应三种价值
用户感受
情感共鸣
问题解决
效率跃升
对话式
Agent
用户价值
情绪价值
智能价值
时间价值
PART 3
ENGINE
引擎怎么做到
模型选择多、智能响应快、对话体验好、用起来省心更省钱。四个字,每个字后面都有能被验收的数。
01 对话式 AI 是什么
02 里程碑与落地
03 引擎怎么做到
04 音频体验革新
PART 3 · 架构
11
From Perception to Intelligence
引擎负责最下面两层,也是最难的两层
顶层智能层
Top-tier Intelligence Layer · 高级认知与学习能力,并具备超高情商
任务处理层
Task Processing Layer · 面向目标的行动与处理能力,具备超高智商
模态融合层
Modal Fusion Layer · 针对感知后的内容进行统一的多模态理解和透传
模态感知层
Modal Perception Layer · 基础的视觉与音频处理和转换
对话式 AI 引擎
Conversational AI Engine
SERVICE AGENTS · 智能价值
COMPANION AGENTS · 情绪价值
PART 3 · 产品架构
12
产品架构图
RTE + AI:两股能力合流,才有这个引擎
RTE
实时传输 · 音频算法 · 抗弱网
AI
ASR · LLM · TTS · 多模态理解
对话式 AI 引擎
模态感知
模态融合
服务类智能体
陪伴类智能体
把现实世界的声音变成模型能用的输入,再把模型的输出变回自然的声音 —— 这就是音频这条通道的全部工作
PART 3 · 总览
13
多、快、好、省
四个字,每个字后面都有硬指标
多
智能多、音色多
全球几乎所有大模型厂商 + 全球主流语音合成供应商,任意切换
快
响应快、打断快
响应延迟中位数 650ms,打断延迟中位数 340ms
好
情商高、真拟人
优雅打断、选择性注意力锁定、无惧噪声弱网
省
开发省心更省钱
2 行代码 + 15 分钟接入,一分钟不到一毛钱
对视听行业来说,这四个字里最关键的是「好」。
内容行业最先感知到的,永远是体验的毛刺。
PART 3 · 多 & 快
14
选择权交给开发者 · 由奢入俭难
模型都能选,而且换了也一样快
多
模型与音色,都不锁定
只要和 OpenAI 接口协议兼容的模型厂商,全部原生支持;全球主流语音合成供应商任意切换,客户自己定制、克隆的音色也能上线。
快
响应快,更要打断快
超低延时方案,中、美、欧、东南亚主要城市实测,响应延迟中位数 650ms;超高智能 + 超强表现力方案,全球主要城市实测低至 1s。
650
MS · 响应延迟中位数
340
MS · 打断延迟中位数(任意方案)
延时会根据不同供应商的选择而浮动。
这条口径写在这里,是给客户拿去做验收标准的,不是拿去做宣传的。
PART 3 · 好
15
好 · 情商高、真拟人、无惧噪声弱网
三件事决定了它像不像一个能聊的人
01
优雅打断
任意模型接入即可做到「嘘」、「等等」、「闭嘴」的对话体验。根据人的对话节奏与内容,做出最拟人化的打断响应——「更懂你」。
02
选择性注意力锁定
对话人声锁定。当对话人处于现实世界、身边有不同人声干扰时,模型必须准确识别谁在和自己讲话——「听谁的」。
03
抗丢包、抗抖动
人模对话场景,除了抗丢包 80% 外,断网 3–5s 依旧流畅对话。人人对话场景,抗上下行丢包已达到 80%。
音频算法在这一代产品里的任务变了。
过去是让声音更干净,现在是让模型知道该听谁的、什么时候闭嘴。
MONEY QUOTE · 02
把话筒,
交给 Agent。
优雅打断解决「它什么时候该停」,选择性注意力锁定解决「它该听谁的」。两件事做到了,话筒才敢递过去。
PART 3 · 省
17
省 · 开发省心,用起来省钱
2 行代码 + 15 分钟,一分钟不到一毛钱
Console
登录 Playground
LLM
填入 Key & URL
TTS
填入 Key & URL
立即体验
实测智能与音色
View Code
生成服务端代码
Server API
复制 · 调用 · Debug
在你的服务器调用这些代码,就可以直接在任意 App 中商用
从 Console 到任意模型对你开口 Say Hi,只需要
2 行代码 + 15 分钟
。
不是简单的文字游戏
——这条路径的每一步都能在 Playground 里当场跑一遍。
PART 4
AUDIO
音频体验革新
最后回到这场的题目:对话式 AI 到底把音频体验推到了哪一步。
01 对话式 AI 是什么
02 里程碑与落地
03 引擎怎么做到
04 音频体验革新
PART 4 · 切题
19
技术变革 × 体验革新
同一条线上,服务对象换了一次
听得到
Hearing
QoS
VAD · 2014–2019
听得清
Hearing Clearly
QoE
AI-VAD · 2020
AI QoE
2024
MM-AI QoE
2025 – 未来
对话式 AI 引擎
面向人类设计
面向模型设计
体验革新
技术变革
MONEY QUOTE · 03
从面向人类设计,
到面向模型设计。
VAD 是为人听得到而生的,AI-VAD 是为人听得清而生的。到了对话式 AI 引擎这一代,音频算法第一次把模型当成用户。
PART 4 · 收束
21
回归用户价值
技术往前走一步,是为了换回三种价值
情感共鸣
情绪价值
陪伴类智能体交付的东西,是对方愿意继续说下去。
问题解决
智能价值
服务类智能体交付的东西,是这件事真的办成了。
效率跃升
时间价值
把原本要等、要排队、要重复的过程压掉。
声网为客户创造的价值,最终只落在这三格里。
音频体验革新不是目的,是抵达这三格的必经之路。
MONEY QUOTE · 04
对话式 Agent,
创业者最好的选择。
模型和音色都能换,响应 650ms、打断 340ms,一分钟不到一毛钱。剩下的事,交给做内容的人自己去想。
带走 · TAKEAWAYS
23
今天能带走的三件事
如果只记三句
01
音频是关键驱动
生成式 AI 提供能力,实时互动提供基建,AI 音频提供体验。对视听行业来说,第三个位置最值得投入。
02
两类智能体,两套尺子
服务类看任务办没办成,陪伴类看对方愿不愿意继续说。别用同一套指标验收。
03
音频算法换了用户
从让人听得清,到让模型知道该听谁的、什么时候闭嘴。这是这一代最大的变化。
对话式 AI 驱动的这轮音频体验革新,起点是听得到,今天走到听得清。
往后每一步,都是在为模型和人共同设计。
第十二届中国网络视听大会 · 演讲结束
谢谢各位的时间
希望和大家一起持续学习,共同进步
Venue
第十二届中国网络视听大会
Date
2025.03.28
Archive
演讲档案 04 · 原稿 25 页
Note
本 deck 已剔除空页与致谢页,按主线重排
EDIT
浅底