RTE 2024 · 声网年度大会 · AI 专场
生成式 AI 驱动实时互动
技术变革与体验革新
Generative AI × Real-Time Engagement
Venue
RTE 2024 · AI 专场
Date
2024.10.25
Speaker
姚光华 Colin · 声网 AI RTE 产品线负责人
Deck
4 幕 · 31 页
提要 · OVERVIEW
02
这场在讲什么
四个部分,一条线:RTE 到底在为谁设计
PART 1
体验的十年
RTE 是干什么的
PART 2
产品矩阵变迁
新增了什么产品
PART 3
接入架构拆解
怎么把模型接进来
PART 4
为模型设计
今天只讲一件事
今年是声网成立第十年。
从 Day 1 谈 QoS,到 2019-2020 谈 QoE,再到今天谈 AI QoE。
PART 1
DECADE
体验的十年 2014 – 2024
先把 RTE 这十年抽象成一条线:QoS 保证传得到,QoE 保证用得爽,AI QoE 开始为模型设计。
01 体验的十年
02 产品矩阵变迁
03 接入架构拆解
04 为模型设计
PART 1 · 体验的十年
04
一张图看完十年
同一件事被问了三遍:这个体验,是为谁设计的
QoS
2014 – 2019 · SLA
为硬件与网络设计
QoE
2020 – 至今 · XLA
为人设计
AI QoE
2024 – · 跨模态
为人和模型设计
RTC
RTE
AI RTE
十年里产品形态换了两次名字:
RTC → RTE → AI RTE
。真正变的不是名字,是
「体验为谁而设计」
这个答案。
PART 1 · QoS
05
2014 – 2019 · SLA 时代
QoS:先把 100 分的内容,原样送到对面
01
产品形态
RTC(Real-Time Communication)—— 实时通话场景下的服务质量保证
02
关键词
高保真、传输。确保音视频数据包的无损、无中断,减少丢包、延迟与抖动
03
衡量方式
SLA 服务水平协议:服务时长每五分钟切片,登录成功率低于 99% 即判定这 5 分钟不可用;不可用时长 ÷ 总服务时长 = 可用性
这个时代衡量的是「技术够不够强」。
关键词是可用——登录得上、传得过去、还原得回来。
PART 1 · QoE
06
2020 – 至今 · XLA 时代
QoE:登录得上,不等于用得爽
01
产品形态
RTE(Real-Time Engagement),涵盖 RTC、RTM、RTSC 等核心产品
02
关键词
终端用户体验、前后处理算法
03
标志事件
2020 年声网提出 XLA(体验等级协议)
04
衡量方式
不再只看登录成功率,扩展到 400ms 端到端延迟达标率、音频卡顿率、视频卡顿率等体验指标
这个时代衡量的是「用户用着好不好」。
从 SLA 到 XLA,衡量对象从系统换成了人。
PART 1 · QoS vs QoE
07
同一条链路,两种目标
一个无限逼近 100 分,一个要做到 120 分
QOS · 高保真传输
100
发送端
无损传输
99.99
接收端
音频进音频出,视频进视频出,文本进文本出
模态不发生变化,追求的是无限逼近发送端
QOE · 前后处理算法
100
采集内容
RTC Pipeline
120
超越预期 WOW
不只是「技术不错」,而是「体验很好」
高级前后处理算法把原本 100 分的内容做到 120 分
MONEY QUOTE · 01
QoS 是为硬件和网络设计的,
QoE 是为人设计的。
前者关键是可用,后者关键是用户用着好。这句话决定了后面十年所有产品的重心往哪边挪。
PART 1 · AI QoE
09
2024 – · 跨模态 / 多模态
音频进文本出,已经不是可能性,是既定事实
INPUT
音频
视频
文本
生成式 AI
跨模态转换
OUTPUT
音频
视频
文本
100 分 进 · ?分 出
内容质量已经不再受控于采集、编码、传输、解码这条传统 Pipeline——
模型本身重度参与并决定了体验水平
。所以 AI RTE 的规划重心必须从
为人设计
转为
为人和模型设计
。
PART 1 · 小结
10
十年三段,一张表收
同模态 QoS → 同模态 QoE → 跨模态 AI QoE
时代
IN
聚焦
OUT
为谁设计
同模态 QoS
音频 / 视频 / 文本
无损、无中断、高保真传输
同模态原样输出
硬件与网络
同模态 QoE
音频 / 视频 / 文本
端到端延迟、卡顿率等用户体验
同模态原样输出
人类
跨模态 AI QoE
音频 / 视频 / 文本
多模态交互、跨模态转换
任意模态自由组合
人类和模型
输入是音频,输出可以是文本;输入是视频,输出可以是音频。
模态的边界,第一次被打开。
PART 2
MATRIX
AI RTE 产品矩阵变迁
十年沉淀出的那张产品矩阵图,在生成式 AI 面前被改了两次。改的地方,就是我们对未来的判断。
01 体验的十年
02 产品矩阵变迁
03 接入架构拆解
04 为模型设计
PART 2 · 起点
12
RTE Standalone · 2024 年之前
十年沉淀,长成这样一张五层矩阵
05
方案层
社交娱乐 / 在线教育 / 智能硬件 / 数字化转型 / 直播电商 / 出海
Solution
04
工具层
灵动课堂 / 声动互娱 / 灵隼物联网云平台 / 会议 aPaaS / UIKit
Tools
03
扩展层
录制、转码等围绕核心能力的扩展模块
Extension
02
核心层
音频通话 / 视频通话 / 互动直播 / 极速直播 / 融合 CDN 直播 / RTM 云信令
Core
01
基建层
SD-RTN™ 软件定义实时网(公有云 / 私有云 / 混合云)
Infra
这张图能解释「RTE 是干什么的」,但它解释不了下一年涌进来的新需求。
PART 2 · 第一次改图
13
AI RTE Prototype Draft v1.0
GPT 发布之后,四层同时长出新东西
Infrastructure
基建层
开始出现 Storage / Dataset、GPU 与 CPU 资源
Core
核心层
出现只有生成式 AI 才会有的模块:Function Call、RAG、Reviser
Tools
工具层
涌现出一批 Agent 编排工具,如 Graph Designer
Solutions
方案层
不再拘泥于语聊、直播:AI 会议纪要、口语老师、AI Bot
新增需求已经从 RTE 变成 AI RTE。
问题不是「AI 能不能增强 QoE」,而是「AI 要不要重新定义这张图」。
PART 2 · 今天的形态
14
AI RTE Prototype v8.0
三个新产品,撑起「为模型设计」这件事
01
AI Streaming Service
面向大模型厂商的协议与格式转换服务,把 RTE 的流送进 WebSocket 世界
02
Linux Server SDK for AI
为服务端而生的低阶 SDK,让客户集群直接推拉流,天然带 RTE 的 QoE 保证
03
AI-AED
AI 声学事件检测。本场最后一部分,它会变成第一个为模型设计的核心算法
分层上,AI RTE 已经具备 AI 时代所需要的
基建 / 核心产品 / 核心服务 / 对外 API
,底座换成 Serverless GPU Infra for AI。
MONEY QUOTE · 02
AI 不再只是 QoE 的增强器,
它开始重新定义整张产品矩阵。
从「把 AI 用在前后处理算法里」,到「AI 成为实时互动产品矩阵的核心构成」——这是两件不同量级的事。
PART 3
ACCESS
AI RTE 接入架构拆解
最佳实践只有两类:客户自有大模型走架构 A,大模型厂商的 To B 平台走架构 B。
01 体验的十年
02 产品矩阵变迁
03 接入架构拆解
04 为模型设计
PART 3 · 接入架构 A
17
面向自有大模型的 To C 应用开发企业
端侧 SDK + Linux Server SDK for AI
终端 App
iOS / Android / Flutter
CLIENT SDK
SD-RTN™
音视频流与信令
REAL-TIME NETWORK
客户业务集群
Linux Server SDK for AI
PULL & PUSH
自有大模型
LLM Cluster
CUSTOMER OWNED
接入架构 A · 通过 PULL-PUSH 机制连接模型与用户
Linux SDK 从多年前就坚持是
为服务端而生
的:保持 Low Level API 面向开发者,可以灵活部署成内部 Service。
所以产品名一直叫 Linux Server SDK,而不是 Linux Client SDK。
PART 3 · SDK 分层
18
Linux Server SDK for AI · Cores
把 RTE 的能力,拆成模型开发者会用的三层
LAYER 3
Scenario API
针对 AI RTE 场景做特化:AI Scenario API (Python / Go / Rust),让后端开发者更快接进自己的服务
LAYER 2
Language Binding API
适配模型开发、生产、运营环节最广泛使用的语言:Python、Go、Rust、Java
LAYER 1
Low-Level API
C / C++ API 与算法接口层,保持简洁、功能明确,面向底层开发者
分层的本质,是把 RTE 的功能和算法翻译成模型世界的语言。
PART 3 · 接入架构 B
19
面向大模型厂商的 To B 平台
AI Streaming Service:做 RTC 与 WebSocket 的翻译
终端 App
音频 / 视频 / 信令
SD-RTN™
AUT 传输
AI Streaming Service
Message Converter
WebSocket Service
全球就近部署 · 高可用
WebSocket
大模型平台
LLMs Cluster
接入架构 B · 内容不变,只换协议
开发者不再需要在服务端集成 Linux Server SDK。
本质是内容不变、协议转换
——因为大部分大模型公司用的是 WebSocket,而实时对话的采集播放全链路,RTC 方案最优。
MONEY QUOTE · 03
这其实是过渡期的方案,
因为标准还没有被定义。
针对人与模型实时互动的场景,会迈向新的协议、新的接口、新的标准。声网希望和行业一起定义它。
PART 4
INTENTION
体验的十年 2024 –
如果今天我只讲一件事,可能就是这件事:声网为模型设计的第一个产品,是什么。
01 体验的十年
02 产品矩阵变迁
03 接入架构拆解
04 为模型设计
PART 4 · Conversational AI Agent
22
先讲「快」
级联大模型时代:ASR + LLM + TTS 编排出对话
端侧采集
前处理 · 编码
SD-RTN™
智能路由 · 抗弱网
ASR
语音转文本
LLM
内容生成
TTS
文本转语音
端侧播放
解码 · 渲染
RTC 链路 115.25ms
级联模型约 440ms
这样的产品,核心体验是
又快又好
。目前大部分场景下延迟已经压缩到
平均 700ms、最低近 500ms
。
PART 4 · E2E 延迟
23
iOS 极限方案 · 全链路分段拆解
RTE 只占 115.25ms,剩下的都在模型里
555.25
MS · iOS 最低 E2E
从录音输入到扬声器输出的完整链路
115.25
MS · RTC 全链路
含采集、3A、编解码、传输、Jitter Buffer、播放
440
MS · 级联模型环节
STT 180~250ms + 句子聚合 150ms + TTS 40~110ms
网络传输本身只有
10ms
(全球 70ms),Opus 编码 6.25ms、解码 1ms,Jitter Buffer 20ms。
声网还在继续压这个数字,让均值稳定到 500ms 的水平。
PART 4 · 再讲「好」
24
加上 VAD 之后,新问题来了
人能打断模型之后,模型开始疯狂打断人
没有 VAD
模型说完你才能说
业内很多对话式智能助手不能自然打断,只能一问一答,轮流讲话。
加了 VAD
人可以随时打断模型
但模型不知道人什么时候把话讲完——在超低延迟的自由对话里,它会疯狂打断人类。
问题的本质
人人对话时,为了把一件事讲清楚,通常会有铺垫。
只有 VAD 是完全不够的
——模型需要从「听得懂内容」进一步变成「在倾听这个人」,才谈得上交流和共鸣。
MONEY QUOTE · 04
自然打断,
自如对话。
我说「有事等我一下」,它安静下来;我「嘘」一声,它立刻停;我说 OK,它立刻接上。这是人模对话中最重要的那条 QoE。
PART 4 · AI-AED
26
回到 2022 Q4 的那张规划
「如果只做一件事,做哪件?」——声学事件检测
01
当时的判断
降噪已经是既定的三年战略路线;声学事件检测是产品角度的第一优先级,要在 2023 年交付
02
当时的思路
视频算法已经有动捕、面捕,开始转向内容检测;而音频还没有类似的算法
03
当时的定位
AI-VAD + AI-MD 作为 AI-NS、AI-AEC 的增强器,从 Input 开始为降噪做筛选和分类
04
端侧链路
ADC 输入 → AED 事件识别与分类 → 3A 降噪回声消除增益 → 虚拟声卡(AI 调音器)→ 网络与上报 → App
诞生之初,AI-AED 只是一个「让声音听得清」的端侧功能。
PART 4 · HIP
27
把 AI-AED 搬到服务端之后
HIP:第一个为模型设计的核心算法
AI-AED
声学事件检测
AI-VAD · AI-MD · AI-ANS
DETECTION
+
MSU
多模态语音理解
Multi-Modal Speech Understanding
UNDERSTANDING
HIP
Human Intention Prediction
对人类实时意图的预测
PREDICTION
模型
何时该听
何时该说
通过 AED 的 Detection,加上 MSU 的 Understanding,最终变成 HIP 的 Prediction。
模型可以根据这份预测,自己决定什么时候保持倾听、什么时候开口。
PART 4 · 切题
28
技术变革 × 体验革新
听得到 → 听得清 → 听得懂 → 听「得心」
听得到
Hearing
QoS
VAD
听得清
Hearing Clearly
QoE
AI-VAD
听得懂
Fully Understanding
QoE + ASR
AI-AED
听得心
Understanding Thoroughly
QoE + HIP + LLM
HIP · 今天发布
体验革新
技术变革
人人对话从听得到走到听得清;人模对话直接从听得懂起步——模型 Day 1 就具备了听得到和听得清
MONEY QUOTE · 05
有些话,讲给朋友和讲给大模型,
一定是不一样的。
因为你已经预设了对面不是人,而是工具,就无法发自肺腑地铺垫和陈述。模型要从理解内容,变成理解心理与情绪,最终理解人类意图。
带走 · TAKEAWAYS
30
今天能带走的三件事
如果只记三句
01
先问「为谁设计」
QoS 为硬件和网络,QoE 为人,AI QoE 为人和模型。判断一个 AI 实时产品好不好,先问它把谁当用户。
02
延迟的账要拆开算
iOS 最低 555.25ms 里,RTC 只占 115.25ms。优化对象在哪一段,决定了你该找谁。
03
VAD 远远不够
自然打断只是起点。让模型知道人什么时候讲完,需要 AED 的检测 + MSU 的理解 = HIP 的预测。
在生成式 AI 的推动下,实时互动体验正迈向一个全新的高度。
我们不只在提升技术性能,更是在重塑人与技术的沟通方式。
RTE 2024 · AI 专场 · 演讲结束
携手,见证无限可能
生成式 AI 驱动的实时互动
Venue
RTE 2024 · 声网年度大会 AI 专场
Date
2024.10.25
Archive
演讲档案 01 · 原稿 33 页
Note
本 deck 已剔除视频页与空页,按主线重排
EDIT
浅底