RTE 2024 · 声网年度大会 · AI 专场

生成式 AI 驱动实时互动

技术变革与体验革新
Generative AI × Real-Time Engagement
VenueRTE 2024 · AI 专场
Date2024.10.25
Speaker姚光华 Colin · 声网 AI RTE 产品线负责人
Deck4 幕 · 31 页
提要 · OVERVIEW02
这场在讲什么

四个部分,一条线:RTE 到底在为谁设计

PART 1 体验的十年 RTE 是干什么的 PART 2 产品矩阵变迁 新增了什么产品 PART 3 接入架构拆解 怎么把模型接进来 PART 4 为模型设计 今天只讲一件事
今年是声网成立第十年。从 Day 1 谈 QoS,到 2019-2020 谈 QoE,再到今天谈 AI QoE。
PART 1
DECADE
体验的十年 2014 – 2024
先把 RTE 这十年抽象成一条线:QoS 保证传得到,QoE 保证用得爽,AI QoE 开始为模型设计。
01 体验的十年 02 产品矩阵变迁 03 接入架构拆解 04 为模型设计
PART 1 · 体验的十年04
一张图看完十年

同一件事被问了三遍:这个体验,是为谁设计的

QoS 2014 – 2019 · SLA 为硬件与网络设计 QoE 2020 – 至今 · XLA 为人设计 AI QoE 2024 – · 跨模态 为人和模型设计 RTC RTE AI RTE
十年里产品形态换了两次名字:RTC → RTE → AI RTE。真正变的不是名字,是「体验为谁而设计」这个答案。
PART 1 · QoS05
2014 – 2019 · SLA 时代

QoS:先把 100 分的内容,原样送到对面

01产品形态RTC(Real-Time Communication)—— 实时通话场景下的服务质量保证
02关键词高保真、传输。确保音视频数据包的无损、无中断,减少丢包、延迟与抖动
03衡量方式SLA 服务水平协议:服务时长每五分钟切片,登录成功率低于 99% 即判定这 5 分钟不可用;不可用时长 ÷ 总服务时长 = 可用性
这个时代衡量的是「技术够不够强」。关键词是可用——登录得上、传得过去、还原得回来。
PART 1 · QoE06
2020 – 至今 · XLA 时代

QoE:登录得上,不等于用得爽

01产品形态RTE(Real-Time Engagement),涵盖 RTC、RTM、RTSC 等核心产品
02关键词终端用户体验、前后处理算法
03标志事件2020 年声网提出 XLA(体验等级协议)
04衡量方式不再只看登录成功率,扩展到 400ms 端到端延迟达标率、音频卡顿率、视频卡顿率等体验指标
这个时代衡量的是「用户用着好不好」。从 SLA 到 XLA,衡量对象从系统换成了人。
PART 1 · QoS vs QoE07
同一条链路,两种目标

一个无限逼近 100 分,一个要做到 120 分

QOS · 高保真传输 100 发送端 无损传输 99.99 接收端 音频进音频出,视频进视频出,文本进文本出 模态不发生变化,追求的是无限逼近发送端 QOE · 前后处理算法 100 采集内容 RTC Pipeline 120 超越预期 WOW 不只是「技术不错」,而是「体验很好」 高级前后处理算法把原本 100 分的内容做到 120 分
MONEY QUOTE · 01
QoS 是为硬件和网络设计的,QoE 是为人设计的。
前者关键是可用,后者关键是用户用着好。这句话决定了后面十年所有产品的重心往哪边挪。
PART 1 · AI QoE09
2024 – · 跨模态 / 多模态

音频进文本出,已经不是可能性,是既定事实

INPUT 音频 视频 文本 生成式 AI 跨模态转换 OUTPUT 音频 视频 文本 100 分 进 · ?分 出
内容质量已经不再受控于采集、编码、传输、解码这条传统 Pipeline——模型本身重度参与并决定了体验水平。所以 AI RTE 的规划重心必须从为人设计转为为人和模型设计
PART 1 · 小结10
十年三段,一张表收

同模态 QoS → 同模态 QoE → 跨模态 AI QoE

时代IN聚焦OUT为谁设计
同模态 QoS音频 / 视频 / 文本无损、无中断、高保真传输同模态原样输出硬件与网络
同模态 QoE音频 / 视频 / 文本端到端延迟、卡顿率等用户体验同模态原样输出人类
跨模态 AI QoE音频 / 视频 / 文本多模态交互、跨模态转换任意模态自由组合人类和模型
输入是音频,输出可以是文本;输入是视频,输出可以是音频。模态的边界,第一次被打开。
PART 2
MATRIX
AI RTE 产品矩阵变迁
十年沉淀出的那张产品矩阵图,在生成式 AI 面前被改了两次。改的地方,就是我们对未来的判断。
01 体验的十年 02 产品矩阵变迁 03 接入架构拆解 04 为模型设计
PART 2 · 起点12
RTE Standalone · 2024 年之前

十年沉淀,长成这样一张五层矩阵

05方案层社交娱乐 / 在线教育 / 智能硬件 / 数字化转型 / 直播电商 / 出海Solution
04工具层灵动课堂 / 声动互娱 / 灵隼物联网云平台 / 会议 aPaaS / UIKitTools
03扩展层录制、转码等围绕核心能力的扩展模块Extension
02核心层音频通话 / 视频通话 / 互动直播 / 极速直播 / 融合 CDN 直播 / RTM 云信令Core
01基建层SD-RTN™ 软件定义实时网(公有云 / 私有云 / 混合云)Infra
这张图能解释「RTE 是干什么的」,但它解释不了下一年涌进来的新需求。
PART 2 · 第一次改图13
AI RTE Prototype Draft v1.0

GPT 发布之后,四层同时长出新东西

Infrastructure
基建层
开始出现 Storage / Dataset、GPU 与 CPU 资源
Core
核心层
出现只有生成式 AI 才会有的模块:Function Call、RAG、Reviser
Tools
工具层
涌现出一批 Agent 编排工具,如 Graph Designer
Solutions
方案层
不再拘泥于语聊、直播:AI 会议纪要、口语老师、AI Bot
新增需求已经从 RTE 变成 AI RTE。问题不是「AI 能不能增强 QoE」,而是「AI 要不要重新定义这张图」。
PART 2 · 今天的形态14
AI RTE Prototype v8.0

三个新产品,撑起「为模型设计」这件事

01
AI Streaming Service
面向大模型厂商的协议与格式转换服务,把 RTE 的流送进 WebSocket 世界
02
Linux Server SDK for AI
为服务端而生的低阶 SDK,让客户集群直接推拉流,天然带 RTE 的 QoE 保证
03
AI-AED
AI 声学事件检测。本场最后一部分,它会变成第一个为模型设计的核心算法
分层上,AI RTE 已经具备 AI 时代所需要的基建 / 核心产品 / 核心服务 / 对外 API,底座换成 Serverless GPU Infra for AI。
MONEY QUOTE · 02
AI 不再只是 QoE 的增强器,它开始重新定义整张产品矩阵。
从「把 AI 用在前后处理算法里」,到「AI 成为实时互动产品矩阵的核心构成」——这是两件不同量级的事。
PART 3
ACCESS
AI RTE 接入架构拆解
最佳实践只有两类:客户自有大模型走架构 A,大模型厂商的 To B 平台走架构 B。
01 体验的十年 02 产品矩阵变迁 03 接入架构拆解 04 为模型设计
PART 3 · 接入架构 A17
面向自有大模型的 To C 应用开发企业

端侧 SDK + Linux Server SDK for AI

终端 App iOS / Android / Flutter CLIENT SDK SD-RTN™ 音视频流与信令 REAL-TIME NETWORK 客户业务集群 Linux Server SDK for AI PULL & PUSH 自有大模型 LLM Cluster CUSTOMER OWNED 接入架构 A · 通过 PULL-PUSH 机制连接模型与用户
Linux SDK 从多年前就坚持是为服务端而生的:保持 Low Level API 面向开发者,可以灵活部署成内部 Service。所以产品名一直叫 Linux Server SDK,而不是 Linux Client SDK。
PART 3 · SDK 分层18
Linux Server SDK for AI · Cores

把 RTE 的能力,拆成模型开发者会用的三层

LAYER 3Scenario API针对 AI RTE 场景做特化:AI Scenario API (Python / Go / Rust),让后端开发者更快接进自己的服务
LAYER 2Language Binding API适配模型开发、生产、运营环节最广泛使用的语言:Python、Go、Rust、Java
LAYER 1Low-Level APIC / C++ API 与算法接口层,保持简洁、功能明确,面向底层开发者
分层的本质,是把 RTE 的功能和算法翻译成模型世界的语言。
PART 3 · 接入架构 B19
面向大模型厂商的 To B 平台

AI Streaming Service:做 RTC 与 WebSocket 的翻译

终端 App 音频 / 视频 / 信令 SD-RTN™ AUT 传输 AI Streaming Service Message Converter WebSocket Service 全球就近部署 · 高可用 WebSocket 大模型平台 LLMs Cluster 接入架构 B · 内容不变,只换协议
开发者不再需要在服务端集成 Linux Server SDK。本质是内容不变、协议转换——因为大部分大模型公司用的是 WebSocket,而实时对话的采集播放全链路,RTC 方案最优。
MONEY QUOTE · 03
这其实是过渡期的方案,因为标准还没有被定义。
针对人与模型实时互动的场景,会迈向新的协议、新的接口、新的标准。声网希望和行业一起定义它。
PART 4
INTENTION
体验的十年 2024 –
如果今天我只讲一件事,可能就是这件事:声网为模型设计的第一个产品,是什么。
01 体验的十年 02 产品矩阵变迁 03 接入架构拆解 04 为模型设计
PART 4 · Conversational AI Agent22
先讲「快」

级联大模型时代:ASR + LLM + TTS 编排出对话

端侧采集 前处理 · 编码 SD-RTN™ 智能路由 · 抗弱网 ASR 语音转文本 LLM 内容生成 TTS 文本转语音 端侧播放 解码 · 渲染 RTC 链路 115.25ms 级联模型约 440ms
这样的产品,核心体验是又快又好。目前大部分场景下延迟已经压缩到平均 700ms、最低近 500ms
PART 4 · E2E 延迟23
iOS 极限方案 · 全链路分段拆解

RTE 只占 115.25ms,剩下的都在模型里

555.25MS · iOS 最低 E2E从录音输入到扬声器输出的完整链路
115.25MS · RTC 全链路含采集、3A、编解码、传输、Jitter Buffer、播放
440MS · 级联模型环节STT 180~250ms + 句子聚合 150ms + TTS 40~110ms
网络传输本身只有 10ms(全球 70ms),Opus 编码 6.25ms、解码 1ms,Jitter Buffer 20ms。声网还在继续压这个数字,让均值稳定到 500ms 的水平。
PART 4 · 再讲「好」24
加上 VAD 之后,新问题来了

人能打断模型之后,模型开始疯狂打断人

没有 VAD模型说完你才能说业内很多对话式智能助手不能自然打断,只能一问一答,轮流讲话。
加了 VAD人可以随时打断模型但模型不知道人什么时候把话讲完——在超低延迟的自由对话里,它会疯狂打断人类。
问题的本质
人人对话时,为了把一件事讲清楚,通常会有铺垫。只有 VAD 是完全不够的——模型需要从「听得懂内容」进一步变成「在倾听这个人」,才谈得上交流和共鸣。
MONEY QUOTE · 04
自然打断,自如对话。
我说「有事等我一下」,它安静下来;我「嘘」一声,它立刻停;我说 OK,它立刻接上。这是人模对话中最重要的那条 QoE。
PART 4 · AI-AED26
回到 2022 Q4 的那张规划

「如果只做一件事,做哪件?」——声学事件检测

01当时的判断降噪已经是既定的三年战略路线;声学事件检测是产品角度的第一优先级,要在 2023 年交付
02当时的思路视频算法已经有动捕、面捕,开始转向内容检测;而音频还没有类似的算法
03当时的定位AI-VAD + AI-MD 作为 AI-NS、AI-AEC 的增强器,从 Input 开始为降噪做筛选和分类
04端侧链路ADC 输入 → AED 事件识别与分类 → 3A 降噪回声消除增益 → 虚拟声卡(AI 调音器)→ 网络与上报 → App
诞生之初,AI-AED 只是一个「让声音听得清」的端侧功能。
PART 4 · HIP27
把 AI-AED 搬到服务端之后

HIP:第一个为模型设计的核心算法

AI-AED 声学事件检测 AI-VAD · AI-MD · AI-ANS DETECTION + MSU 多模态语音理解 Multi-Modal Speech Understanding UNDERSTANDING HIP Human Intention Prediction 对人类实时意图的预测 PREDICTION 模型 何时该听 何时该说
通过 AED 的 Detection,加上 MSU 的 Understanding,最终变成 HIP 的 Prediction。模型可以根据这份预测,自己决定什么时候保持倾听、什么时候开口。
PART 4 · 切题28
技术变革 × 体验革新

听得到 → 听得清 → 听得懂 → 听「得心」

听得到 Hearing QoS VAD 听得清 Hearing Clearly QoE AI-VAD 听得懂 Fully Understanding QoE + ASR AI-AED 听得心 Understanding Thoroughly QoE + HIP + LLM HIP · 今天发布 体验革新 技术变革 人人对话从听得到走到听得清;人模对话直接从听得懂起步——模型 Day 1 就具备了听得到和听得清
MONEY QUOTE · 05
有些话,讲给朋友和讲给大模型,一定是不一样的。
因为你已经预设了对面不是人,而是工具,就无法发自肺腑地铺垫和陈述。模型要从理解内容,变成理解心理与情绪,最终理解人类意图。
带走 · TAKEAWAYS30
今天能带走的三件事

如果只记三句

01
先问「为谁设计」
QoS 为硬件和网络,QoE 为人,AI QoE 为人和模型。判断一个 AI 实时产品好不好,先问它把谁当用户。
02
延迟的账要拆开算
iOS 最低 555.25ms 里,RTC 只占 115.25ms。优化对象在哪一段,决定了你该找谁。
03
VAD 远远不够
自然打断只是起点。让模型知道人什么时候讲完,需要 AED 的检测 + MSU 的理解 = HIP 的预测。
在生成式 AI 的推动下,实时互动体验正迈向一个全新的高度。我们不只在提升技术性能,更是在重塑人与技术的沟通方式。
RTE 2024 · AI 专场 · 演讲结束

携手,见证无限可能

生成式 AI 驱动的实时互动
VenueRTE 2024 · 声网年度大会 AI 专场
Date2024.10.25
Archive演讲档案 01 · 原稿 33 页
Note本 deck 已剔除视频页与空页,按主线重排