人人都是产品经理大会 2024 · PMTalk

生成式 AI 驱动实时互动

技术变革与体验革新
A PM's View on Real-Time AI
Venue人人都是产品经理大会 2024
Date2024.12.07
Speaker姚光华 Colin · 声网 AI RTE 产品线负责人
Deck5 幕 · 32 页
提要 · OVERVIEW02
这场在讲什么

从一次浪潮讲到一个岗位的变化

PART 0 浪潮已来 半年发生了什么 PART 1 体验的十年 RTE 是干什么的 PART 2 产品矩阵变迁 新增了什么产品 PART 3 为模型设计 最重要的那条体验 PART 4 AI 产品经理 挑战与自我提升
前三部分讲清楚 RTE 是什么、变成了什么。最后一部分,讲这门手艺本身正在发生的变化。
PART 0
WAVE
浪潮已来
先看最近半年,从一个 RTE 从业者的视角,AI 产业到底发生了哪几件大事。
00 浪潮已来 01 体验的十年 02 产品矩阵变迁 03 为模型设计 04 AI 产品经理
PART 0 · 半年两件事04
2024 年的两个日子

实时对话从演示,变成了一条 API

May 13, 2024 · Spring UpdateChatGPT can now see, hear, and speakOpenAI 发布 GPT-4o,预告面向高级订阅客户 rollout 高级语音模式;发布会上插着网线,为全世界演示了超低延时的实时对话。
October 1, 2024 · Realtime API开发者可以自己做 speech-to-speech五个月后,OpenAI 对外发布 To B 的 Realtime API,正式 Public Beta。实时对话第一次变成开发者可以直接调用的能力。
同一篇发布 Blog 里,OpenAI 明确提及声网在美国的兄弟公司 Agora,建议自己的开发者通过 Agora 等实时互动供应商接入 Realtime API,以获得更好的体验。
PART 0 · 算一笔账05
技术很强,账很吓人

人模对话,比人人对话贵两个数量级

0.99USD / 1000 MINS · 人人对话Agora 海外音频刊例价
300USD / 1000 MINS · 人模对话Realtime API 音频输入约 6¢/分钟(60 美元)+ 音频输出约 24¢/分钟(240 美元)
人和模型各讲一半,也就是 150 美元 / 1000 分钟。总归是人人对话的 150 倍到 300 倍的价差。
MONEY QUOTE · 01
这项技术很强,除了贵,没什么毛病。
对产品经理来说,这句话的另一面是:接下来两年最值钱的能力,是把这个体验做到同样好、成本降一个数量级。
PART 1
DECADE
体验的十年 2014 – 2024
支撑 Realtime API 的,是 RTE 这个产业。它这十年只在回答一个问题:这个体验,是为谁设计的。
00 浪潮已来 01 体验的十年 02 产品矩阵变迁 03 为模型设计 04 AI 产品经理
PART 1 · 一张图看完十年08
QoS → QoE → MM AI QoE

产品为谁的体验设计,答案换了两次

QoS 2014 – 2019 · RTC · SLA 技术够强 QoE 2020 – 至今 · RTE · XLA 用得很爽 MM AI QoE 2024 – · AI RTE · 跨模态 为人和模型设计 为硬件与网络 为人 为人和模型
这条线对产品经理的意义很直接:每换一次「为谁设计」,衡量指标、验收标准、甚至团队里谁说了算,都要跟着换一遍。
PART 1 · SLA vs XLA09
两个时代,两把尺子

从「登录得上」到「用户用得爽」

2014 – 2019 · SLA 时代技术够强产品形态 RTC,关键词高保真、传输。SLA 只看登录成功率:服务时长每五分钟切片,低于 99% 即判定这 5 分钟不可用。
2020 – 至今 · XLA 时代用得很爽产品形态 RTE(含 RTC / RTM / RTSC)。2020 年声网提出 XLA,从单一指标扩展到 400ms 端到端延迟达标率、音频卡顿率、视频卡顿率。
100发送端内容
99.99QoS · 无限逼近还原
120QoE · 超越预期 WOW
MONEY QUOTE · 02
QoS 是为硬件和网络设计的,QoE 是为人设计的。
前者关键是可用,后者关键是用户用着好。产品经理换一次视角,整张指标体系就要重写一次。
PART 1 · MM-AI QoE11
2024 – · 跨模态 / 多模态体验质量

输出是什么模态,第一次由模型决定

同模态 · QOS / QOE 音频 视频 文本 音频 视频 文本 进什么,出什么 跨模态 · MM-AI QOE 音频 视频 文本 生成式 AI 音频 视频 文本 100 分进,?分出
内容质量已经不受控于采集、编码、传输、解码这条传统 Pipeline,模型本身重度参与并决定了体验水平——所以 AI RTE 的规划重心必须从为人设计,转为为人和模型设计
PART 1 · 小结12
QoS > QoE > MM-AI QoE

十年三段,一张表收

时代IN聚焦OUT为谁设计
同模态 QoS音频 / 视频 / 文本无损传输、高保真还原同模态原样输出人类
同模态 QoE音频 / 视频 / 文本终端用户体验、前后处理算法同模态原样输出人类
跨模态 AI QoE音频 / 视频 / 文本跨模态交互、生成式 AI任意模态自由组合人类和模型
输入是音频,输出可以是文本;输入是视频,输出可以是音频。这种组合方式,会彻底改变用户消费内容的体验方式。
PART 2
MATRIX
AI RTE 产品矩阵变迁
十年沉淀出的那张产品矩阵图,近一年被改了两次。改在哪儿,就是我们对未来下的注。
00 浪潮已来 01 体验的十年 02 产品矩阵变迁 03 为模型设计 04 AI 产品经理
PART 2 · 三个版本14
RTE Standalone → AI RTE v1 → AI RTE 2024

同一张图,改了两次

01十年沉淀RTE Standalone:SD-RTN™ 基建 → RTE Core(RTC / RTM)→ 扩展层(录制、转码)→ 工具层(aPaaS、低代码)→ 解决方案层
02第一次改AI RTE v1:基建层出现 Storage / Dataset / GPU,核心层出现 Function Call、RAG,工具层涌现 Agent 编排工具,方案层转向 AI 会议纪要、口语老师
03第二次改AI RTE 2024:底座换成 Serverless GPU Infra for AI,核心层出现 Conversational AI Agent、AI Real-Time Translation、AI Meeting Mins
变化的不是新增了几个框。是 AI 从「QoE 的增强器」,变成了产品矩阵的核心构成。
PART 2 · AI RTE 202415
今天的形态

AI 时代该有的基建、核心、平台与方案

Solutions 社交娱乐 · 在线教育 · 智能硬件 · 数字化转型 · 直播电商 · 出海 Core Conversational AI Agent · AI Real-Time Translation · AI Meeting Mins Platform RTE Platform · Graph Designer · TTS 等模型服务编排 Infrastructure SD-RTN™ · Storage / Dataset · Serverless GPU Infra for AI 对外统一 API · 核心层是这一年新增最多的一层
PART 2 · 给产品经理的16
产品怎么快速迭代

全知道、快理解、慢聚焦

30 MINS · 全知道穷举新技术新技术第一时间知道。不追求深度,追求不漏。
60 MINS · 快理解学习新技术马上理解新技术的工作原理,判断它能不能进自己的产品。
120 MINS · 慢聚焦放弃新技术毙掉团队不该学的、不该做的。放弃比开始难,也更值钱。
时间分配本身就是判断:决定「不做什么」,花的时间是「知道有什么」的四倍。
PART 3
LISTEN
体验的十年 2024 –
如果今天我只讲一件事,可能就是这件事:为模型设计的第一个产品,是什么。
00 浪潮已来 01 体验的十年 02 产品矩阵变迁 03 为模型设计 04 AI 产品经理
PART 3 · Agent AI18
From Perception to Intelligence

从感知到智能,一个 Agent 有四层

顶层智能层 Top-tier Intelligence Layer · 高级认知与学习能力 任务处理层 Task Processing Layer · 面向目标的行动与适应能力 模态融合层 Modal Fusion Layer · 统一的多模态理解 模态感知层 Modal Perception Layer · 基础的视觉与音频处理 SERVICE AGENTS COMPANION AGENTS Conversational AI Engine
PART 3 · 先讲「快」19
级联大模型:ASR + LLM + TTS

RTE 只占 115.25ms,其余都在模型里

端侧采集 前处理 · 编码 SD-RTN™ 智能路由 · 抗弱网 ASR 180~250ms LLM 句子聚合 150ms TTS 40~110ms 端侧播放 解码 · 渲染 RTC 链路 115.25ms 级联模型约 440ms E2E 555.25ms
01端到端iOS 极限方案最低 555.25ms;目前大部分场景延迟已压缩至平均 700ms、最低近 500ms
02RTC 链路115.25ms,含采集、3A、Opus 编解码、网络传输 10ms、Jitter Buffer 20ms、播放
03模型环节约 440ms。想再快,优化对象不在传输,在模型编排
PART 3 · 再讲「好」20
加了 VAD 之后,新问题来了

人能打断模型之后,模型开始疯狂打断人

没有 VAD模型说完你才能说业内很多对话式智能助手不能自然打断,只能一问一答,轮流讲话。
加了 VAD人可以随时打断模型但模型不知道人什么时候把话讲完——在超低延迟的自由对话里,它会疯狂打断人类。
产品经理该定义的那条体验
人人对话时,为了把一件事讲清楚,通常会有铺垫。只有 VAD 是完全不够的——模型要从「听得懂内容」,变成「在倾听这个人」,才谈得上交流和共鸣。
MONEY QUOTE · 03
优雅打断,自如对话。
我说「有事等我一下」,它安静下来;我「嘘」一声,它立刻停;我说 OK,它立刻接上。这是人模对话中最重要的那条用户体验。
PART 3 · 为谁设计22
其实我们只做了一件事

同一个模块搬上云,用户从人换成模型

端侧 · Human Participants让人听得清2022 Q4 定下的 2023 音频规划:VAD + MD 作为 AI-NS、AI-AEC 的增强器,从 Input 开始为降噪做筛选和分类。链路是 ADC → AED → 3A → 虚拟声卡 → App。
云端 · Model Participants让模型听得懂人把 AI-AED 放到云端,加上一些特定优化,把这个产品的用户从人变成模型——就得到一个为模型设计的产品。
模块没怎么变,变的是「为谁设计」。对产品经理来说,这一步的成本最低,杠杆最大。
PART 3 · 切题23
技术变革 × 体验革新

同一条线上,两次换了服务对象

听得到 Hearing QoS VAD · 2019 听得清 Hearing Clearly QoE VAD + MD · 2020 AI QoE 2024 MM-AI QoE 2025 FOR HUMAN · 为人类设计 FOR MODEL · 为模型设计 体验革新 技术变革
MONEY QUOTE · 04
模型要从理解内容,变成理解人的心理与情绪。
有些话,讲给朋友和讲给大模型一定是不一样的——因为你已经预设了对面是工具。最终理解人类意图,才是「听得心」。
PART 4
CRAFT
聊聊 AI 产品经理的事
最后轻松一点,讲讲近期工作中感受到的、AI 对产品经理这个岗位的冲击。
00 浪潮已来 01 体验的十年 02 产品矩阵变迁 03 为模型设计 04 AI 产品经理
PART 4 · 挑战26
AI 产品管理的关键挑战是什么

三个以前不会被问倒的问题

01
还知道 60 天后发什么吗
以前产品规划一年一写,老板问半年、一年后 release 什么,我是清楚的。现在问 60 天后有什么体验,我也不知道。
02
O 不确定,怎么设计
产品设计一般先明确 Input 和 Output,再拆工作流。现在 Output 无法确定、有极大概率失败。
03
我够了解新技术吗
用户需求已经开始由新技术驱动。看起来确定的 AI 会议纪要,也从提炼与总结,变成给建议、直接执行待办。
某种程度上,产品经理已经无法定义产品行为。只能说:大概率是这样的。
PART 4 · 技能27
AI 产品经理应该具备哪些技能

三项自我提升的重点

01做原型利用模型进行产品原型设计。现在谁还不用 LLM 设计原型或者写 PRD,已经是 out of date 的产品经理
02懂算法深度理解技术,不只是工程技术,更要理解算法技术。要可以和工程师对话,也要可以和科学家对话
03写评估撰写高质量的产品评估标准——快速、精准地定义关键指标来衡量 LLM 的某种表现
只理解用户的产品经理,面太窄了。第三项是我认为最重要的技能:只有精准定义了衡量标准,才可能给出模型好坏的反馈。
PART 4 · 评估28
为什么高质量的产品评估至关重要

评估不是验收环节,是牵引方向的舵

评估什么
情商 × 智商
从情商(感知)和智商(智能)两个维度评估模型能力。
评估用来干嘛
从迭代方向到实验方法
从引导产品「迭代」的方向,变成指引产品「实验」的方法。
评估对象是谁
从识别人到识别模型
从识别人类用户的行为,变成识别模型的行为。
产品经理要培养一种直觉:快速定义产品指标的准确性——这样每一次「实验」之后,都能立刻衡量好坏,牵引下一次迭代,并快速识别模型的 bad experiences 并给予纠正。
MONEY QUOTE · 05
产品开发越来越像一连串实验,而不是确定性的设计和执行。
既然是实验,衡量就不再是收尾动作,而是方向盘。谁定义尺子,谁决定下一轮迭代往哪走。
PART 4 · 收束30
原稿的最后一页

三个职能,每一格上面都写着 AI

Product 原型、PRD、评估标准 Design 交互、界面、体验节奏 R&D 工程、算法、编排 AI 同一层新能力,同时长在三个职能上——边界开始融合
带走 · TAKEAWAYS31
今天能带走的三件事

如果只记三句

01
先问「为谁设计」
QoS 为硬件和网络,QoE 为人,MM-AI QoE 为人和模型。换一次服务对象,指标体系就要重写一遍。
02
时间分配就是判断
全知道 30 分钟、快理解 60 分钟、慢聚焦 120 分钟。决定不做什么,最贵也最值钱。
03
会写评估标准
在输出不确定的时代,能定义衡量标准的人,才有资格决定产品下一步往哪走。
第三条后来长成了一整条主线。「撰写高质量的产品评估标准」这个判断,在 2026 年被展开成了「评测即 PRD」系列文章。
人人都是产品经理大会 2024 · 演讲结束

一起持续学习

共同进步 · 谢谢各位的时间
Venue人人都是产品经理大会 2024 · PMTalk
Date2024.12.07
Archive演讲档案 02 · 原稿 37 页
Note「写评估标准」这条判断,2026 年展开为「评测即 PRD」系列文章