声网 · 对话式 AI 引擎产品发布会
对话式 AI 引擎正式发布
Conversational AI Engine · GA Release
全球首个对话式 AI 引擎
Venue
ConvoAI 产品发布会 · 声网官方
Date
2025.03.06
Speaker
姚光华 Colin · 声网 AI RTE 产品线负责人
Deck
4 幕 · 27 页
提要 · OVERVIEW
02
这场在讲什么
发布了什么,以及为什么这么设计
PART 1
里程碑
这一年是怎么走到今天的
PART 2
为什么这么设计
用户价值与四层架构
PART 3
多、快、好、省
今天发布的能力
PART 4
定价与生态
一分钟不到一毛钱
一句话概括今天:
模型选择多、智能响应快、对话体验好、用起来省心更省钱。
PART 1
MILESTONES
对话式 AI 的里程碑
从 GPT-4o 的一次演示,到今天这场发布会,中间只隔了不到十个月。
01 里程碑
02 为什么这么设计
03 多快好省
04 定价与生态
PART 1 · 十个月
04
2024.05 – 2025.03
六个日子,把对话式 AI 推到了台前
2024.05.13
GPT-4o
See, Hear, and Speak
2024.10.01
Realtime API
全球首个
2024.10.24
RTE 2024
国内首个 Realtime API
2025.01.28
Private Beta
除夕
2025.02.18
Public Beta
雨水
2025.03.06
正式发布
惊蛰次日
全球首个对话式 AI 引擎 —— 从别人的演示,到我们自己的发布
PART 1 · 三个节气
05
除夕 · 雨水 · 惊蛰
这条产品线的三次开门,都挑了节气
01
除夕
2025 年 1 月 28 日 · 声网对话式 AI 引擎 Private Beta —— 第一批客户拿到钥匙
02
雨水
2025 年 2 月 18 日 · 声网对话式 AI 引擎 Public Beta —— 所有开发者都能进来试
03
惊蛰
2025 年 3 月 5 日 · 春雷惊万物,新声自此启。次日 3 月 6 日,引擎正式发布
从 Private Beta 到 GA,只用了 37 天。
节奏本身就是一种承诺。
MONEY QUOTE · 01
春雷惊万物,
新声自此启。
2025 年 3 月 5 日,惊蛰。第二天,声网对话式 AI 引擎正式发布——全球首个对话式 AI 引擎。
PART 2
WHY
为什么这么设计
先说清楚这个引擎为谁创造什么价值,再说它长什么样。顺序不能反。
01 里程碑
02 为什么这么设计
03 多快好省
04 定价与生态
PART 2 · 用户价值
08
对话式 Agent 提供哪些价值
三种感受,对应三种价值
用户感受
情感共鸣
问题解决
效率跃升
对话式
Agent
用户价值
情绪价值
智能价值
时间价值
陪伴类智能体(Companion Agents)主要交付
情绪价值
,服务类智能体(Service Agents)主要交付
智能价值
与
时间价值
。
PART 2 · 架构
09
From Perception to Intelligence
从感知到智能,一个 Agent 有四层
顶层智能层
Top-tier Intelligence Layer · 高级认知与学习能力,并具备超高情商
任务处理层
Task Processing Layer · 面向目标的行动与处理能力,具备超高智商
模态融合层
Modal Fusion Layer · 针对感知后的内容进行统一的多模态理解和透传
模态感知层
Modal Perception Layer · 基础的视觉与音频处理和转换
对话式 AI 引擎
Conversational AI Engine
SERVICE AGENTS · 智能价值
COMPANION AGENTS · 情绪价值
PART 2 · RTE + AI
10
产品架构
两股能力合流,才有这个引擎
RTE
实时传输 · 音频算法 · 抗弱网
AI
ASR · LLM · TTS · 多模态理解
对话式 AI 引擎
模态感知
模态融合
服务类智能体
陪伴类智能体
引擎承担的是底下两层:把现实世界的声音变成模型能用的输入,再把模型的输出变回自然的声音
PART 3
RELEASE
多、快、好、省
模型选择多、智能响应快、对话体验好、用起来省心更省钱。今天发布的全部内容,就是这四个字。
01 里程碑
02 为什么这么设计
03 多快好省
04 定价与生态
PART 3 · 总览
12
不是简单的文字游戏
四个字,每个字后面都有硬指标
多
智能多、音色多
全球几乎所有大模型厂商 + 全球主流语音合成供应商,任意切换
快
响应快、打断快
响应延迟中位数 650ms,打断延迟中位数 340ms
好
情商高、真拟人
优雅打断、选择性注意力锁定、无惧噪声弱网
省
开发省心更省钱
2 行代码 + 15 分钟接入,一分钟不到一毛钱
选择权交给开发者,话筒交给 Agent,账单交给一个大家算得过来的数字。
PART 3 · 多
13
多 · 选择权交给开发者
模型都能选,音色也都能选
LLM
支持全球几乎所有大模型厂商
只要和 OpenAI 接口协议兼容的模型厂商,
今天起,全部原生支持
。不需要为换一个模型重写一遍接入。
TTS
语音合成自由选择和定制
支持全球主流语音合成供应商任意切换;客户在供应商处
定制、克隆
的自定义音色,也能直接上线。
我们不替开发者选模型。
引擎该做的,是让「换一个」这件事没有成本。
PART 3 · 快
14
快 · 由奢入俭难
响应快是基本盘,打断快才是分水岭
650
MS · 响应延迟中位数
超低延时方案,中、美、欧、东南亚主要城市实测
340
MS · 打断延迟中位数
任意方案,均可以获得这个打断延时
1
S · 高智能方案响应
超高智能 + 超强表现力方案,全球主要城市实测低至 1s
延时会根据不同供应商的选择而浮动。
这条口径写在这里,是为了让客户拿去做自己的验收标准,而不是拿去做宣传。
PART 3 · 好
15
好 · 情商高、真拟人、无惧噪声弱网
三件事决定了它像不像一个能聊的人
01
优雅打断
任意模型接入即可做到「嘘」、「等等」、「闭嘴」的对话体验。根据人的对话节奏与内容,做出最拟人化的打断响应——「更懂你」。
02
选择性注意力锁定
对话人声锁定。现实环境里有别人的说话声时,模型要准确识别谁在和自己讲话——「听谁的」。
03
抗丢包、抗抖动
人模对话场景,除了抗丢包 80% 外,断网 3–5s 依旧流畅对话。人人对话场景,抗上下行丢包已达到 80%。
情商不是形容词。
它是「什么时候闭嘴」和「听谁的」这两个可测量的判断。
MONEY QUOTE · 02
把话筒,
交给 Agent。
优雅打断解决「它什么时候该停」,选择性注意力锁定解决「它该听谁的」。两件事做到了,话筒才敢递过去。
PART 3 · 省
17
省 · 开发省心
2 行代码 + 15 分钟,让任意模型对你开口
Console
登录 Playground
LLM
填入 Key & URL
TTS
填入 Key & URL
立即体验
实测智能与音色
View Code
生成服务端代码
Server API
复制 · 调用 · Debug
在你的服务器调用这些代码,就可以直接在任意 App 中商用
PART 4
PRICE
定价与生态
能不能真正做到「物美价廉」?先看看人人沟通的时代,计费模型是怎么走过来的。
01 里程碑
02 为什么这么设计
03 多快好省
04 定价与生态
PART 4 · 参照系
19
人人沟通时代的计费模型
三十年,一分钟的价格是怎么走下来的
01
1995 年
本地 0.6 元 / 分钟,漫游 1.1 元 / 分钟(跨省通话叠加长途费)。入网还要 6000 元
02
2010 年
本地 0.22 元 / 分钟,传统长途 0.89 元 / 分钟(含本地接入费)
03
2025 年
套餐外语音 0.15 元 / 分钟,国际通话(欧美)
1.99 元 / 分钟
人人沟通花了三十年,把一分钟从 6 毛降到 1 毛 5。
那么人模对话的第一天,应该定在哪儿?
PART 4 · 定价
20
今天公布的价格
一分钟不到一毛钱
计费大类
计费项目
单价
免费额度
语音通话费用
智能体通话
0.098 元 / 分钟
1000 分钟总量(一次性赠予)
增值服务费用
优雅打断
0.042 元 / 分钟
无
优雅打断单独计价,是因为它是一项
可以被选择的增值能力
,不是所有场景都需要——把选择权和账单一起交给开发者。
PART 4 · 算给客户听
21
按真实使用频次折算
一次 3 分钱,一年 5 块钱
0.03
元 · 次均成本
平均约 3 轮对话,平均对话时长 21.1s —— 一次仅需 3 分钱
0.45
元 · 月均成本
每月对话次数约 15 次 —— 一个月不到 5 毛钱
5.4
元 · 年均成本
一年活跃 12 个月 —— 一年只要 5 块钱
这个数字要能被创业者一次算清楚,才叫真的「省」。
MONEY QUOTE · 03
每年,
请你的用户喝杯奶茶。
一个活跃用户一整年的对话成本约 5.4 元。定价能不能成立,取决于它有没有小到可以不被讨论。
PART 4 · 收束
23
回归用户价值
声网为客户创造的价值,只有一句
情感共鸣
情绪价值
陪伴类智能体交付的东西,是对方愿意继续说下去。
问题解决
智能价值
服务类智能体交付的东西,是这件事真的办成了。
效率跃升
时间价值
把原本要等、要排队、要重复的过程压掉。
对话式 Agent,创业者最好的选择。
多、快、好、省这四个字,最终都要落回这三种价值上。
MONEY QUOTE · 04
你的 Agent,
由你定义。
咖啡馆老板可以用情绪识别模块做会员关怀 AI,医生可以结合医疗知识库做分诊助手,小学生都能训练宠物陪伴机器人。我们不定义 Agent 的形态——声网引擎要做的,只是让每个垂直场景都拥有自主进化的 AI 生命体。
发布会 · 圆桌
25
圆桌对话
从生成到对话:多模态 AI 重塑人机交互
声网
姚光华 Colin
AI RTE 产品线负责人
MiniMax
冯雯
解决方案高级总监
阿里云
辛晓剑
通义千问高级产品架构师
腾讯云
曹超
AI 产品架构师总监
发布会当天同步开放
公开体验版
与 DEMO 体验环节:从 Console 进去,十五分钟之内就能听到自己选的模型开口说话。
带走 · TAKEAWAYS
26
今天能带走的三件事
如果只记三句
01
选择权不在引擎手里
模型、音色都能换。引擎的价值不是替你选,而是让「换一个」不产生成本。
02
情商是可测量的
优雅打断 340ms、注意力锁定、抗丢包 80%。拟人不是形容词,是一组能验收的数。
03
价格要小到不被讨论
0.098 元 / 分钟,一个活跃用户一年 5.4 元。定价是产品设计的一部分。
2025 年 3 月 6 日,全球首个对话式 AI 引擎正式发布。
从这一天起,Agent 的形态由开发者定义。
ConvoAI 产品发布会 · 发布结束
新声自此启
声网 · 对话式 AI 引擎
Venue
ConvoAI 产品发布会 · 声网官方
Date
2025.03.06
Archive
演讲档案 03 · 原稿 31 页
Note
本 deck 已剔除空页与 DEMO 占位页,按主线重排
EDIT
浅底