声网 · 对话式 AI 引擎产品发布会

对话式 AI 引擎正式发布

Conversational AI Engine · GA Release
全球首个对话式 AI 引擎
VenueConvoAI 产品发布会 · 声网官方
Date2025.03.06
Speaker姚光华 Colin · 声网 AI RTE 产品线负责人
Deck4 幕 · 27 页
提要 · OVERVIEW02
这场在讲什么

发布了什么,以及为什么这么设计

PART 1 里程碑 这一年是怎么走到今天的 PART 2 为什么这么设计 用户价值与四层架构 PART 3 多、快、好、省 今天发布的能力 PART 4 定价与生态 一分钟不到一毛钱
一句话概括今天:模型选择多、智能响应快、对话体验好、用起来省心更省钱。
PART 1
MILESTONES
对话式 AI 的里程碑
从 GPT-4o 的一次演示,到今天这场发布会,中间只隔了不到十个月。
01 里程碑 02 为什么这么设计 03 多快好省 04 定价与生态
PART 1 · 十个月04
2024.05 – 2025.03

六个日子,把对话式 AI 推到了台前

2024.05.13 GPT-4o See, Hear, and Speak 2024.10.01 Realtime API 全球首个 2024.10.24 RTE 2024 国内首个 Realtime API 2025.01.28 Private Beta 除夕 2025.02.18 Public Beta 雨水 2025.03.06 正式发布 惊蛰次日 全球首个对话式 AI 引擎 —— 从别人的演示,到我们自己的发布
PART 1 · 三个节气05
除夕 · 雨水 · 惊蛰

这条产品线的三次开门,都挑了节气

01除夕2025 年 1 月 28 日 · 声网对话式 AI 引擎 Private Beta —— 第一批客户拿到钥匙
02雨水2025 年 2 月 18 日 · 声网对话式 AI 引擎 Public Beta —— 所有开发者都能进来试
03惊蛰2025 年 3 月 5 日 · 春雷惊万物,新声自此启。次日 3 月 6 日,引擎正式发布
从 Private Beta 到 GA,只用了 37 天。节奏本身就是一种承诺。
MONEY QUOTE · 01
春雷惊万物,新声自此启。
2025 年 3 月 5 日,惊蛰。第二天,声网对话式 AI 引擎正式发布——全球首个对话式 AI 引擎。
PART 2
WHY
为什么这么设计
先说清楚这个引擎为谁创造什么价值,再说它长什么样。顺序不能反。
01 里程碑 02 为什么这么设计 03 多快好省 04 定价与生态
PART 2 · 用户价值08
对话式 Agent 提供哪些价值

三种感受,对应三种价值

用户感受 情感共鸣 问题解决 效率跃升 对话式 Agent 用户价值 情绪价值 智能价值 时间价值
陪伴类智能体(Companion Agents)主要交付情绪价值,服务类智能体(Service Agents)主要交付智能价值时间价值
PART 2 · 架构09
From Perception to Intelligence

从感知到智能,一个 Agent 有四层

顶层智能层 Top-tier Intelligence Layer · 高级认知与学习能力,并具备超高情商 任务处理层 Task Processing Layer · 面向目标的行动与处理能力,具备超高智商 模态融合层 Modal Fusion Layer · 针对感知后的内容进行统一的多模态理解和透传 模态感知层 Modal Perception Layer · 基础的视觉与音频处理和转换 对话式 AI 引擎 Conversational AI Engine SERVICE AGENTS · 智能价值 COMPANION AGENTS · 情绪价值
PART 2 · RTE + AI10
产品架构

两股能力合流,才有这个引擎

RTE 实时传输 · 音频算法 · 抗弱网 AI ASR · LLM · TTS · 多模态理解 对话式 AI 引擎 模态感知 模态融合 服务类智能体 陪伴类智能体 引擎承担的是底下两层:把现实世界的声音变成模型能用的输入,再把模型的输出变回自然的声音
PART 3
RELEASE
多、快、好、省
模型选择多、智能响应快、对话体验好、用起来省心更省钱。今天发布的全部内容,就是这四个字。
01 里程碑 02 为什么这么设计 03 多快好省 04 定价与生态
PART 3 · 总览12
不是简单的文字游戏

四个字,每个字后面都有硬指标

智能多、音色多
全球几乎所有大模型厂商 + 全球主流语音合成供应商,任意切换
响应快、打断快
响应延迟中位数 650ms,打断延迟中位数 340ms
情商高、真拟人
优雅打断、选择性注意力锁定、无惧噪声弱网
开发省心更省钱
2 行代码 + 15 分钟接入,一分钟不到一毛钱
选择权交给开发者,话筒交给 Agent,账单交给一个大家算得过来的数字。
PART 3 · 多13
多 · 选择权交给开发者

模型都能选,音色也都能选

LLM
支持全球几乎所有大模型厂商
只要和 OpenAI 接口协议兼容的模型厂商,今天起,全部原生支持。不需要为换一个模型重写一遍接入。
TTS
语音合成自由选择和定制
支持全球主流语音合成供应商任意切换;客户在供应商处定制、克隆的自定义音色,也能直接上线。
我们不替开发者选模型。引擎该做的,是让「换一个」这件事没有成本。
PART 3 · 快14
快 · 由奢入俭难

响应快是基本盘,打断快才是分水岭

650MS · 响应延迟中位数超低延时方案,中、美、欧、东南亚主要城市实测
340MS · 打断延迟中位数任意方案,均可以获得这个打断延时
1S · 高智能方案响应超高智能 + 超强表现力方案,全球主要城市实测低至 1s
延时会根据不同供应商的选择而浮动。这条口径写在这里,是为了让客户拿去做自己的验收标准,而不是拿去做宣传。
PART 3 · 好15
好 · 情商高、真拟人、无惧噪声弱网

三件事决定了它像不像一个能聊的人

01
优雅打断
任意模型接入即可做到「嘘」、「等等」、「闭嘴」的对话体验。根据人的对话节奏与内容,做出最拟人化的打断响应——「更懂你」。
02
选择性注意力锁定
对话人声锁定。现实环境里有别人的说话声时,模型要准确识别谁在和自己讲话——「听谁的」。
03
抗丢包、抗抖动
人模对话场景,除了抗丢包 80% 外,断网 3–5s 依旧流畅对话。人人对话场景,抗上下行丢包已达到 80%。
情商不是形容词。它是「什么时候闭嘴」和「听谁的」这两个可测量的判断。
MONEY QUOTE · 02
把话筒,交给 Agent。
优雅打断解决「它什么时候该停」,选择性注意力锁定解决「它该听谁的」。两件事做到了,话筒才敢递过去。
PART 3 · 省17
省 · 开发省心

2 行代码 + 15 分钟,让任意模型对你开口

Console 登录 Playground LLM 填入 Key & URL TTS 填入 Key & URL 立即体验 实测智能与音色 View Code 生成服务端代码 Server API 复制 · 调用 · Debug 在你的服务器调用这些代码,就可以直接在任意 App 中商用
PART 4
PRICE
定价与生态
能不能真正做到「物美价廉」?先看看人人沟通的时代,计费模型是怎么走过来的。
01 里程碑 02 为什么这么设计 03 多快好省 04 定价与生态
PART 4 · 参照系19
人人沟通时代的计费模型

三十年,一分钟的价格是怎么走下来的

011995 年本地 0.6 元 / 分钟,漫游 1.1 元 / 分钟(跨省通话叠加长途费)。入网还要 6000 元
022010 年本地 0.22 元 / 分钟,传统长途 0.89 元 / 分钟(含本地接入费)
032025 年套餐外语音 0.15 元 / 分钟,国际通话(欧美)1.99 元 / 分钟
人人沟通花了三十年,把一分钟从 6 毛降到 1 毛 5。那么人模对话的第一天,应该定在哪儿?
PART 4 · 定价20
今天公布的价格

一分钟不到一毛钱

计费大类计费项目单价免费额度
语音通话费用智能体通话0.098 元 / 分钟1000 分钟总量(一次性赠予)
增值服务费用优雅打断0.042 元 / 分钟
优雅打断单独计价,是因为它是一项可以被选择的增值能力,不是所有场景都需要——把选择权和账单一起交给开发者。
PART 4 · 算给客户听21
按真实使用频次折算

一次 3 分钱,一年 5 块钱

0.03元 · 次均成本平均约 3 轮对话,平均对话时长 21.1s —— 一次仅需 3 分钱
0.45元 · 月均成本每月对话次数约 15 次 —— 一个月不到 5 毛钱
5.4元 · 年均成本一年活跃 12 个月 —— 一年只要 5 块钱
这个数字要能被创业者一次算清楚,才叫真的「省」。
MONEY QUOTE · 03
每年,请你的用户喝杯奶茶。
一个活跃用户一整年的对话成本约 5.4 元。定价能不能成立,取决于它有没有小到可以不被讨论。
PART 4 · 收束23
回归用户价值

声网为客户创造的价值,只有一句

情感共鸣
情绪价值
陪伴类智能体交付的东西,是对方愿意继续说下去。
问题解决
智能价值
服务类智能体交付的东西,是这件事真的办成了。
效率跃升
时间价值
把原本要等、要排队、要重复的过程压掉。
对话式 Agent,创业者最好的选择。多、快、好、省这四个字,最终都要落回这三种价值上。
MONEY QUOTE · 04
你的 Agent,由你定义。
咖啡馆老板可以用情绪识别模块做会员关怀 AI,医生可以结合医疗知识库做分诊助手,小学生都能训练宠物陪伴机器人。我们不定义 Agent 的形态——声网引擎要做的,只是让每个垂直场景都拥有自主进化的 AI 生命体。
发布会 · 圆桌25
圆桌对话

从生成到对话:多模态 AI 重塑人机交互

声网姚光华 ColinAI RTE 产品线负责人
MiniMax冯雯解决方案高级总监
阿里云辛晓剑通义千问高级产品架构师
腾讯云曹超AI 产品架构师总监
发布会当天同步开放公开体验版与 DEMO 体验环节:从 Console 进去,十五分钟之内就能听到自己选的模型开口说话。
带走 · TAKEAWAYS26
今天能带走的三件事

如果只记三句

01
选择权不在引擎手里
模型、音色都能换。引擎的价值不是替你选,而是让「换一个」不产生成本。
02
情商是可测量的
优雅打断 340ms、注意力锁定、抗丢包 80%。拟人不是形容词,是一组能验收的数。
03
价格要小到不被讨论
0.098 元 / 分钟,一个活跃用户一年 5.4 元。定价是产品设计的一部分。
2025 年 3 月 6 日,全球首个对话式 AI 引擎正式发布。从这一天起,Agent 的形态由开发者定义。
ConvoAI 产品发布会 · 发布结束

新声自此启

声网 · 对话式 AI 引擎
VenueConvoAI 产品发布会 · 声网官方
Date2025.03.06
Archive演讲档案 03 · 原稿 31 页
Note本 deck 已剔除空页与 DEMO 占位页,按主线重排