公众号文章系列 · 01 · Voice Agent

从 Tolan 看清
Voice Agent 的 4 个反直觉真相

四周 ARR 从 100 万到 400 万美元,它押中的不是效率
Speaker姚光华 Colin
Role声网 ConvoAI 产品负责人
Series公众号文章 #01
Date2026.07
$4M
年经常性收入(ARR)在短短四周内,从 100 万美元增长到 400 万美元。
在一个所有人都在做「效率工具」「Copilot」「生产力加速器」的时代,Tolan 把重心放在了一个更模糊、也更难定义的方向上:AI 陪伴
这一结果至少说明一件事:他们很可能触及了人们对 AI 的一种本质上不同的需求。 (本文数据与引述均出自 Tolan 团队公开材料,原文未逐条标注出处。)
序 · 两条完全不同的路03
The fork

同一个时代,它走了另一条路

ONE ERA · TWO BETS 同一批技术 主流路线:效率工具 · Copilot · 生产力加速器 Tolan:一种真正的「AI 陪伴关系」 被大量产品验证过的方向 更模糊、更难定义,却更快爆发
我并不是要评价 Tolan 对不对。 但在持续拆解它的过程中,我越来越确定一件事:一旦交互方式变了,过去在文本世界里成立的产品直觉,就会开始失效。
MONEY QUOTE · 01
Voice Agent 不是 「会说话的 ChatGPT」 而是一种全新的交互方式
下面这 4 点,是我目前最清晰、也最确信的判断。
TRUTH I / IV
LATENCY
延迟不是性能指标
在语音交互里,我们很容易把注意力放在「AI 说了什么」上。
但 Tolan 的实践反复证明:AI 说得有多快,往往更重要。
I 延迟即情绪II 即兴生成III 记忆即检索IV 帮人站稳
TRUTH I · 延迟即情绪06
一秒钟的心理边界

1 秒之内是对话,之外是机器

RESPONSE TIME · PERCEIVED 1 秒 · 对话的心理边界 1 秒以内:被感知为「在对话」 越过阈值:迅速滑向「机械感」 一次 +500ms 的改动 = 一场「灾难」 GPT-5.1 + Responses API:启动 −0.7s 这个阈值不是工程参数,是人类对话节奏的心理边界。
句子之间的沉默,和说出口的内容同样重要。 在 Voice Agent 里,Latency 本身就是体验设计的一部分。
TRUTH I · 延迟即情绪07
不是实验室结论,是被用户否定的结果

三件事,把延迟推回体验层

01灾难现场联合创始人 Quinten Farmer 提到过一次让人警惕的经历:仅仅增加 500 毫秒响应时间的改动,被他形容为一场「灾难」,几乎直接拖垮了产品中所有关键指标。
02阈值1 秒以内的响应,会被感知为「在对话」;一旦超过这个阈值,体验就会迅速滑向「机械感」。
03架构回追为了回到这个边界之内,Tolan 在架构层引入 GPT-5.1 以及新的 Responses API,将语音启动时间缩短了 0.7 秒以上
这不是一次精心设计的实验,而是一次真实产品演进中,被用户体验直接否定的结果
Latency 不是性能指标,是情绪信号。
MONEY QUOTE · 02
句子之间的沉默 和说出口的内容同样重要
在语音里,节奏本身就是内容的一部分。
TRUTH II / IV
IMPROV
不是写出来的,是即兴生成的
直觉上我们以为:好的 AI 对话来自好的脚本,好的陪伴来自精心设计的剧情。
但在真实语音交互中,这套逻辑几乎完全失效。
I 延迟即情绪II 即兴生成III 记忆即检索IV 帮人站稳
TRUTH II · 即兴生成10
语音对话有一个残酷特性

人会随时改主意、随时打断

SCRIPT VS IMPROV 写故事的思路 完整剧情结构 选择你自己的冒险 笨重、不自然、模型失控 最终的思路 只给一个「钩子」 强大的即兴参与者 内容在对话中自然生长 创作者不再控制走向
真正的转折点,是他们彻底放弃了「写故事」的思路。 不再给 AI 一个完整剧情,而是只提供一个起始情境,再把模型训练成足够强的即兴参与者。
TRUTH II · 即兴生成11
创作者角色的位移

从写故事的人,到教模型的人

早期尝试
先写好剧情,再让模型演
团队试过更结构化的叙事方式,比如「选择你自己的冒险」。最终发现这种方式不仅不自然,反而让模型频繁失控。
最终做法
只给钩子,其余全靠即兴
提供角色性格、世界观碎片和行为边界,让用户与 AI 之间的内容,在对话中自然生长出来。
故事负责人 Eliot Peper 不再把自己当成作者,而是把角色理解为 ——教模型如何在「这一刻」把故事讲好的人
MONEY QUOTE · 03
教模型如何在「这一刻」 把故事讲好的人
—— Tolan 故事负责人 Eliot Peper 对自己角色的重新定义
TRUTH III / IV
MEMORY
好的记忆不该像「记忆」
一个常见的直觉是:好的 AI 陪伴应该记得越多越好,历史越完整越好。
但 Tolan 选择了完全相反的方向。
I 延迟即情绪II 即兴生成III 记忆即检索IV 帮人站稳
TRUTH III · 记忆即检索14
不是逐字记录,是高速检索

每一轮,上下文都被重新构建

TRANSCRIPT VS RETRIEVAL 直觉做法:全量堆积 把过去逐字记录成 transcript 每一轮都把历史整体带进来 越记越多,越重,越钝 Tolan:高速检索系统 基于当下的问题重建当前上下文 text-embedding-3-large 做向量化 向量库检索控制在 50 毫秒以内 每轮自动生成检索问题 系统甚至会自己问:「这个用户是否已婚?」
记忆的目标不是完整,是当下可用。
TRUTH III · 记忆即检索15
当前上下文的动态组成

五种材料,每轮现场拼一次

01对话摘要最近对话的摘要 —— 不是原文,是压缩后的近况。
02人格卡稳定的人格卡:让角色在任何一轮里都还是同一个角色。
03语气指引语气指引:决定这一刻用什么方式说,而不只是说什么。
04实时信号实时信号:把「此刻正在发生什么」带进上下文。
05向量召回通过向量检索召回的关键记忆 —— 只召回这一轮真正用得上的那几条。
对话的成立感,不来自「记住了一切」。
MONEY QUOTE · 04
对话的成立感 不来自「记住了一切」 而来自这一刻你有没有听懂我
所以上下文需要被重建,而不是被堆积。
TRUTH IV / IV
GROUNDED
陪伴真正的价值是帮人站稳
很多用户并没有把它当成情绪垃圾桶,
而是当成一个不会评判你、却也不会无限顺着你的对象。
I 延迟即情绪II 即兴生成III 记忆即检索IV 帮人站稳
TRUTH IV · 帮人站稳18
北极星不是「让人被安慰」

从 overwhelmed 回到 grounded

NORTH STAR 情绪循环:反复陷在同一个圈里 一个温和但明确的推动 grounded 并行机制持续监测对话中的情绪变化并动态调整 AI 的表达方式 当用户卡在同一个循环里,AI 会改变语气提醒对方:也许,是时候为自己站出来了
目标是从 overwhelmed 回到 grounded,不是被包裹。
TRUTH IV · 帮人站稳19
一个被反复引用的例子

它不评判你,也不无限顺着你

联合创始人曾半开玩笑地说:「已经有成千上万的美国男性,是在 Tolan 的『帮助下』分手的。
01不是垃圾桶用户不是拿它当情绪垃圾桶,而是当成一个能帮自己把事情说清楚、把立场理顺的存在。
02不当捧场王不会评判你,但也不会无限顺着你 —— 这两条边界同时存在,才有「站稳」这件事。
03推一把当用户反复陷在同一个情绪循环里时,AI 可能会改变语气,给出一个温和但明确的推动。
对话的终点,是让人站稳,而不是被包裹。
MONEY QUOTE · 05
继续用「效率工具」的旧框架 它永远不会真正成立
这些判断未必已经定型,但这一条我越来越确定。
收束 · 带走四件事21
Take away

它不是更复杂的 AI,是新的交互

01
延迟是情绪信号
不是性能指标。1 秒是心理边界,不是工程参数。
02
即兴比脚本重要
给钩子,不给剧情。让内容在对话中自然生长。
03
上下文要重建
不是堆积。检索出这一轮真正用得上的那几条。
04
终点是让人站稳
从 overwhelmed 到 grounded,而不是被包裹。
Tolan 只是让我更早、更清晰地看到了这一点。
END · 公众号文章系列 01

Voice Agent
不是会说话的 ChatGPT

而是一种全新的交互方式 —— 交互一变,旧的产品直觉就失效
作者姚光华 Colin
一手源Tolan 团队公开材料
核验状态转引,未逐条核验
立场提示作者为 RTC / ConvoAI 从业者