公众号文章系列 · 03 · 第一性原理

我们的一生
只有 0.29TB

从第一性原理看 AI 录音的价值上限
Speaker姚光华 Colin
Role声网 ConvoAI 产品负责人
Series公众号文章 #03
Date2026.07
00
人类一生 大约会听到 10 亿个词
A human hears on the order of a billion words in their lifetime.
如果人类听到的词汇是恒定的,那么 AI 录音设备的市场到底有多大?
10 亿词
这是一生通过耳朵接收到的总词数 —— 包括听别人说的,也包括听自己说的。
上周末我和闪电说 CEO 余猛一起参加了一个线下 Voice Agent 分享会,他的 Presentation 里提到了前 OpenAI 首席科学家 Ilya Sutskever 分享过的这个洞察。Plaud 的产品负责人秀才也是分享嘉宾之一。 (该数字经现场分享转引,非一手核验;Ilya 的「10 亿词」本身也是宏观估算。)
序 · 一个被误解的起点04
先把那个逻辑悖论摊开

之前的估算,错在哪一步

THE HIDDEN PARADOX 之前的分析 把「用户说的话」(3.4 亿词)等同于「录音设备录的内容」 既然「听」是 10 亿,那「说」也大致相当,或按比例折算 回到第一性原理 录音设备录的是「我选择录制的、包含各方声音的完整音频场景」 所以基准不是我说出的词,而是我听到的那个巨大环境 一个字之差,市场估算就差了三倍。
错误的基准,会让整张市场地图跟着歪。
LAYER I / VI
HEARING
重新理解「听」
「听」是通过听觉通道接收到的所有语言信息 ——
既包含听别人说话(外部输入),也包含听自己说话(语言产生时的自我监控)。
I 听是什么II 媒体放大III 录的是什么IV 0.29TB V 全球尺度VI 市场边界
LAYER I · 听是什么06
10 亿词的三种来源

三种场景,构成了全部听觉输入

THREE MODES OF HEARING 场景 1 · 单向听 我在听,别人在说,我不说话 看视频、听播客、听讲座、听音乐 听觉输入的最大来源 纯粹信息消费者的状态 场景 2 · 双向对话 我和对方轮流说话 面对面聊天、电话、视频会议 既听到对方说的 也听到自己说的 场景 3 · 单向说 我在说,没有对话对象 自言自语、录制视频、演讲 听到的是自己的声音 自我表达时的状态
这三种场景加起来,就是那 10 亿词的全部构成。
LAYER I · 听是什么07
一天的时间账

从每天 13,000 词推到一生

01说话量根据 2018 年的研究数据,现代人平均每天说话约 13,000 词
02说话时长按 150 词/分钟的说话速度,相当于每天说话约 1.5 小时。
03音频消费Nielsen 2025 年第一季度数据:美国成年人每天音频消费达 3.9 小时,且不含视频内容与面对面交流。
04一生说出一生按 80 年计,排除婴幼儿期与部分老年期,约 72 年有效期:13,000 × 365 × 72 ≈ 3.4 亿词
以上推导基于公开研究数据。不同职业(教师 vs 程序员)、社交习惯与媒体消费偏好都会让数字显著差异,但「听远多于说」这个核心洞察普遍成立。
LAYER I · 听是什么08
把两个数字放在一起

说 3.4 亿,听 10 亿

SPOKEN VS HEARD · A LIFETIME 一生「说出」 3.4 亿词 一生「听到」 10 亿词 我们听到的信息量,接近表达的 3 倍。这个不对称性,正是 AI 录制设备的核心价值所在。
我们一生「说出」的词,只相当于「听到」的约 1/3。
MONEY QUOTE · 01
我们的大部分人生 都在做一个「沉默的接收者」
听播客、看视频、参加会议、接受培训 —— 录音的价值,首先在于记录我们听到的那些转瞬即逝的外部信息。
LAYER II / VI
MEDIA
为什么「听」远大于「说」
接近 3:1 的听/说比例背后,是现代媒体无与伦比的放大效应。
这一洞察至关重要,因为它彻底改变了我们对录音市场的理解。
I 听是什么II 媒体放大III 录的是什么IV 0.29TB V 全球尺度VI 市场边界
LAYER II · 媒体放大11
一次说,一千万次听

10 亿词里,大部分是被复制的

THE AMPLIFIER 1 万词 一个热门播客的内容 主播只「说」一次 1000 万次 被下载、被播放 1000 亿次 社会级的听觉输入 我们听到的 10 亿词,大部分来自这种被大规模复制和分发的媒体内容, 而非面对面的一对一交流。
这就是为什么,录音市场的基准必须换。
LAYER III / VI
RECORDING
Plaud 到底在录什么
它录制的不是「我说的话」(3.4 亿词),
而是「我选择录制的、包含各方声音的完整音频场景」。
I 听是什么II 媒体放大III 录的是什么IV 0.29TB V 全球尺度VI 市场边界
LAYER III · 录的是什么13
把使用场景对回三种「听」

录的是场景,不只是我的输出

01现场讲座现场讲座 / 线下活动 → 对应「单向听」→ 录的是讲者说的话。
02通话会议通话 / 会议 → 对应「双向对话」→ 录的是双方、多方说的话。
03录制备忘录制备忘 / 灵感 → 对应「单向说」→ 录的是我自己说的话。
重要限定:本文讨论的「录制」,仅指现实世界中尚未被数字化保存的声音场景,而非已经以文件形式存在的媒体内容(YouTube、Spotify 等)。
我们录的是想捕捉的场景,不仅仅是自己的输出。
MONEY QUOTE · 02
基准不是我说出的 3.4 亿词 而是我听到的 10 亿词
结论是颠覆性的:计算录制市场规模的基准,必须换成那个巨大的潜在环境。
LAYER IV / VI
QUOTA
量化那条价值上限
现在需要量化三种场景在一生中的实际占比,
以便精确定位 AI 录音设备的真正战场。
I 听是什么II 媒体放大III 录的是什么IV 0.29TB V 全球尺度VI 市场边界
LAYER IV · 量化16
从时间分配推场景占比

每天听 4.8 小时,一生 11.4 亿词

DAILY BUDGET → LIFETIME WORDS 单向听3.9h 双向对话里听对方0.6h 单向说时听自己0.3h 每天「听」合计4.8h 4.8 小时 × 60 分钟 × 150 词/分钟 = 43,200 词/天 43,200 × 365 × 72 年 ≈ 11.4 亿词(略高于 Ilya 的 10 亿,但在同一数量级) 为与 Ilya 的估算保持一致,按比例调整,得出三种场景的占比
同一数量级,说明这条推导路径站得住。
LAYER IV · 量化17
三种场景的占比

10 亿词,这样分给三个场景

01单向听3.9 小时/天 · 占比 81% → 8.1 亿词
02双向对话0.6 小时/天 · 占比 13% → 1.3 亿词
03单向说0.3 小时/天 · 占比 6% → 0.6 亿词
接下来的问题不是「一生听到多少」,而是这三份里,哪一份真的值得被录下来并长期保存
占比最大的那一份,不一定是市场最大的那一份。
LAYER IV · 量化18
逐场景筛一遍

真正可录的,只剩 2.5 亿词

WHAT IS ACTUALLY RECORDABLE 单向说 0.6 亿词 功能性表达 99%:语音输入法 / 指令 / 语音消息 即时转译,音频用完即扔(Disposable Audio) 表演与情感表达 1% → 0.006 亿词 约 0%:几乎不是这门生意的战场 单向听 8.1 亿词 线上内容 85% → 6.9 亿词 播客、YouTube、在线课程,已被数字化保存 线下内容 15% → 1.2 亿词(48%) 现场讲座与培训:稍纵即逝的高价值资产 双向对话 1.3 亿词 即时的、未被记录的 且包含双方的智慧碰撞 假设 100% → 1.3 亿词(52%) 全部视为潜在录制对象 总计 2.5 亿词 —— 占一生听到的 10 亿词的 25%。
0.29 TB
2.5 亿词 ÷ 150 词/分钟 ≈ 167 万分钟 ≈ 3.2 年连续音频 → 约 295 GB
码率按 25 kbps 估算(这周末我用 viaim 录了 42 分钟音频,实际文件 7.6MB)。
这就是价值上限:任何 AI 录音设备,为单个用户能长期保存、反复调用并产生复利价值的「生命上下文」(Lifetime Context),规模大约就在 0.29 TB 左右 —— 它同时构成了 LTV 的实际天花板。
MONEY QUOTE · 03
语音输入法 = 文字工具 AI 录音机 = 记忆工具
前者的音频是用完即扔的耗材,后者的音频是承载信息的资产。两者泾渭分明。
AI 录音设备是纯粹的「环境捕获器」—— 它存在的全部意义,是捕获那 52% 的双向对话和 48% 的线下单向听。
LAYER V / VI
SCALE
放大到全球:每日 86PB
把 2.5 亿词均匀分摊到一生(80 年),
相当于每天约 57 分钟的被记录音频。
I 听是什么II 媒体放大III 录的是什么IV 0.29TB V 全球尺度VI 市场边界
LAYER V · 全球尺度22
假设 100% 渗透

每天 86PB 的数据洪流

GLOBAL · PER DAY 80 亿人× 每天 57 分钟 76 亿小时 / 天 68.4 万亿词 / 天 86 PB存储增量 / 天 这些天文数字展示了把人类全部对话外部化所面临的技术挑战与商业机遇。
86PB/天 —— 按 25 kbps 码率推算。
LAYER VI / VI
MARKET
硬件与云服务的边界
硬件是一次性的入口,云服务是持续性的收入。
但真正的价值不在存储本身 —— 存储成本会随技术发展而下降。
I 听是什么II 媒体放大III 录的是什么IV 0.29TB V 全球尺度VI 市场边界
LAYER VI · 市场边界24
硬件一次性 · 云服务持续性

两个市场,两种收入结构

015% 渗透4 亿用户 × 150 美元设备单价 = 600 亿美元(一次性销售)
0215% 渗透12 亿用户 = 1800 亿美元
0330% 渗透24 亿用户 = 3600 亿美元。巨大的存量市场,但竞争会集中在入口的争夺上。
04对象存储按 15% 渗透、每用户 300 GB、平均填充率 50% 估算:约 500 亿美元/年($50 Billion)
05深度归档同样条件下的深度归档存储:约 21 亿美元/年($2.1 Billion)
真正的价值在索引、搜索、摘要与分析。
MONEY QUOTE · 04
商业模式的终局 是从「卖存储」转向「卖智能」
存储成本会随技术发展而下降;对这 0.29TB 做索引、搜索、摘要、分析的能力不会。
终章 · 0.29TB 里的价值问题26
完整的逻辑链条

从 10 亿词,走到 0.29TB

FIRST PRINCIPLES CHAIN 10 亿词一生听到的总量 三大场景听 / 对话 / 说 2.5 亿词真正可录的部分 3.2 年连续音频时长 0.29 TB生命上下文配额 AI 录音硬件并不是在争夺一个无限的市场,而是在争夺每个人有限的这份配额。
竞争的终局不在于「能录多久」, 而在于「什么值得被录制」,以及「如何让录下的内容产生价值」。
MONEY QUOTE · 05
如果说人类的灵魂重 21g 那么一生真正值得被保存的记忆 大约重 0.29TB
既然只有 0.29TB,也许我们更应该在乎这 0.29TB 里,到底记录了什么。
END · 公众号文章系列 03

记忆,正是
人之为人的核心

10 亿词 → 2.5 亿词 → 3.2 年 → 0.29 TB
作者姚光华 Colin
数据源Nielsen 2025 Q1 · 2018 研究
核验状态Ilya 数字为转引估算
立场提示作者为 RTC / ConvoAI 从业者