公众号文章系列 · 02 · Side Project

PaperHunt
重新定义「论文阅读」

用一个 Side Project 做的 First Principles 实验
Speaker姚光华 Colin
Role声网 ConvoAI 产品负责人
Written2026.01 · 上海
Series公众号文章 #02
00
上周我盯着 arXiv 的搜索框 发了十分钟呆
不是不知道搜什么。是搜完之后 —— 不知道该读哪篇。
60 篇论文,每篇都「看起来重要」。但我只有两小时。
MONEY QUOTE · 01
问题不在于「懒」 论文不是用来「读」的 论文是用来发现洞察的
于是我做了一个实验:PaperHunt。
ACT I / IV
ORIGIN
从 ConvoBench 到 PaperHunt
这两年我持续在做 Voice Agent 相关的产品,每天和「延迟」「打断」「多轮对话」打交道。
但有一个问题始终困扰我 —— 我不知道这个领域的「底层规律」是什么。
I 起点II 三层架构III 发现引擎IV 价值与反思
ACT I · 起点05
From pain to product

评测只是手段,洞察才是价值

FROM PAIN TO PRODUCT 不知道这个领域的「底层规律」是什么 ConvoBench一个技术评测工具 发现评测只是手段真正的价值在洞察 PaperHunt洞察发现引擎 域名换成 paperhunt.org Insight > List 核心理念:先让人理解结构,再决定要不要深入某一篇
定位从「评测工具」迁移到「洞察发现引擎」。
ACT I · 起点06
三个 Google 搜不到答案的问题

我需要的不是列表,是知识结构

01200ms200ms 的响应延迟真的是铁律吗?还是只是某篇论文里的经验值?
02架构差异Cascade(ASR→LLM→TTS)和 Native Omni 架构的本质差异在哪?仅仅是「速度」吗?
03知识结构这些问题 Google 搜不到,arXiv 上的论文太碎片化。我需要的不是「论文列表」,而是「知识结构」。
所以我开始动手。 最初的版本叫 ConvoBench,一个技术评测工具。后来我发现,技术评测只是手段。
ACT II / IV
LAYERS
三层信息架构
我不想让用户面对 60 篇论文的列表发愣。
我想让用户先理解「这个领域的底层规律是什么」,然后再决定要不要深入某篇论文。
I 起点II 三层架构III 发现引擎IV 价值与反思
ACT II · 三层架构08
Insight first

法则、地图、索引:从上往下走

THREE LAYERS LAYER 1 · First Principles 5 条定义 Voice Agent 领域的底层规律,每一条都有论文背书 LAYER 2 · Evolution Map 4 个时代,从 1950 到 2026 —— 不只是时间线,是技术范式迁移图 LAYER 3 · Paper Index 60 篇定义性论文,分为 7 个 Tier,每篇都有一句话 oneLiner
不用打开 PDF,就能判断要不要深入。
ACT II · 三层架构09
Layer 1 · First Principles

5 条定义这个领域的底层规律

01200ms 铁律人类对话的轮换间隔约 200ms —— Levinson 2015 年的研究结论。想「像人」必须突破这个门槛。
02CascadeCascade 灵活可控,Omni 逼近生物速度。二者是工程权衡,不是技术迭代。
03音频即压缩EnCodec、SoundStream 把语音变成离散 Token —— 真正让 LLM 理解语音的底层突破。
04ELIZA 效应1966 年的 ELIZA 揭示了人性真相:我们会下意识给规则系统赋予「智能」。这是心理学问题。
05预测优于反应好的对话 AI 不是「反应快」,而是「预测准」。dGSLM、LSLM 的核心是预测轮换时机。
每条法则都有论文背书,不是经验之谈。
MONEY QUOTE · 02
Insight > List 用户不需要更多数据 用户需要「懂」
这不仅适用于论文阅读,它适用于任何信息过载的场景。
ACT II · 三层架构11
Layer 2 · Evolution Map

四个时代,一张范式迁移图

1950 → 2026 Genesis 1950-1980 符号 AI · 图灵测试 · ELIZA Statistical 1980-2010 概率模型 · HMM · POMDP Deep Learning 2010-2020 端到端 · Transformer · Duplex Generative 2020-至今 原生多模态 · Omni · 全双工 这是一张「时间线」。但更重要的 —— 它是一张「技术范式迁移图」。
看懂迁移,才看得懂现在这一代为什么长这样。
ACT II · 三层架构12
Layer 3 · Paper Index

60 篇论文,7 个 Tier

SEVEN TIERS · 60 PAPERS TIER 0名人堂 ELIZAAttention IsAll You Need TIER 1理论基础 基本假设与形式化 TIER 2The Ear 输入端识别与切分 TIER 3The Brain 处理端理解与决策 TIER 4The Voice 输出端 · 合成 TIER 5工程与评估 TIER 6全球化 每篇论文都有 oneLiner —— 一句话告诉你它的核心贡献。
只关心语音合成?直接进 Tier 4。这是需求匹配,不是信息轰炸。
ACT III / IV
ENGINE
从静态列表到自动发现
手动整理 60 篇论文是第一步。
但 Voice Agent 是一个高速演进的领域,每周都有新论文 —— 我不可能每周手动刷 arXiv。
I 起点II 三层架构III 发现引擎IV 价值与反思
ACT III · 发现引擎14
Discovery Feed

每天自动扫一次 arXiv

DISCOVERY PIPELINE 后台 Cron Job 每天扫描 arXiv 22 个关键词覆盖 自动去重 · 自动入库 ASR · TTS · 多模态语音 LLM WHERE TO STORE 最初想法:用 JSON 文件存增量论文部署后直接报错:只读文件系统 迁移到 Vercel Marketplace 的 Redis用 node-redis 直连云端 KV 存储
打开 paperhunt.org/discovery,就是最新的行业动态。
ACT III · 发现引擎15
一个典型的「本地思维」陷阱

部署后的第一行报错

# Vercel 的 Serverless 环境是只读文件系统 $ 写入 data/papers.json EROFS: read-only file system
解决方案是迁移到 Vercel Marketplace 的 Redis,用 node-redis 包直连云端 KV 存储。
这个坑让我学到一课。
MONEY QUOTE · 03
Serverless 不是「服务器」 它是「无状态函数」
本地跑得通,不代表云上跑得通。
161
发现引擎上线后,我跑了一次 2024-2026 的批量回填:161 篇新发现论文。
这些论文不在我最初的 60 篇「True Master List」里,但它们是活跃的、最新的行业动态 —— 包括 NVIDIA 的 PersonaPlex、VoiceAgentEval 等高价值研究。
从此,跟不上行业动态这件事,交给 Cron Job。
ACT IV / IV
VALUE
它到底解决了什么问题
回到最初的问题 —— 如果我是一个 Voice Agent 领域的 PM,
我为什么需要 PaperHunt?
I 起点II 三层架构III 发现引擎IV 价值与反思
ACT IV · 价值与反思19
PM 视角的三个痛点

大多数 PM 的知识结构是碎片化的

PAIN 01
不知道底层规律
我们知道「200ms 很重要」,但不知道为什么;听说过 Omni,但不知道它和 Cascade 的本质区别。
→ First Principles 层直接给答案。
PAIN 02
不知道读哪篇
60 篇太多了。只关心语音合成就点 Tier 4,只关心评估方法就进 Tier 5。
→ 这是需求匹配,不是信息轰炸。
PAIN 03
跟不上动态
每周都有新论文,人力刷不过来。Discovery Feed 每天自动更新。
→ 打开 /discovery 就是最新动态。
用户不需要更多数据,用户需要「懂」。
ACT IV · 价值与反思20
Side Project 的真正价值

一个人做完,它教了我三件事

01真实动机产品感来自「解决自己的痛点」。我不是为了做产品才做 PaperHunt,是因为自己需要 —— 这种动机决定了产品的真实性。
02务实选型Next.js + Vercel + Redis。没有微服务,没有 K8s。一个人能运维的架构,才是好架构。
03洞察优先「洞察 > 信息」是通用法则。它不只适用于论文阅读,适用于任何信息过载的场景。
下一步我想做的是 —— 把 First Principles 做成可交互的「知识图谱」,让每条法则都连接到相关论文、相关产品、相关技术选型。
这个实验,我还在继续。
MONEY QUOTE · 04
读论文的目的不是「读完」 是「获得洞察」
PaperHunt 就是这个理念的产品化尝试。
END · 公众号文章系列 02

Insight > List
洞察,而不是列表

60 篇 → 161 篇 —— 一个人的 First Principles 实验
作者姚光华 Colin
一手源作者自建项目 paperhunt.org
写作时间2026 年 1 月 · 上海
立场提示项目为作者本人 Side Project