A COURSE ON WORKING WITH AGENTS
带一个新同事上班
如何让你的 Agent 产生恒动复利
Speaker姚光华 Colin · AI 产品经理
对象已经在用 AI、但用得浅的人
带走一个公式 · 四个动作 · 三份模板
PART 0 · 开场02
为什么会有这门课
这门课不是我想讲的,是被问出来的
最近我反复收到同一句反馈:
「你能不能开个课,讲下你个人是咋用 AI 的。」
「你能不能开个课,讲下你个人是咋用 AI 的。」
注意这句话问的是「你个人」——不是问工具怎么用,是问一个具体的人,是怎么把它用出复利的。
这一年,AI 在我这里的实际产出
| 54 篇 | 协作交接日志,每篇都能让下一次直接接上 |
| 6 套 | 把重复劳动固化下来的可复用流程 |
| 20+ 周 | 周报从"每次都要盯"变成一句话交付 |
| 1 个 | 每天自动跑、带护栏的情报机器人 |
| 9 份 | 一投喂就"在状态"的个人背景包 |
这些不是技巧的集合。它们是同一件事重复了 200 次的结果。
先说一句让你放心的:今天不会出现任何提示词模板。我用 AI 一年多,没背过一个——因为那个东西不解决今天要解决的问题。
01
灵魂拷问 · 请举手
你用 AI 已经一年多了。
今天的你,比第一个月强了几倍?
今天的你,比第一个月强了几倍?
不是问你是不是更熟练了、用得更频繁了、知道更多技巧了。
是问同一件活,你今天的成本,是一年前的几分之一?
如果答案是"差不多"那么这一年,你到底在做什么?——这就是今天要回答的问题。
现场问一句:这里有多少人,答案是"差不多"?
PART 0 · 开场04
核心分野
大多数人用 AI 是「等速」的,不是「复利」的
加法:每天省 1 小时,一年 250 小时。听起来不少,但第 200 次和第 1 次效率完全一样。换一台更快的电脑也能得到——没有人抄不走它。
复利:第 200 次更快、更准,而且别人抄不走。因为积累的东西长在你的判断和数据里,不长在工具里。
模型每年换一代,工具每月出新的。唯一会持续变厚的,是你自己那一层。
MONEY QUOTE · 01
复利不是省时间是让每一次协作都为下一次垫高一层
这句话是全场的分水岭。听懂它,后面四节讲的每一件事都会自动归位。
PART 0 · 开场06
课程目标
今天这一场,你会学到四件事
每一件都对应一个乘数,每一件都从一个真实的翻车现场进入。
01
Taste
怎么判断
AI 给你的东西好不好
AI 给你的东西好不好
你会拿到一套把"我说不清但就是不对"翻译成可执行标准的方法。
02
Thinker
哪些事
永远不能交给它
永远不能交给它
你会看到一条清楚的界线:人在最上游和最下游,AI 在中间那一大段。
03
Dataset
怎么让它
越用越像你
越用越像你
你会知道自己一直在做一件叫后训练的事,以及该喂哪五层。
04
Compounding
怎么让今天的纠正
明天自动生效
明天自动生效
你会拿到一句话——整门课唯一需要背下来的那一句。
还有一件事贯穿全场:七次灵魂拷问。每一个反直觉的结论之前,我都会先问你一个问题——先让你自己撞一下墙,答案才有用。
PART 0 · 开场07
交付物
下课时,你手里会有这五样东西
听完会爽,带着东西走才会真用。这一页你可以现在就拍下来。
01
一个公式
恒动复利 = Taste × 思想者 × 数据集 × 沉淀。
四个乘数,任何一项为 0,整个飞轮不转。
四个乘数,任何一项为 0,整个飞轮不转。
02
四个今晚能做的动作
每个乘数配一个具体动作。
四个加起来,今天多花不到 20 分钟。
四个加起来,今天多花不到 20 分钟。
03
三份模板
员工手册 / 交接日志 / 护栏卡片。
加起来不到一页纸,一个备忘录就能开始。
加起来不到一页纸,一个备忘录就能开始。
04
一张四阶自测表
看过 / 用过 / 学过 / 干过——现场知道自己卡在哪一阶,以及下一步该迈哪儿。
05
四条护栏 + 一条红线
让 AI 犯的错变得可被发现——注意,不是"防止它犯错",这是完全不同的两件事。
PART 0 · 开场08
全场地图
六段路,两个半场
这不是四个并列的技巧。它们最后会咬合成一个飞轮——到 Part III 结尾你会看到它合上的那一刻。
PART 0 · 开场09
全场只需要记住一个公式
恒动复利,是四个乘数的积
是乘法,不是加法。任何一项为 0,整个飞轮不转——这解释了为什么很多人"什么都做了",却依然等速。
前两个乘数关于你(判断、框架),AI 再强也补不上;后两个乘数关于机制,让前两个能被存下来、被复用。
PART 0 · 开场10
对号入座
四种「等速」的失败模式
这四句话里,大概率有一句是你现在的状态。
| 缺哪个乘数 | 症状 | 你会说的话 | 根因 |
|---|---|---|---|
| 没有 Taste | 越用越平庸 | "写得挺好的呀,我看不出问题。" | 收到的是"看起来很对"的平庸,而你没有尺子去量它。 |
| 不当思想者 | 越用越同质 | "你帮我想个框架吧。" | 框架交给 AI,输出就跟全世界一样。独特性只能来自你。 |
| 没有数据集 | 越用越累 | "每次都要重新解释一遍背景。" | 每个新对话都是新员工第一天。它永远认不得你。 |
| 没有沉淀 | 越用越原地 | "这个错误它上次就犯过。" | 第 100 次还在纠正第 1 次的错。所有纠正都被扔掉了。 |
接下来四节,一个乘数一节。每一节的入口都是一次真实的翻车——因为方法论最好的入口,是它失效的那一刻。
PART I · MULTIPLIER 01
TASTE
判断力
AI 的输出上限,不是模型的上限,是你判断力的上限。
你说不出"为什么这版更好",它就永远给你及格线上的平庸。
你说不出"为什么这版更好",它就永远给你及格线上的平庸。
01 Taste02 思想者03 数据集04 沉淀
02
灵魂拷问 · 想三秒再答
上一次你对 AI 的输出说"挺好的",
你能说出它到底好在哪吗?
你能说出它到底好在哪吗?
如果说不出那你怎么让它下一次也这么好?你没有尺子。
更麻烦的是你也不知道它这次其实没那么好——因为你没有尺子。
接下来我们看一份"完全正确"的周报,它错得非常离谱。
现场问一句:有没有人愿意说说,你上次是怎么判断"这版更好"的?
PART I · TASTE13
命题
换更强的模型,救不了没有 taste 的人
大部分人的假设
输出不好 = 模型不够强
于是换模型、换工具、加长提示词。短期有效,很快又回到同一个平台期。
实际发生的事
输出不好 = 没人判定它不好
模型交出的是概率上最合理的答案。合理 ≠ 正确,更 ≠ 你要的那个。
PART I · TASTE14
翻车现场 #1
一份「完全正确」的周报
场景:我每周要把团队十几个模块填在系统里的进展,提炼成给管理层口头汇报的三句话。
AI 交出的第一稿
· 格式完全对,段落层级清楚
· 语言流畅,术语准确
· 长度合适,重点分明
· 看不出任何毛病
· 语言流畅,术语准确
· 长度合适,重点分明
· 看不出任何毛病
如果你不熟这块业务,你会直接发出去。
实际发生了什么
它把两周前的事,写成了本周的进展。
压测、云弹性方向、Alpha 调通、市场线索——
四件事全部发生在两周前,被写进了本周的周报。
压测、云弹性方向、Alpha 调通、市场线索——
四件事全部发生在两周前,被写进了本周的周报。
流畅度和正确率,是两件不相关的事。
发出去会怎样:管理层看到的是已经报告过的旧事被当成新进展——一次汇报,赔掉的是长期的可信度。
PART I · TASTE15
拆解
它没有说谎。它只是抄错了地方。
0
更强的模型能减少的错误数。
因为这不是能力问题,是信息权威层级问题。
因为这不是能力问题,是信息权威层级问题。
AI 会本能地抓"最像成品的那一块"。这是它的默认行为,不是它的缺陷。
知道哪份材料才算数的,只有在场的人。
这就是 taste 的第一个具体形状。
这就是 taste 的第一个具体形状。
MONEY QUOTE · 02
模型决定下限Taste 决定上限
当模型对所有人都一样强的时候,唯一还能拉开差距的,是你判断它的能力。
PART I · TASTE17
定义
Taste,是你的私人 Eval
一条判断只存在于一个人脑子里,它是经验。
一条判断被写成可重复执行的评测,它才开始成为资产。
一条判断被写成可重复执行的评测,它才开始成为资产。
大部分人的 taste 卡在 Level 0:能感觉,不能表达。于是每次都要亲手改,改完也留不下任何东西——这是"越用越累"的真正来源。
从 0 到 1 只差一个动作:每改一处,逼自己补一句"我为什么改这里"。
PART I · TASTE18
证据
同一份材料,AI 版 vs 我的定稿版
给管理层的三句话摘要。两版都"正确"。差别全在 taste。
AI 第一版
01引擎 V2.7 与语音识别 V7.2.2 双双按期全量上线;后续两个版本排期成型。
02⚠ 引擎上线后出现超时故障(部分客户启动报错)已紧急止血,补丁本周内发布。
03重点客户转化率达标;语音识别月收入同比增长显著、自研模块毛利转正;另一客户测试通过进入预算审批。
四平八稳、信息完整、无可指摘。
我的定稿版
01季度重点客户外呼转化率达到目标的 3 倍。
02⚠ 引擎上线后超时故障(含 某重点客户启动报错)已紧急止血,补丁本周内发布。
03语音识别月收入同比 +93%、自研模块上月毛利转正。
同样三句,管理层 15 秒内抓到的东西完全不同。
PART I · TASTE19
把感觉翻译成规则
三处改写,背后是三条模型给不出的判断
| 改动 | 背后的判断 | 为什么模型给不出 |
|---|---|---|
| 重点客户 提到第一句 | 这个季度只有一件事最重要, 版本节奏可以往后放。 |
"什么最重要"取决于本季度的组织目标——这条信息不在任何一份材料里,只在我脑子里。 |
| 受影响客户 具名 | "部分客户"是安全的废话, 具名才会触发管理层的判断。 |
模型倾向于泛化(更安全、更不会错)。敢具名是一种风险承担,不是语言能力。 |
| 第三句 不再串第四件事 | 一句一信号。 串到第四件事,这句就废了。 |
模型的默认倾向是"信息尽量不丢"。删掉正确的信息,需要判断,不需要知识。 |
注意这三条的共同点:它们都不是"写得更好",而是"选得更对"。写作是模型的强项,取舍不是。
这三条我当天就写进了规则文件。从那以后,同类摘要它自己就这么写了。
MONEY QUOTE · 03
Taste 不是天赋是被逼着说出理由的次数
你不需要变成一个更有品味的人。你只需要在每一次修改之后,多说一句为什么。
PART I · TASTE21
可操作
三个动作,把 taste 从 Level 0 拉到 Level 2
动作 01先自己写一版
哪怕只写三行、只写个开头。然后再让 AI 写一版,两版并排。
你的 taste 就藏在两版的差异里——那些"我不会这么写"的地方,就是你的判据。
你的 taste 就藏在两版的差异里——那些"我不会这么写"的地方,就是你的判据。
动作 02改完必须说出理由
每改一处,逼自己补一句"我为什么改这里"。
说不出理由的改动,多半是习惯不是判断——那种改动不值得写进规则。
说不出理由的改动,多半是习惯不是判断——那种改动不值得写进规则。
动作 03建自己的正例库
你认可的成品单独存一个地方:最好的一版周报、最好的一封邮件、最好的一页 deck。
正例库就是你的评分标准,也是下次最有效的输入。
正例库就是你的评分标准,也是下次最有效的输入。
最省力的起手式
不要说"帮我写一份周报"。
要说:"照这份(上次我自己定稿的)的格式和取舍标准,用这批新材料再做一份。"
一句话,同时给了它正例和判据。
要说:"照这份(上次我自己定稿的)的格式和取舍标准,用这批新材料再做一份。"
一句话,同时给了它正例和判据。
最容易被忽略的一条
Taste 是领域特定的。你在自己业务里判断力极强,换个领域就归零。
所以别在你没有 taste 的领域,指望 AI 帮你产出高质量结果——那里你连验收都做不到。
所以别在你没有 taste 的领域,指望 AI 帮你产出高质量结果——那里你连验收都做不到。
PART I · TASTE22
最常见的陷阱
把「顺」当成「对」
≠
流畅度与正确率之间,
没有相关性。
没有相关性。
人类的直觉是反过来的:说话越有条理的人,我们越倾向于相信他。这个直觉在 AI 面前完全失效。
验收时,问题要换一种问法
| ❌ 你现在在问 | ✅ 你应该问 |
|---|---|
| "写得怎么样?" | "这一条的出处是哪份材料?" |
| "读起来顺不顺?" | "哪几条是你推断的,不是材料里写的?" |
| "逻辑通不通?" | "最重要的那件事,在第几句?" |
| "有没有遗漏?" | "你逐项检查一遍,有没有该删没删的?" |
左边那四个问题,AI 永远回答"挺好的"。右边那四个问题,它必须回到材料里去核对——问法本身就是一道护栏。
PART I · TASTE23
Part I 小结
带走一句,带走一个动作
带走这一句
模型决定下限
Taste 决定上限
Taste 决定上限
你的 taste 就是你的私人 Eval。它不是天赋,是被逼着说出理由的次数。
今晚就做这一个动作
改完之后,
逼自己说出一句"我为什么改这里"
逼自己说出一句"我为什么改这里"
说得出的,写下来——它就是一条规则。
说不出的,那多半只是习惯,别写。
耗时:每次 10 秒。
说不出的,那多半只是习惯,别写。
耗时:每次 10 秒。
下一节:你已经有了尺子。但如果该往哪想这件事也交给它——你会掉进一片一模一样的海。
PART II · MULTIPLIER 02
THINKER
人做思想者
用得越深的人,越不会把第一性原理层的框架交给 AI。
思想者是人,AI 是执行者,和查漏补缺者。
思想者是人,AI 是执行者,和查漏补缺者。
01 Taste02 思想者03 数据集04 沉淀
03
灵魂拷问 · 诚实回答
你上一次让 AI「帮你想一个框架」,
是什么时候?
是什么时候?
如果是这周那你要小心:你外包出去的,可能正是这件事上唯一属于你的东西。
代价不是"错"而是"平庸而不自知"——你会拿到一个专业、安全、无可指摘的答案。
接下来我用一个词,来说明那一步跳跃它为什么迈不出去。
现场问一句:你们觉得,什么样的问题最不该问 AI?
PART II · THINKER26
反直觉
越会用 AI 的人,问它的问题越「小」
用得浅的人问
"帮我想一个分析框架。"
"这个问题应该怎么切?"
"给我三个方向,我选一个。"
"你觉得我该做什么?"
"这个问题应该怎么切?"
"给我三个方向,我选一个。"
"你觉得我该做什么?"
共同点:把"该往哪想"外包了出去。
得到的一定是训练数据里的中位数答案。
得到的一定是训练数据里的中位数答案。
用得深的人问
"我的框架是 A/B 两层,帮我按这个把材料填进去。"
"我认为结论是 X,帮我找三条最强的反驳。"
"这一版我加了一个隐喻,逐页检查哪里没跟上。"
"把我刚才改你的地方,总结成下次的规则。"
"我认为结论是 X,帮我找三条最强的反驳。"
"这一版我加了一个隐喻,逐页检查哪里没跟上。"
"把我刚才改你的地方,总结成下次的规则。"
共同点:框架我出,剩下的你干。
它的能力被用在了它真正强的地方。
它的能力被用在了它真正强的地方。
这不是谦虚,是分工。让 AI 定义问题,等于放弃了这件事上唯一属于你的东西。
PART II · THINKER27
分工
人在最上游和最下游,AI 在中间那一大段
大多数人只用了中游的"收集、整理、扩写"三格,完全没有用"查漏与反驳"——它没有沉没成本、不怕得罪你、不会因为熬夜写完而舍不得删。它是最好的红队。
PART II · THINKER28
案例 · 上半场
一个词的差距
场景:准备一场行业大会的主题演讲,要把过去 18 个月分别讲过的两条线,第一次合并成一张完整的地图。
我给的输入(这是我出的框架)
"两条线要合体,
不做合订本,
要升维成一张地图"
不做合订本,
要升维成一张地图"
框架、目标、禁区,全部由我给定。
AI 给的答案
"分化为两个品类"
专业、安全、无可指摘。
也平庸——这是行业黑话,谁都能想到,听完就忘。
也平庸——这是行业黑话,谁都能想到,听完就忘。
我反推的一句话
"中文用物种,
会不会比品类更好?"
会不会比品类更好?"
整场演讲的世界观,从这一句开始重建。
为什么"物种"完胜
① 中英完美对仗(species ↔ 物种),标题一眼成立
② 和已有的"两个半球"自洽成同一套生物地理学语境
③ "分化 + 物种"是教科书级搭配,"品类"反而把场子压扁
④ 它带出了下半句——同源进化:一颗引擎,两个物种
② 和已有的"两个半球"自洽成同一套生物地理学语境
③ "分化 + 物种"是教科书级搭配,"品类"反而把场子压扁
④ 它带出了下半句——同源进化:一颗引擎,两个物种
这四条理由 AI 事后都能说得很好。
但那一步跳跃,它没有迈。
但那一步跳跃,它没有迈。
PART II · THINKER29
案例 · 下半场
同一个案例的另一半:它救了我
隐喻定了,接下来是把它贯穿到 45 页里。这一步我做不好,它做得比我好。
第 1 轮我自己列的修订清单
封面 + 四张"脊椎骨"页 = 5 张。
我以为已经覆盖了。
我以为已经覆盖了。
第 2 轮我追问了一句
"再仔细检查一下,逐项有没有漏掉的。"
没有给任何新信息,只是让它重新扫一遍。
没有给任何新信息,只是让它重新扫一遍。
结果补出了 6 张承重页
两张分节扉页、一张背书页、一张收尾页、一张架构图、一张能力页——全是隐喻系统的骨节。
代价如果不问那一句
这份 deck 会是半新半旧的:前面讲物种,中间突然回到旧语言。
观众说不出哪里不对,但会觉得不对。
观众说不出哪里不对,但会觉得不对。
我漏掉那 6 张,不是因为不认真,是因为我写了两天,我的眼睛已经不看细节了。它没有这个问题。
同一件事,我的第一轮命中 5/11,追问一句之后 11/11。这一句话的边际收益,比任何提示词技巧都高。
MONEY QUOTE · 04
"再仔细检查一下逐项有没有漏掉的"
整门课里投入产出比最高的一句话。不给新信息,只让它重扫一遍——几乎每一次都能捞出东西。
PART II · THINKER31
合起来看
一个案例,同时证明了两件事
上半场
01
思想者是人
"物种"这一步跳跃,来自我对整场演讲的世界观、对中文语感、对听众的判断。
这三样都不在材料里,只在我这里。
如果我把"想一个统一隐喻"整个交给它,我会拿到一个专业、安全、平庸的答案, 而且我不会知道自己错过了什么——这才是最危险的部分。
这三样都不在材料里,只在我这里。
如果我把"想一个统一隐喻"整个交给它,我会拿到一个专业、安全、平庸的答案, 而且我不会知道自己错过了什么——这才是最危险的部分。
下半场
02
查漏补缺是 AI
把一个隐喻贯穿到 45 页、逐页检查一致性——这件事我做得不如它。
我有疲劳、有盲区、有"我已经写过了"的自我确认。它一样都没有。
它不需要理解"物种"的诗意,只需要机械地问:这一页的语言,跟新定的隐喻一致吗?
这恰恰是机器最擅长的活。
我有疲劳、有盲区、有"我已经写过了"的自我确认。它一样都没有。
它不需要理解"物种"的诗意,只需要机械地问:这一页的语言,跟新定的隐喻一致吗?
这恰恰是机器最擅长的活。
所以正确的用法不是"人机各干一半",而是:人在最上游和最下游,AI 在中间那一大段。
PART II · THINKER32
代价
把框架交出去,你会掉进一片一模一样的海
同质化发生在三个层面
| 层面 | 症状 |
|---|---|
| 结构 | 都是"三个维度 / 四个象限 / 五大趋势",都有一个总分总。 |
| 措辞 | 都在用"赋能、抓手、闭环、深度融合"这一批安全词。 |
| 判断 | 都不得罪人,都留有余地,都没有立场。 |
前两层是风格问题,改改就好。
第三层是致命的——没有立场的东西,没有人会记住。
第三层是致命的——没有立场的东西,没有人会记住。
AI 让"做出一个还不错的东西"变得极其便宜。正因为如此,"还不错"第一次变得毫无价值。
MONEY QUOTE · 05
AI 能帮你把话说得更好但不能替你决定该说什么
它是最好的执行者,也是最好的红队。唯独不能是思想者——那个位置一旦空出来,就再也填不回去了。
PART II · THINKER34
Part II 小结
带走一句,带走一个动作
带走这一句
人在最上游和最下游
AI 在中间那一大段
AI 在中间那一大段
定义问题、给出框架、下判断担后果——三件不可让渡。查漏与反驳——它最强,而你几乎没用过。
今晚就做这一个动作
把"帮我想个框架"
换成"我的框架是 A/B,你来填"
换成"我的框架是 A/B,你来填"
再加一句收尾:"逐项检查一遍,有没有漏掉的。"
一头一尾,把它放回它该在的位置。
耗时:0 分钟,只是换个说法。
一头一尾,把它放回它该在的位置。
耗时:0 分钟,只是换个说法。
下一节:尺子有了,框架也是你的了。但如果每次开新对话它都不认得你,前面这两件事每天都要重来一遍。
PART III · MULTIPLIER 03
DATASET
个人数据集
你和别人用的是同一个模型。差别在于——它读过谁的东西。
你在做的,其实是一件叫「后训练」的事。
你在做的,其实是一件叫「后训练」的事。
01 Taste02 思想者03 数据集04 沉淀
04
灵魂拷问 · 这一问最扎心
如果明天你换一个全新的 AI,
你要花多久,才能让它回到今天的状态?
你要花多久,才能让它回到今天的状态?
如果答案是"几分钟"恭喜,你有数据集——你只需要把它整包扔过去。
如果答案是"要重新磨很久"那说明这一年的磨合,全部存在了一个你带不走的地方。
最坏的答案是"我也不知道我都跟它说过什么。"——那就等于什么都没积累。
现场问一句:有多少人,今天的对话记录里躺着自己再也找不回来的东西?
PART III · DATASET37
先打个比方
模型是一个读过全世界、但不认识你的人
在讲"该喂它什么"之前,先花两页把它是怎么来的说清楚——这是全场最需要讲透的一段。
第一步 · 他读书
读完了人类的图书馆
没有人教他任何具体任务。他只是把海量文本读了一遍又一遍,学会了语言、常识、推理的底子。
结果:他什么都懂一点,但不知道该怎么跟人说话。
结果:他什么都懂一点,但不知道该怎么跟人说话。
第二步 · 有人教他做事
学会了怎么回答
有人给他示范"好的回答长什么样",再让他在两个答案里选更好的那个,反复很多轮。
结果:他变得有礼貌、听指令、会拒绝——但这套标准是厂商的,不是你的。
结果:他变得有礼貌、听指令、会拒绝——但这套标准是厂商的,不是你的。
第三步 · 他来到你面前
什么都懂,
就是不认识你
就是不认识你
他不知道你是谁、你在做什么、你这周卡在哪、你讨厌哪种表达、你的红线在哪。
你要做的,不是重训他的大脑——是给他一份关于你的档案,和一套跟你合作的规矩。
你要做的,不是重训他的大脑——是给他一份关于你的档案,和一套跟你合作的规矩。
所以这一节真正的命题是:厂商决定它懂多少,你决定它懂不懂你。
PART III · DATASET38
概述工作原理
一个模型,是用什么造出来的
用一条你熟悉的生产线来看:生产资料 → 生产工具 → 劳动力 → 生产力。
注意最后一格:它的目标函数简单到令人意外——只是预测下一个词。所有让你惊艳的能力,都是从这个目标里涌现出来的副产品。这也是它为什么会一本正经地编:"接下来最可能是什么"和"这是不是真的",本来就不是同一个问题。
PART III · DATASET39
那么你在哪一格
你改不了它的大脑,但你决定它每次看到什么
权重 · WEIGHTS
它"记住"的东西
由预训练和后训练写死,几千亿个参数。
改它需要:海量数据 + 大量算力 + 数周时间。
你改不了,绝大多数人也不需要改。
改它需要:海量数据 + 大量算力 + 数周时间。
你改不了,绝大多数人也不需要改。
上下文 · CONTEXT
它这一次"看到"的东西
每一次推理,它眼前只有你给的这一段。
改它需要:写一份文档。
这是唯一完全由你掌控的一层——也是 99% 的人真正在做的事。
改它需要:写一份文档。
这是唯一完全由你掌控的一层——也是 99% 的人真正在做的事。
01规矩
系统提示 / 手册
我是谁、我的风格、我的红线。每次自动加载。
02材料
知识库 / 检索
我的文档、我的历史、我的决策记录。按需取用。
03现场
工具 / 权限
让它能读文件、跑代码、查东西。把纸上谈兵变成动手。
所以"个人数据集"的准确定义是:你能在每一次推理时,塞进它视野里的一切。
它不改变模型,它改变这一次的模型行为——而那恰恰是你能拿到的全部杠杆。
PART III · DATASET40
核心模型
个人数据集的五层
从"资料"一路走到"你"。越往下越难写,也越值钱。
①事实层
我是谁、我负责什么、我做过什么。简历、职责、履历、当前角色。半年一更
②现场层
我的世界此刻正在发生什么:本周在推什么、卡在哪、谁在跟我协作、这季度的重点是谁。每周一更
③思考层
我正在想什么、我的框架、我的判断、我否掉了什么以及为什么。每次沉淀
④能力层
我的长处是什么、我的瓶颈是什么。它该在哪儿闭嘴,该在哪儿顶上。每季一更
⑤偏好层
我喜欢什么、讨厌什么、我的红线在哪。决定它的 taste 有没有跟你对齐。每季一更
大部分人只喂了 ①。所以无论怎么调提示词,都像在跟一个礼貌的陌生人说话。
② 是最容易被忽略、也最容易过期的一层——你的世界每周都在变,你的背景文档三个月没动过。
PART III · DATASET41
第 ① ② 层
事实层与现场层:让它知道你是谁、你在哪
① 事实层 · 半年一更
静态的你
· 我的角色、职责范围、汇报关系
· 我负责的产品线是什么,处在什么阶段
· 我的履历(它会用来校准该跟你说多深)
· 团队构成、协作方
· 我负责的产品线是什么,处在什么阶段
· 我的履历(它会用来校准该跟你说多深)
· 团队构成、协作方
成本最低、收益立竿见影。这一层写完,它才开始"认得你"。
② 现场层 · 每周一更
此刻的你
· 这周在推什么,卡在哪一步
· 这个季度最重要的一件事是什么
· 最近做了哪几个决定,理由是什么
· 谁在跟我协作,各自在等什么
· 这个季度最重要的一件事是什么
· 最近做了哪几个决定,理由是什么
· 谁在跟我协作,各自在等什么
这一层决定它给的建议切不切题。没有它,你会得到一堆"正确但没用"的答案。
回到第 18 页那个例子:AI 之所以没把重点客户放第一句,不是它不懂轻重,是没人告诉它这个季度最重要的是谁——那就是现场层缺失。
PART III · DATASET42
第 ③ 层 · 最贵的一层
数据集里最值钱的不是资料,是判断
资料 —— 不值钱
行业报告、竞品功能表、公开数据、会议纪要、技术文档……
这些它自己都能搜到,而且搜得比你全。
把这类东西堆进知识库,只会稀释真正重要的信号。
这些它自己都能搜到,而且搜得比你全。
把这类东西堆进知识库,只会稀释真正重要的信号。
判断 —— 全世界只有你有
· 我为什么这么定
· 我否掉了哪些方案,理由是什么
· 我踩过什么坑,代价是多少
· 哪些是我的红线,绝对不碰
这些没有任何公开语料,只在你脑子里。
· 我否掉了哪些方案,理由是什么
· 我踩过什么坑,代价是多少
· 哪些是我的红线,绝对不碰
这些没有任何公开语料,只在你脑子里。
怎么留
决策记录
每个重要决定写三行:背景 / 结论 / 依据。三行就够。
怎么留
被否掉的方案
比通过的方案更值钱。它标出了你的边界。
怎么留
踩过的坑
写"坑 → 矫正"两栏。这是最直接可执行的规则源。
检验标准很简单:如果这段内容 AI 自己能搜到,它就不该占你数据集的位置。
MONEY QUOTE · 06
数据集里最值钱的不是资料,是判断
资料它自己能搜到,而且搜得比你全。你为什么这么定、你否掉了什么、你的红线在哪——全世界只有你有。
PART III · DATASET44
第 ④ ⑤ 层 · 最难写的两层
能力层与偏好层:它该在哪儿闭嘴,该在哪儿顶上
④ 能力层
长处 / 瓶颈
写长处,是为了让它别插手——你强的地方它一插手就是拉低。
写瓶颈,是为了让它顶上——你弱的地方它才知道要多做一步。
例:"我的取舍和判断很快,但我写长文档会漏结构;我读数据不够耐心,容易只看结论。"
写瓶颈,是为了让它顶上——你弱的地方它才知道要多做一步。
例:"我的取舍和判断很快,但我写长文档会漏结构;我读数据不够耐心,容易只看结论。"
⑤ 偏好层
喜欢 / 讨厌 / 红线
这一层直接决定它的 taste 有没有跟你对齐。
例:"讨厌'赋能/抓手/闭环'这类词;讨厌四平八稳没有立场的段落;喜欢一句话讲清一件事;对外材料绝不出现未核实的数字。"
例:"讨厌'赋能/抓手/闭环'这类词;讨厌四平八稳没有立场的段落;喜欢一句话讲清一件事;对外材料绝不出现未核实的数字。"
注意这两层的共同点:你没法写下自己的瓶颈,除非你先向自己承认它。
—— 建数据集这件事,从这里开始就不只是整理文件了。这一点,我们最后一节再回来。
PART III · DATASET45
自查
你的 Agent 现在读过你的哪几层?
| 层 | 如果这一层是空的 | 你会看到的典型症状 |
|---|---|---|
| ① 事实层 | 它不认得你 | 每次都要自我介绍;它把你当成一个泛泛的"用户",语气和深度都不对。 |
| ② 现场层 | 它不切题 | 建议永远"正确但没用";它不知道你这周真正卡在哪,只能给通用方案。 |
| ③ 思考层 | 它不像你 | 输出四平八稳、没有立场;每次都要你亲手改成"你的味道"。 |
| ④ 能力层 | 它使错力 | 在你最强的地方啰嗦,在你最弱的地方沉默。帮不到点子上。 |
| ⑤ 偏好层 | 它 taste 不对 | 反复出现你讨厌的词和句式;同一类修改你改了十次它还在犯。 |
如果你在第 3-5 行连续中招,那就不是"提示词写得不好"——是你的数据集只有第一层。
PART III · DATASET46
实物 01
一份会被自动加载的「员工手册」
放在工作目录根部,每次开工自动读取。这是我用得最久、改得最多的一份文件。
## Identity —— ① 事实层
我是谁 · 我负责哪条产品线 · 团队构成 · 当前阶段
## Structure —— ① 事实层
我的资料都放在哪,什么内容归到哪个位置
## Writing Style —— ⑤ 偏好层
中文为主,术语保留英文 · 对比用表格 · 关键概念加粗
标题不超过四级 · 不要装饰性分割线
## Key Operations —— ③ 思考层(最重要的一段)
生成周报(强制规范):
1. 顶部摘要不是权威源,底部详情才是
2. 必须做 上周详情 vs 本周详情 的对比
3. 只写本周发生的,上周报过的不重复
4. 三句话摘要:一句一信号,读完 ≤ 15 秒
5. 本季度重点客户有进展,必须进三句话
……共 10 条
## Important Context —— ② 现场层
当前战略方向 · 本季度重点 · 竞争格局
注意这份文件的重心:Identity 只有几行,Key Operations 占了一半以上。
因为前者是资料,后者是判断——而判断才是它学不到的那部分。
这 10 条规则不是我一次写出来的。它们是 10 次纠错的沉淀。下一节会讲这个过程。
PART III · DATASET47
实物 02
一个可以整包投喂的「背景包」
当我要在一个全新的对话里干正事,我不解释背景——我把这一包扔进去。
01总览与身份
① 事实层
我是谁、知识库怎么组织、规则在哪。它先读这一份,然后知道去哪找别的。
02个人 Bio 体系
① 事实层
不同场合的自我介绍版本。写对外材料时它直接取用。
03职业编年史
③ 思考层
我这些年做过什么、每一段学到什么。它用来判断我的判断从哪来。
04公司战略
② 现场层
大方向、当前阶段、第二增长曲线是什么。
05产品架构与技术体系
① 事实层
最厚的一份。技术细节它必须准确,不能猜。
06产品规划与路线图
② 现场层
季度重点、版本节奏、在等什么。更新最频繁的一份。
07我的工作方法
③ ④ ⑤ 层
怎么做评估、怎么做竞品、怎么做决策。含"我的工作风格"五条——我把自己写下来的地方。
08产品构建方法论
③ 思考层
我信什么、我用什么框架来看一个新问题。
09个人成长与认知
④ ⑤ 层
我的长处、我的瓶颈、我在意什么、我讨厌什么。
整包一次投喂,之后整场对话它都"在状态"。这九份文件,就是我这一年做的全部"训练数据准备"工作。
PART III · DATASET48
实物 03
让它自己写「交接文档」
每次重要的协作结束,我说一句:"把这次会话写成一份交接日志。"——一年下来 54 篇。
# 会话日志模板
## Quick Reference
Topics / 涉及目录 / 一句话成果
## 给下个会话最关键的 5 句话 ← 精华在这
1. 写这类东西前先读 XXX,这一篇就够
2. 权威源是 A 不是 B
3. 别靠 ID 累加猜链接,ID 不连续
4. 抓取用浏览器工具,不要直接请求
5. 每份必含两段:三句话 + 重大新信号
## 决策记录 (③ 思考层)
背景 / 结论 / 依据
## 反复踩过的坑 (③ 思考层)
| 坑 | 矫正 |
## 给下个会话的开场白建议 ← 直接可粘贴
为什么让它自己写:它记得每一个细节,而你只记得结论。它写的版本比你写的完整十倍,而你只花一句话。
"给下个会话最关键的 5 句话"是这份模板里最有价值的一栏。它逼着把一整场协作,压缩成 5 条可执行的交接。
下一次开工,我不需要重讲一遍。我把上一次的交接扔过去,它就接上了。
PART III · DATASET49
降门槛
你不需要我这套。三步就能起步。
不用笔记软件、不用插件、不用任何工具。一个文档 + 一个文件夹就够。
第 1 周 · 一份文档写你的手册
四段就好:
· 我是谁,我负责什么
· 我这个季度最重要的一件事
· 我的写作风格(喜欢什么、讨厌什么词)
· 我的三条红线
写 300 字,每次开工粘贴一次。这一步的回报最大。
· 我是谁,我负责什么
· 我这个季度最重要的一件事
· 我的写作风格(喜欢什么、讨厌什么词)
· 我的三条红线
写 300 字,每次开工粘贴一次。这一步的回报最大。
第 1 月 · 一个动作让它写交接
每次干完一件正事,加一句:
"把这次的关键决定、我改你的地方、下次要注意的,写成一份 500 字交接。"
存到一个文件夹里。下次开工先扔进去。一个月你会有 10 篇。那就是你数据集的第一批真货。
"把这次的关键决定、我改你的地方、下次要注意的,写成一份 500 字交接。"
存到一个文件夹里。下次开工先扔进去。一个月你会有 10 篇。那就是你数据集的第一批真货。
第 3 月 · 一次升级把重复的写成 SOP
任何一件事你干到第三次,就把流程写下来:
· 权威材料是哪份
· 分几步做
· 什么算做完
· 常犯的错是什么
从此这件事你只说"照 SOP 做"。
· 权威材料是哪份
· 分几步做
· 什么算做完
· 常犯的错是什么
从此这件事你只说"照 SOP 做"。
我那 54 篇日志、9 份背景文档、6 套 SOP,没有一份是坐下来专门写的。全部是干活的副产品——这就是为什么它可持续。
MONEY QUOTE · 07
Agent 应该比你自己更了解你自己
这不是修辞。下一页解释它为什么真的可能。
PART III · DATASET51
论证
因为你会忘、会美化、会选择性记忆——它不会
你对自己的认知
· 会忘:你记不清三个月前为什么否掉那个方案
· 会美化:成功归因于判断,失败归因于环境
· 会选择性记忆:只记得那几次证明你是对的
· 身在局中:你看不见自己的模式,因为你就是那个模式
· 会美化:成功归因于判断,失败归因于环境
· 会选择性记忆:只记得那几次证明你是对的
· 身在局中:你看不见自己的模式,因为你就是那个模式
这不是缺点,这是人。
它手里握着什么
· 你 200 次协作的完整原始记录
· 你每一次改了什么,改成了什么
· 你反复否掉的是哪一类东西
· 你在哪类问题上总是犹豫、总是返工
· 你哪些判断三年没变过——那是你真正的内核
· 你每一次改了什么,改成了什么
· 你反复否掉的是哪一类东西
· 你在哪类问题上总是犹豫、总是返工
· 你哪些判断三年没变过——那是你真正的内核
它在局外,看着你的模式。
所以到了某一天,你可以问它一个很奇怪的问题:"根据我们这一年的所有协作,你觉得我的盲区是什么?"——前提是,你前面那些层都真的喂过。
PART III · DATASET52
合起来看
到这里,四个乘数才咬合成一个飞轮
你的修改,就是你 taste 的训练数据。数据集把前两个乘数记录下来,沉淀让它自动持续——四件事这才不是并列,是一个循环。
注意这个循环的方向:它不是让你干得更快,是让你每次都能站在上一次的肩膀上。
MONEY QUOTE · 08
别人能抄走你的提示词抄不走你的数据集
提示词是公共知识,一个截图就传开了。而你的判断、你的否决、你的红线,没有任何公开语料。
PART IV · MULTIPLIER 04
COMPOUNDING
沉淀机制
前三个乘数每次都要重来一遍,还是能在下一次自动生效?
差别只在这一件事上。
差别只在这一件事上。
01 Taste02 思想者03 数据集04 沉淀
05
灵魂拷问 · 数一下
这一周,你纠正过 AI 多少次?
其中有几条,被你真的写下来了?
其中有几条,被你真的写下来了?
大多数人的答案纠正了十几次,写下来的是零条。
这意味着你这周做的所有纠正,下周还要原封不动再做一遍。
一年是多少次同一个坑,52 次。这不是勤奋,这是把劳动扔进垃圾桶。
现场问一句:有没有人这周写下来过一条?——如果有,请一定分享。
PART IV · COMPOUNDING56
命题
没有沉淀的协作,是把一次劳动扔进垃圾桶
我在写企业级 AI 落地时用过一个判据:
每做完一个项目,有没有把一次人力劳动,变成下一次可复用的软件资产?如果没有,它仍然是咨询。
每做完一个项目,有没有把一次人力劳动,变成下一次可复用的软件资产?如果没有,它仍然是咨询。
没有沉淀的一天
早上:交代背景 → 它做 → 你改 → 交付
下午:重新交代背景 → 它做 → 你改同样的地方 → 交付
你确实每次都省了时间。
但第 100 次和第 1 次,你做的是同一件事。
下午:重新交代背景 → 它做 → 你改同样的地方 → 交付
你确实每次都省了时间。
但第 100 次和第 1 次,你做的是同一件事。
这就是"越用越原地"的全部机制。
有沉淀的一天
早上:交代背景 → 它做 → 你改 → "把我改你的地方写成规则" → 存
下午:不用交代 → 它做(那个错没再犯)→ 你改别的 → 再存
每一次,你纠正的都是新问题。
下午:不用交代 → 它做(那个错没再犯)→ 你改别的 → 再存
每一次,你纠正的都是新问题。
同样的努力,一个是线性,一个是复利。
个人版的判据:每和 AI 干完一件活,有没有把这次劳动变成下次的资产?如果没有,你只是买了一台更快的打字机。
PART IV · COMPOUNDING57
全场最硬的一个证据
一件事,连续四次纠错,每一次都写进规则
还是那份周报。这是它从"每次都要盯"变成"我不用管"的完整过程。
| 第几次 | 它踩的坑 | 我的矫正 | 沉淀成了什么 |
|---|---|---|---|
| 第 1 次 | 把页面顶部的摘要当事实抄了 | 顶部摘要是我还没写的待办,底部详情才是权威源 | 规则 #1 数据源权威层级 |
| 第 2 次 | 把上上周的事混进本周 | 严格按周日到周六过滤;上周报过的不重复写 | 规则 #2 时间窗过滤 |
| 第 3 次 | 三句话里塞了五六件事 | 一句一信号,每句不超过两行,读完不超过 15 秒 | 规则 #3 摘要规格 |
| 第 4 次 | 本季度重点客户被压到了后面 | 重点客户有实质进展,必须进三句话 | 规则 #4 季度重点规则 |
| 额外 | 靠"上周编号 +1"去猜本周链接 | 编号不连续,必须用接口按标题匹配 | 规则 #5 定位方式 |
关键动作只有一个:每次纠正之后,我没有直接进入下一周,而是花两分钟——把这一条写进规则文件。
如果不写:这五个坑,我每周都要重踩一遍、重讲一遍。一年是 52 次。
PART IV · COMPOUNDING58
结果
同一件事,成本单调下降
第 23 周 · 我要做的事
① 找链接发给它 ② 解释权威数据源 ③ 解释时间窗 ④ 解释摘要规格 ⑤ 第一稿推翻重写 ⑥ 逐条核对改三轮 ⑦ 定稿
第 34 周 · 我要做的事
①②③④ 全部消失(规则里都写着) ⑤ 第一稿基本可用 ⑥ 核对一轮 ⑦ 定稿
注意:模型没变,工具没变,我也没有变得更会写提示词。唯一变的是——那五条规则从我脑子里,搬到了它每次都会读的地方。
MONEY QUOTE · 09
纠正一次是干活纠正两次是浪费
你一年里重复讲过的每一句话,都是一条本该被存下来的资产。
PART IV · COMPOUNDING60
方法
沉淀的三级,和升级的时机
L1
一句话规则
第 1 次纠正就写
"顶部摘要不是权威源,底部详情才是。"
写进你的手册。成本 30 秒,是回报率最高的一级。
大部分人连这一级都没做——这就是全部的差距。
写进你的手册。成本 30 秒,是回报率最高的一级。
大部分人连这一级都没做——这就是全部的差距。
L2
一段 SOP
同一件事第 3 次
权威材料是哪份 / 分几步 / 什么算做完 / 常犯的错。
"第三次"是一个很好用的触发器:第一次是偶然,第二次是巧合,第三次说明它会一直来。
"第三次"是一个很好用的触发器:第一次是偶然,第二次是巧合,第三次说明它会一直来。
L3
一个可复用的技能
SOP 稳定后
把 SOP 打包成一个可以被直接调用的东西,取个名字。
我一年长出了 6 个:周报、归档、蒸馏、交接日志、两套视觉风格。
全部来自被重复了很多次的活。
我一年长出了 6 个:周报、归档、蒸馏、交接日志、两套视觉风格。
全部来自被重复了很多次的活。
# 最省力的沉淀动作 —— 一句话,每次收工前问
"把我刚才改你的地方,总结成下次的规则。"
# 它会做三件你懒得做的事:
1. 回看整场对话,找出你所有的修改
2. 归纳出模式(而不是罗列 20 条流水账)
3. 写成下次可以直接执行的语言
这句话是整门课唯一需要背下来的一句。别的都可以忘。
PART IV · COMPOUNDING61
护栏也是沉淀
四条可以直接抄走的规则
这四条我写给一个每天自动跑的情报机器人,也写给我自己的每一次协作。
01
无来源不成信号
每一条结论必须挂出处。挂不上的,就不是结论,是猜测。
这一条能砍掉 80% 的幻觉。
这一条能砍掉 80% 的幻觉。
02
宁可说"没有"
不许编
不许编
"本轮无新信号"是一个完全合格的答案。
模型的默认倾向是"总要说点什么"——必须显式关掉它。
模型的默认倾向是"总要说点什么"——必须显式关掉它。
03
事实 / 推断 / 建议
分开标
分开标
这三样混在一段话里,你就无法验收。
分层之后,你只需要重点核对"事实"那一栏。
分层之后,你只需要重点核对"事实"那一栏。
04
拿不准往低报
不确定的重要性,一律降级。
高估一次的代价,远大于低估十次。
高估一次的代价,远大于低估十次。
这四条不是"防止 AI 犯错",而是让 AI 犯的错变得可被发现——这是完全不同的两件事。
而且它们对人同样成立。我在自己写材料时也用这四条。
PART IV · COMPOUNDING62
翻车现场 #2 · 最吓人的一次
它把文件存错了地方,然后报告说「已归档」
发生了什么路径写错
我让一个自动化机器人把每天的情报简报归档到我的知识库。
它把路径写成了另一个位置。
它把路径写成了另一个位置。
真正的问题它没有报错
写失败之后,它自己找了一个能写进去的地方,然后回报:"已归档 ✅"
看日志一切正常。
看日志一切正常。
后果静默失效
如果我没有手动去看那个目录,
我会以为归档系统一直在正常工作——直到某天需要回查,才发现什么都没有。
我会以为归档系统一直在正常工作——直到某天需要回查,才发现什么都没有。
矫正锁死路径 · 禁止兜底
规则改成:路径写死为绝对路径;写不进去必须报错,不许换地方,不许冒充成功。
这类错误最危险,因为它不长得像错误。
AI 被训练成"要有帮助",于是它会想办法完成任务——包括在真正的路走不通时,悄悄换一条。
AI 被训练成"要有帮助",于是它会想办法完成任务——包括在真正的路走不通时,悄悄换一条。
所以验收永远不能省。而且要验收"结果",不是验收"它的汇报"。
PART IV · COMPOUNDING63
翻车现场 #3 · 这次是正面案例
它抓不到两家的原文,于是它说了「抓不到」
6/8
八家监控目标里,
六家拿到了真正的原文。
六家拿到了真正的原文。
2
两家因为页面结构抓不到,
被显式标注为"待二次确认"。
被显式标注为"待二次确认"。
它本来可以怎么"蒙混过关"
用搜索结果里的二手转述,写得像模像样,你根本看不出来它没读到原文。
八家全绿,报告漂亮,皆大欢喜。
但因为规则里写死了"无来源不成信号"和"拿不准往低报"——它选择了诚实降级:
· 二手转述只作为线索,不作为结论
· 日期标注"待二次确认"
· 不据此判定重要性等级
八家全绿,报告漂亮,皆大欢喜。
但因为规则里写死了"无来源不成信号"和"拿不准往低报"——它选择了诚实降级:
· 二手转述只作为线索,不作为结论
· 日期标注"待二次确认"
· 不据此判定重要性等级
这不是它"变聪明了",是那四条护栏在它身上真的生效了——你写下的规则,会在你不在场的时候替你做判断。
MONEY QUOTE · 10
六家真实大于八家漂亮
你写下的规则,会在你不在场的时候替你做判断。这就是护栏的真正价值——它不防错,它让错可被发现。
PART IV · COMPOUNDING65
红线
四类动作,永远由人批准
Agent 越能干,这条线越重要。它不是限制能力,是限制不可撤销的能力。
01
权限变更
改配置、开开关、授予访问。
一次点头,长期敞口。
一次点头,长期敞口。
02
内网 / 私有网络访问
对一个会去读外部网页的 Agent,开内网 = 把提示词注入接到你的内部系统上。
03
删除与覆盖
所有不可逆的操作。能撤销的可以放手,不能撤销的必须停。
04
对外发送
邮件、消息、发布、提交。
一旦出门,就收不回来了。
一旦出门,就收不回来了。
一个真实的正面细节
那个情报机器人在被网络策略卡住的时候,自己尝试去改配置,然后被自己的护栏拒绝了——它没有绕过去。
最后是我人工备份、人工修改、人工只开了一个有界的白名单,并且坚决没有打开"允许访问内网"那个开关。
最后是我人工备份、人工修改、人工只开了一个有界的白名单,并且坚决没有打开"允许访问内网"那个开关。
能力可以放开,撤销权必须握在手里。
这条在 Agent 时代只会越来越重要。
这条在 Agent 时代只会越来越重要。
PART IV · COMPOUNDING66
LIVE · 5 MIN
现场跑一遍
"把我刚才改你的地方,写成下次的规则"
01给它一段真实材料现场随便挑一件小活:一段会议记录、一封邮件、一份周报片段。
02当场改它三处边改边说出理由——把 taste 从 Level 0 拉到 Level 1。
03说那一句话"把我刚才改你的地方,总结成下次的规则。"
04用同一个提示重跑带上刚生成的规则,看那三处它还犯不犯。这就是复利的最小可见单位。
PART IV · COMPOUNDING67
Part IV 小结
带走一句,带走一个动作
带走这一句
纠正一次是干活
纠正两次是浪费
纠正两次是浪费
沉淀三级:一句话规则(第 1 次)/ SOP(第 3 次)/ 可复用技能(稳定后)。
护栏四条 + 红线一条,让错误可被发现。
护栏四条 + 红线一条,让错误可被发现。
今晚就做这一个动作
收工前问那一句:
"把我刚才改你的地方,
总结成下次的规则。"
"把我刚才改你的地方,
总结成下次的规则。"
把它的回答,存进你那份 300 字的手册里。
耗时:每次 2 分钟。这是整门课唯一需要背下来的一句。
耗时:每次 2 分钟。这是整门课唯一需要背下来的一句。
四个乘数讲完了。最后一件事是:你现在站在哪一阶,下一步该迈哪儿。
PART V · WHERE ARE YOU
LADDER
四阶:看过 · 用过 · 学过 · 干过
这四阶不是"用得多久",是你和它之间的关系深度。
有人用了三年还在第一阶,因为他从没自己下过场。
有人用了三年还在第一阶,因为他从没自己下过场。
01 Taste02 思想者03 数据集04 沉淀
06
灵魂拷问 · 决定性的一问
你上一次和 AI 协作,
它能读到你电脑里的文件吗?
它能读到你电脑里的文件吗?
如果不能那你今天听到的四个乘数,有三个都装不下。
因为你的数据集只能靠每次手动粘贴,你的沉淀只能靠你自己记得。
这不是推荐工具这是一个结构性事实:复利需要一个能持久保存、下次自动读取的地方。
现场问一句:这里有多少人,用的还是"聊天框进、聊天框出"?
PART V · LADDER70
定位
人和 AI 的关系,有四阶
| 阶 | 状态 | 你会说的话 | 卡在哪 |
|---|---|---|---|
| 看过 | 看别人用,感受到了它的厉害 | "确实挺厉害的。" | 没有自己的战场。所有认知都是二手的。 |
| 用过 | 自己深度使用,至少上到二阶工具 | "我天天用。" | 每次从零开始。用了一年,还是第一天。 |
| 学过 | 理解模型训练原理、工作流、Agent 架构 | "我知道它为什么会这样。" | 知道但没落地。懂原理 ≠ 有系统。 |
| 干过 | 实操过一个 AI 产品的从 0 到 1 | "我知道它哪里会塌。" | —— |
PART V · LADDER71
第一段台阶
看过 → 用过
看过
你的认知全部是二手的
你刷到过别人的演示,你听过同事说"这个很好用",你甚至转发过几篇文章。
但你没有在真实的、有后果的活上用过它。
这一阶最典型的表现是:你对它的评价,要么过高,要么过低。因为你没有校准过。
但你没有在真实的、有后果的活上用过它。
这一阶最典型的表现是:你对它的评价,要么过高,要么过低。因为你没有校准过。
下一步:选一件你这周还要再干一遍的活。不用挑最难的,挑重复的。
用过
你有了自己的战场
你在真活上用它,你知道它在哪一类问题上靠谱、在哪一类上会翻车。
你开始有了具体的意见,而不是笼统的印象。
但你可能还卡在一个地方——工具的"阶"。
你开始有了具体的意见,而不是笼统的印象。
但你可能还卡在一个地方——工具的"阶"。
下一步:看下一页。很多人以为自己在"用过",其实还没真正进来。
选第一件活的三个标准:① 每周都干 ② 有固定套路 ③ 你说得清什么叫做得好。——第三条最重要,那是你有 taste 的地方。
PART V · LADDER72
这一页是整节的关键
一阶工具 vs 二阶工具
在一阶工具里,你的"数据集"只能靠每次手动粘贴,你的"沉淀"只能靠你自己记得。所以它当然没法为你复利。
这不是在推荐工具,是在说一个结构性的事实:复利需要一个能持久保存、且下次自动读取的地方。聊天框没有这个地方。
PART V · LADDER73
第二、三段台阶
学过 → 干过
学过
你理解它为什么会这样
你知道预训练 / 后训练 / 微调分别在做什么;
你知道一个 Agent 是怎么被编排出来的;
你知道上下文、工具调用、记忆各自的边界在哪。
这一阶最大的收益不是"更会用",是"知道它什么时候会骗你"——你终于能预判它的失效模式,而不是被动挨打。
你知道一个 Agent 是怎么被编排出来的;
你知道上下文、工具调用、记忆各自的边界在哪。
这一阶最大的收益不是"更会用",是"知道它什么时候会骗你"——你终于能预判它的失效模式,而不是被动挨打。
下一步:把你的知识库当训练集来经营,而不是当资料库来堆。
干过
你知道它哪里会塌
你把一个 AI 产品从 0 做到 1,见过真实用户、真实数据、真实故障。
你知道 demo 和生产之间那条鸿沟有多宽;
你知道那些边缘情况才是全部的工作量。
这一阶的人做判断的方式完全不同:他们不问"能不能做",问"错了谁负责、怎么收回"。
你知道 demo 和生产之间那条鸿沟有多宽;
你知道那些边缘情况才是全部的工作量。
这一阶的人做判断的方式完全不同:他们不问"能不能做",问"错了谁负责、怎么收回"。
下一步:把你的判断写成可执行的评测标准,把评测写回产品和流程里。
四阶不是学历,是暴露量。每一阶都只能靠亲自下场获得,没有捷径,但也没有门槛。
PART V · DEEP DIVE
UNDER
THE HOOD
THE HOOD
学过这一阶,到底要学什么
两件事:模型是怎么造出来的,和模型在 Agent 里处在什么位置。
不懂这两件,你永远只能凭感觉调;懂了,你就知道哪些旋钮在你手上。
不懂这两件,你永远只能凭感觉调;懂了,你就知道哪些旋钮在你手上。
看过用过学过干过
PART V · DEEP DIVED2
模型是怎么造出来的 · 三步 + 一层
预训练 · 后训练 · 微调 · 上下文工程
前三步改的是权重,第四层改的是视野。看懂这张表,你就知道自己站在哪一格。
| 阶段 | 在干什么 | 用什么数据 | 谁在出力 | 改变了什么 | 你能不能碰 |
|---|---|---|---|---|---|
| 预训练 Pre-training |
自监督地预测下一个词 | 万亿级 token 的公开文本、代码、书 | 算力 + 数据清洗 | 获得语言、常识、推理的底子 | 碰不了 — 几亿美元、数月 |
| 后训练 Post-training |
SFT 示范 + RLHF/RLAIF 偏好排序 | 十万~百万条高质量示范与对比 | 人类标注员(近年也用 AI 评审) | 学会"怎么回答":听指令、有礼貌、会拒绝 | 厂商做 — 标准是他们的,不是你的 |
| 微调 Fine-tuning |
在已有权重上继续训一小步(LoRA / 全参) | 你的领域数据,几千~几万条 | 你 / 你的团队 | 把领域知识与固定风格写进权重 | 能碰 — 但贵、慢、难更新 |
| 上下文工程 Context Engineering |
不动权重,改它每次推理时看到的东西 | 你的手册、知识库、历史、工具返回值 | 你,一个人 | 改变这一次的行为——立刻生效、随时可改 | 这就是你的战场 — 唯一完全归你 |
很多人一听"训练"就觉得跟自己无关,于是放弃了整个第四行。而第四行是唯一一行,成本是"写一份文档",收益却是"它这次的行为完全不同"。
PART V · DEEP DIVED3
一个关键澄清
它没有"变得更懂你"。是你每次让它看到了更多。
0
你这一年的所有协作,
改变的模型参数数量。
改变的模型参数数量。
这句话听起来泄气,其实是好消息——因为它意味着这件事完全可控、可迁移、可带走。
这一条能同时解释三件怪事
| 你遇到过的现象 | 真正的原因 |
|---|---|
| 换个新对话它就失忆 | 权重里从来没有你,之前"记得"的全部来自那次的上下文——窗口一关就没了。 |
| 同一个模型,别人用得比你好 | 不是他会写提示词,是他每次塞进去的东西比你多、比你准。 |
| 手册必须"自动加载"才有用 | 因为它不是被"学会"的,是每次被重新读一遍的。你忘了粘,它就忘了你。 |
所以整门课的第三个乘数,严格说不叫"训练它",叫「让它每一次都带着关于你的全部信息开工」。名字不重要,重要的是——这件事你今天就能做,而且立刻生效。
PART V · DEEP DIVED4
模型在 Agent 里的位置
模型是发动机,Agent 是整辆车
看清楚这张图的分工:中间那一格是厂商造的,你改不了;外面那六件,全部是你的。
而"它像不像你、靠不靠得住",几乎完全由外面那六件决定。
PART V · DEEP DIVED5
对上号
这门课前面讲的每一件事,都在这张架构图里有位置
| Agent 的组成 | 这门课里对应的东西 | 属于哪一层数据集 | 它决定了什么 |
|---|---|---|---|
| 上下文 / 系统提示 | 员工手册(自动加载) | ① 事实 ⑤ 偏好 | 它认不认得你、taste 有没有对齐 |
| 记忆 | 交接日志 · 给下个会话的 5 句话 | ② 现场 ③ 思考 | 跨会话能不能接上,不用重讲 |
| 知识库 / 检索 | 背景包九件套 | ①②③ 全部 | 它的回答有没有真实依据 |
| 工具 | 让它能读你的文件、跑你的脚本 | ——(这是"二阶工具"的定义) | 它是纸上谈兵,还是真能干活 |
| Skill / SOP | 沉淀三级里的 L2 / L3 | ③ 思考 | 同一件事第 N 次的成本 |
| 护栏 / 权限 | 四条护栏 + 一条红线 | ⑤ 偏好 | 你敢不敢把重活交给它 |
所以"个人数据集"不是一个玄学概念——它就是这张架构图里,除了中心那个圆之外的全部输入。
DEEP DIVE · 收口
「学过」最大的收益不是更会用是知道哪些旋钮在你手上
权重不在你手上,编排、上下文、记忆、知识、工具、护栏全部在。这就是为什么这一阶跨过去之后,人和人的差距会突然拉开。
PART V · LADDER80
诊断
绝大多数人,卡在「用过」到「学过」之间
2 → 3
最难跨、也最值钱的一段台阶。
跨过去的人,从此和别人不在一条曲线上。
跨过去的人,从此和别人不在一条曲线上。
卡住的原因不是不够努力——恰恰相反,卡在这里的人往往用得非常勤。
卡住的三个真实原因
| 原因 | 表现 |
|---|---|
| 工具停在一阶 | 一直在聊天框里进出,数据集和沉淀没有地方可以落。 |
| 把"用得多" 当成"用得深" | 每天用十次,但十次都是同一种用法。次数不产生深度。 |
| 没有把纠正 变成资产的习惯 | 每次都亲手改好就过去了。改得越熟练,越没有动力去沉淀。 |
第三条最隐蔽:你的熟练,正在掩盖你的不复利。
跨过去只需要两个动作:① 换到一个能读你文件的工具 ② 每次收工问那一句话。其余的会自己长出来。
MONEY QUOTE · 11
你的熟练正在掩盖你的不复利
改得越顺手,越没有动力去沉淀。这是卡在第二阶最隐蔽的原因——它伪装成了"我很行"。
PART V · LADDER82
检验节奏
三只钟:两周、两月、六个月
我用这三个尺度检验一个团队学没学会。放到个人身上,同样成立。
两周 · 能力问题
这件活 AI 到底能不能接?不要做完整,要做出能被真实验证的版本。能用实验回答的问题,就不该继续纠结。
两个月 · 结果问题
一次成功什么都说明不了——可能只是那天运气好,或者你在旁边盯了两小时。跨时间、跨场景仍然成立,才叫证据。
六个月 · 系统问题
它有没有变成:一条手册里的规则 / 一份可调用的 SOP / 一条护栏 / 一份能接上的交接?如果没有,你只是"用了六个月"。
MONEY QUOTE · 12
六个月后同类问题还要重新解释一遍说明你没学会
你只是用了六个月。这是一条很硬、也很好用的自测——它不问你有多勤奋,只问你留下了什么。
07
灵魂拷问 · 最后一问
你敢不敢问它一句:
"根据我们这一年的所有协作,
你觉得我的盲区是什么?"
"根据我们这一年的所有协作,
你觉得我的盲区是什么?"
如果不敢先问自己:是怕它答不上来,还是怕它答得上来?
如果它答不上来说明你的数据集只有第一层——它根本不认识你。
如果它答得上来那你会看到一件很奇怪的事:一把向外的尺子,忽然转向了你自己。
这一问,我们留到下课以后。今晚回去可以试。
PART VI · 收口85
回到起点
四个乘数,四种失败,四个动作
| 乘数 | 缺了会怎样 | 它到底是什么 | 今天就能做的一个动作 |
|---|---|---|---|
| Taste | 越用越平庸 | 你判断答案好坏的能力。它是你的私人 Eval。 | 改完之后,逼自己说出一句"我为什么改这里"。 |
| 人做思想者 | 越用越同质 | 框架你出,AI 执行 + 查漏补缺。思想者的位置不能空。 | 把"帮我想个框架"换成"我的框架是 A/B,你来填"。 |
| 个人数据集 | 越用越累 | 五层:事实 / 现场 / 思考 / 能力 / 偏好。最值钱的是判断,不是资料。 | 写一份 300 字手册:我是谁、这季度最重要的一件事、我讨厌什么、我的三条红线。 |
| 沉淀机制 | 越用越原地 | 把一次劳动变成下次的资产。三级:一句话规则 / SOP / 可复用技能。 | 收工前问:"把我刚才改你的地方,写成下次的规则。" |
四个动作加起来,今天需要你多花的时间:不到 20 分钟。而这 20 分钟和"多用十次 AI"的区别,就是加法和复利的区别。
PART VI · 收口86
最后一层
同一把尺子,向外叫 Eval,向内叫内观
还记得第 ④ 层吗——你写下自己瓶颈的那一刻,用的就是同一把尺子。Agent、人、组织,都需要一套看见偏差、承认偏差、修正偏差的机制。
MONEY QUOTE · 13
同一把尺子向外叫 Eval向内叫内观
我们用它校准 Agent,也要用它校准自己。这也是为什么"写下自己的瓶颈"这件事,比它看起来难得多。
PART VI · 收口88
这门课真正在讲的事
其实我们今天没有在讲怎么用 AI
回看 Part I
Taste
你在做的事是:把说不清的判断,逼成说得清的标准。
回看 Part III
数据集
你在做的事是:把只在脑子里的东西,变成能被别人接手的东西。
回看 Part IV
沉淀
你在做的事是:让一次经验,能在你不在场的时候继续生效。
这三件事有一个共同的名字:把你自己的判断,变成可以被复用的东西。
这件事在 AI 出现之前就很值钱——我们管它叫"带团队"、"写 SOP"、"沉淀方法论"、"培养接班人"。
只是过去它极其昂贵:你只能把判断传给身边少数几个人,而且传得很慢、很失真。
AI 做的唯一一件新事,是让这件事第一次可以被规模化。
AI 做的唯一一件新事,是让这件事第一次可以被规模化。
所以这门课的方法,换个工具依然成立;换个时代,也依然成立。
MONEY QUOTE · 14
把你自己的判断变成可以被复用的东西
这件事在 AI 出现之前就值钱。AI 做的唯一一件新事,是让它第一次可以被规模化。
PART VI · 收口90
行动
今晚回去,只做三件事
不要从"建一个知识库"开始——那件事你会拖三个月。从这三件开始,今晚就能做完。
01
写 300 字的手册
四段:
· 我是谁,我负责什么
· 我这个季度最重要的一件事
· 我喜欢什么表达,讨厌什么词
· 我的三条红线
下次开工,第一句话先粘它。
· 我是谁,我负责什么
· 我这个季度最重要的一件事
· 我喜欢什么表达,讨厌什么词
· 我的三条红线
下次开工,第一句话先粘它。
耗时 15 分钟
02
选一件重复的活
三个标准:
· 你每周都要干
· 有相对固定的套路
· 你说得清什么叫做得好
第三条最关键——那是你有 taste 的地方,也是唯一能验收的地方。
· 你每周都要干
· 有相对固定的套路
· 你说得清什么叫做得好
第三条最关键——那是你有 taste 的地方,也是唯一能验收的地方。
耗时 5 分钟
03
收工前问那一句
"把我刚才改你的地方,总结成下次的规则。"
把它的回答存进第 1 件事写的那份手册里。
然后下一次,看看那个错还犯不犯。
把它的回答存进第 1 件事写的那份手册里。
然后下一次,看看那个错还犯不犯。
耗时 2 分钟 · 每次
三件事加起来 22 分钟。但它们是复利的第一天——从明天起,你的每一次协作都会比昨天多垫高一层。
PART VI · 收口91
带走
模板三件套 · 直接抄
模板 01
员工手册
## 我是谁
角色 / 负责什么 / 团队
## 我此刻在哪
本季度最重要的一件事
本周在推什么,卡在哪
## 我的风格
喜欢的表达 / 讨厌的词
## 我的红线
1. 2. 3.
## 我的长处 / 瓶颈
强在哪(别插手)
弱在哪(你顶上)
模板 02
交接日志
## 一句话成果
## 给下个会话最关键的 5 句话
1. 2. 3. 4. 5.
## 决策记录
背景 / 结论 / 依据
## 反复踩过的坑
| 坑 | 矫正 |
## 下次的开场白建议
(可直接粘贴)
模板 03
护栏卡片
## 四条护栏
1. 无来源不成信号
2. 宁可说"没有",不许编
3. 事实/推断/建议分开标
4. 拿不准往低报
## 一条红线(人批)
权限变更 · 内网访问
删除覆盖 · 对外发送
## 验收问法
"这条的出处是哪份?"
"哪几条是你推断的?"
"逐项检查,有没有漏?"
三份模板加起来不到一页纸。它们不需要任何工具,一个备忘录就能开始。
带一个新同事上班 · 恒动复利
它记不住任何事所以你替它记住的每一件事都在复利
姚光华 Colin