当智能体开始行动,
人和组织怎样跟上
我的 AI 产品管理三年观察
When Agents Begin to Act
姚光华 Colin · 声网 AI 产品线负责人
开场 · THE TENSION
模型可以远程调用。
但责任、判断,
以及没有写进文档的例外,
以及没有写进文档的例外,
必须有人到场。
全场主线 · THE LEARNING SYSTEM
模型能力会持续外溢。
工具会持续变便宜。
真正稀缺的是:
一套把现场判断变成证据、
再把证据写进产品和组织的系统。
再把证据写进产品和组织的系统。
2024 → 2025 → 2026
三次演讲,问的是同一个问题。
2024
职能融合
AI 改变产品怎样被做出来
2025
共同转身
AI 改变人和组织怎样做决定
2026
行动与责任
AI 改变行动权怎样被交付
2024 · UNCERTAINTY
产品经理还知道
60 天后能发布什么吗?
传统软件
Input → 确定的 Output
AI 产品
Input → 概率分布
当行为不能被事先写死,
产品到底怎样被定义?
产品到底怎样被定义?
2024 · THE EXPERIMENT
AI 产品开发,
越来越像一连串实验。
假设 → 原型 → Eval → 下一次实验
PRD 描述我们想要什么。
Eval 判断我们有没有靠近。
Eval 判断我们有没有靠近。
2024 · THE CONVERGENCE
AI 正在把三个职能,
推向同一个问题:
谁能最快把判断
变成一个可验证的版本?
变成一个可验证的版本?
2025 · THE TURN
人和组织,必须一起转身。
人愿意试、愿意负责、愿意改错
组织允许实验、缩短反馈、留下学习
如果可以用实验验证,
就不该等待共识。
就不该等待共识。
2026 · THE ACTION
Agent 不再只是回答问题。
回答 → 调用 → 修改 → 主动发起
它开始调用工具、修改状态、
联系客户、代表企业表达。
联系客户、代表企业表达。
交出去的不是一个功能,
是一部分行动权。
是一部分行动权。
盲点 · THE BLIND SPOT
Product、Design、R&D
都在公司内部。
但最难的规则、例外和判断,
往往不在会议室里。
FIELD · THE FOURTH CIRCLE
2024 我说,
三个圆会融合。
两年后,它长出了第四个圆——Field。
Product × Design × R&D × Field
而把这三个圆焊进客户现场的角色,
今天有了名字:FDE。
今天有了名字:FDE。
生产环境 · PRODUCTION
企业 Agent 难在模型之外。
数据 不完整
系统 彼此割裂
流程 充满例外
权限 必须收紧
判断 没有写进 SOP
Demo 证明模型能做。
生产证明组织敢用。
生产证明组织敢用。
OPENAI PRESENCE · MANAGED DEPLOYMENT
Presence 不是一个
注册账号就能用的产品。
Policies · Evals · Approved Actions · Escalation
Limited GA · Managed Deployment
每一次部署,都由 FDE 或合作伙伴带进生产。
从现场长成产品 · HOW IT GREW
它不是先被定义,
再被交付。
内部支持
先做自己的零号客户
FDE 部署
把真实例外带回系统
Presence
把重复判断封装成产品
先在现场做十遍,
再给第十一次起一个产品名。
再给第十一次起一个产品名。
FORWARD DEPLOYED ENGINEER
FDE 站在交付与产品之间。
Discovery · System Design · Build · Rollout
进入现场,把 Agent 跑起来;回到产品,把重复问题留下来。
进入现场,把 Agent 跑起来;回到产品,把重复问题留下来。
它的成功,不只看项目交付,
还看反馈有没有改变产品路线。
还看反馈有没有改变产品路线。
不是谁 · WHAT IT IS NOT
它不是售前,也不只是实施。
销售让客户决定买不买
实施让既有产品装得上
咨询解决这一次的问题
FDE交付这一次,也让下一次不再从零开始
被产品化的驻场工程。
最后一公里 · THE LAST MILE
它不是替产品
补最后一公里。
它在最后一公里里,
寻找产品。
寻找产品。
现场 · THE EARLIEST PRD
对复杂企业 Agent 来说,
生产现场,可能才是最早的 PRD。
规则 · 例外 · 判断 · 边界
需求不是先被写出来,
而是先在现实里发生。
而是先在现实里发生。
例外 · THE DARK MATTER
Edge case 不是噪声。
没写进文档的规则
资深员工的暗知识
跨系统才会发生的例外
资深员工的暗知识
跨系统才会发生的例外
也是产品真正的暗物质。
核心飞轮 · FIELD TO PRODUCT
一次现场判断,怎样变成下一次产品能力?
每转一圈,下一次就少从零开始一点。
从经验到资产 · TACIT TO EXPLICIT
一条判断只存在于
资深员工脑中,
它是经验,还不是组织能力。
能被复现、验证和传递,
才开始成为资产。
才开始成为资产。
判断的产品化 · EVAL AS PRD
Eval 是 AI 时代的新 PRD。
PRD 说:我们想要什么。
Eval 说:什么才算做对。
Eval 说:什么才算做对。
一份 PRD 会在文档里积灰。
一套 Eval,每一次提交都在跑。
一套 Eval,每一次提交都在跑。
共同事实 · SHARED TRUTH
Eval 不只是模型的成绩单。
它是五方共用的事实语言。
没有共同的尺子,组织只能靠职位和音量做决定。
没有尺子 · ORGANIZATIONAL DISTORTION
“客户觉得它没听懂。”
现场这个场景经常失败
产品意图识别不够好
研发换个模型试试
没有 Eval,问题每传一层,
就离真实失败远一点。
就离真实失败远一点。
证据的后果 · FROM EVIDENCE TO PROMISE
Eval 不是终点。
Eval我们知道什么叫做对
Release Gate我们知道何时能上线
SLA我们敢为结果承诺
Approved Action我们敢交出一部分行动权
证据越厚,授权才可能越深。
产品化测试 · THE TEST
项目做完以后,
有没有把一次人力劳动,
变成下一次可复用的软件资产?
变成下一次可复用的软件资产?
没有
它仍然是咨询
有
FDE 才成为产品发现引擎
迭代速度 · THREE CLOCKS
同一个产品迭代,
走着三只不同的钟。
2 周 能力
2 月 结果
6 月 组织
2 月 结果
6 月 组织
快,不只是一种速度。
2 WEEKS · EXPERIMENT
0 周
做出可验证版本。
Question → Prototype → User Signal
不问“大家是否同意”。先问:
它能不能工作?
2 MONTHS · EVIDENCE
0 月
让结果在真实业务里反复成立。
跨时间 · 跨样本 · 跨场景
它是否稳定创造结果?
6 MONTHS · INSTITUTION
0 月
把证据写进产品、流程、指标和组织。
半年以后,遇到同类问题还要不要找回同一个人?
这次迭代,能不能沉淀下来?
三种成熟度 · THREE MATURITIES
两周看能力,
两月看结果,
六个月看组织。
Experiment → Evidence → Institution
迭代的终点,不是更快发布。
是让每一次迭代都沉淀下来。
是让每一次迭代都沉淀下来。
不是速度竞赛 · BEYOND SHIPPING
真正的 AI Native,
不只是发版更快。
发版更快,却反复犯同一种错,只是高频失忆。
分水岭是:
现场学到的东西,能不能留下来。
现场学到的东西,能不能留下来。
收敛 · THE SAME WORD
两位 CEO,
用了同一个词。
“High-agency people are the winners
of the advances in AI.”
of the advances in AI.”
Mati Staniszewski · ElevenLabs CEO
“Hyper high-agency people
who really deeply care.”
who really deeply care.”
Bret Taylor · Sierra CEO / OpenAI 董事长
个人系统 · THE HUMAN SYSTEM
High Agency 是发动机,
不是完整答案。
Agency
主动出手
客户理解
判断方向
Care
守住标准
内观
及时改错
看清楚,敢下注,肯负责,会改错。
方向 · DIRECTION
理解客户在前,
主动行动在后。
方向正确 × AI 加速 = 更快接近结果
方向错误 × AI 加速 = 更快制造破坏
方向错误 × AI 加速 = 更快制造破坏
Agency 没有判断力,
是被放大的负资产。
是被放大的负资产。
标准 · CARE
Care 是:
指标还没报警,
客户也没有投诉,
客户也没有投诉,
你仍然觉得:
这里不对。
这里不对。
校准 · INTROSPECTION
越是行动快的人,
越需要内观。
不是不断问“我做得够不够多”,而是不断问:
什么证据,会证明我错了?
环境 · THE SYSTEM AROUND PEOPLE
低 Agency,
有时是组织制造出来的。
三级审批
跨部门等待
失败只追责、不留学习
跨部门等待
失败只追责、不留学习
然后,组织开始抱怨:
“团队为什么不主动?”
“团队为什么不主动?”
先环境,后评价 · ORDER MATTERS
管理者的顺序不能反。
1砍掉无意义审批
2降低第一个实验的成本
3缩短用户反馈到产品修改的距离
4再判断一个人愿不愿意主动行动
先改环境,再评价人。
尺子的两面 · THE INNER MEASURE
同一把尺子,
向外叫 Eval,向内叫内观。
Eval 让我们看见系统的偏差。
内观让我们承认自己的偏差。
内观让我们承认自己的偏差。
一个决定产品能不能进化,
一个决定我们自己能不能进化。
一个决定我们自己能不能进化。
不只是功能 · THE NEW OBJECT
产品经理的工作对象变了。
过去主要定义:页面 · 功能 · 流程
现在还要定义:判断 · 证据 · 承诺 · 边界 · 学习
不只是产品做什么,
还包括组织怎样知道它做对了。
还包括组织怎样知道它做对了。
PM OUTPUTS · FOUR LAYERS
四层新交付物
产品边界授权 · 披露 · 问责 · 撤销
产品承诺SLA · 计价条件 · 事故等级
产品证据Eval · Scorecard · 结果规格
产品关系场景选择题 · 人格说明书 · 记忆规则
每向上一层,都需要更厚的证据。
MONDAY MORNING · EIGHT QUESTIONS
周一早上,先问这八个问题。
判断从哪里来
我的判断来自哪里?
它进入过真实场景吗?
什么证据会推翻我?
团队对“好”有共同语言吗?
它进入过真实场景吗?
什么证据会推翻我?
团队对“好”有共同语言吗?
学习怎样留下
这次错误变成下一条 Eval 了吗?
这次交付增加下次成功概率了吗?
Agent 得到了什么行动权?
这份托付怎样被收回?
这次交付增加下次成功概率了吗?
Agent 得到了什么行动权?
这份托付怎样被收回?
AI NATIVE · FOUR PROPERTIES
真正的 AI Native 组织:
能把决策快速变成实验
能让现场知识持续回流
能把人的判断产品化
能让学习穿越人员变化
它不是产出更多,
是更少重复支付同一笔学费。
是更少重复支付同一笔学费。
MOAT · WHAT COMPOUNDS
当功能越来越容易复制,
真正不断变厚的是:
▪ 生产里的 edge case
▪ 失败中形成的判断
▪ 持续增长的 Eval
▪ 客户愿意交出的权限
▪ 团队敢签下的结果承诺
护城河,不只是代码。
是一套不断变厚的判断系统。
是一套不断变厚的判断系统。
2024 → 2025 → 2026
三年以后,我对产品经理的答案
2024
亲手做原型,写高质量 Eval
2025
用实验代替等待,用内观修正自己
2026
让现场判断进入产品,让这次学习成为下次能力
下一代 PM 的价值,
是把不确定性压缩成证据。
是把不确定性压缩成证据。
合影页 · 欢迎拍照
让学习留下来
01 进入现场 找到真实例外
02 写出判断 让暗知识显性化
03 变成 Eval 让团队拥有共同事实
04 形成证据 跨时间、样本与场景成立
05 写进产品 能力、承诺、边界一起变厚
06 改变组织 下一次不再从零开始
你的工作不是保证每次都成功,
而是让每次交付都增加下一次成功的概率。
而是让每次交付都增加下一次成功的概率。
智能体会继续进化。
模型可以远程调用。
但责任、判断,以及没有写进文档的例外,
仍然需要有人到场。
但责任、判断,以及没有写进文档的例外,
仍然需要有人到场。
下一次,
希望人和组织没有掉队。
希望人和组织没有掉队。
谢谢 · 姚光华 Colin · 声网 AI 产品线负责人