当智能体开始行动,
人和组织怎样跟上

我的 AI 产品管理三年观察
When Agents Begin to Act
姚光华 Colin · 声网 AI 产品线负责人
开场 · THE TENSION

模型可以远程调用。

责任、判断,
以及没有写进文档的例外
必须有人到场
全场主线 · THE LEARNING SYSTEM

模型能力会持续外溢。
工具会持续变便宜。

真正稀缺的是:
现场证据组织能力
一套把现场判断变成证据、
再把证据写进产品和组织的系统。
2024 → 2025 → 2026

三次演讲,问的是同一个问题。

2024
职能融合
AI 改变产品怎样被做出来
2025
共同转身
AI 改变人和组织怎样做决定
2026
行动与责任
AI 改变行动权怎样被交付
2024 · UNCERTAINTY

产品经理还知道
60 天后能发布什么吗?

传统软件
Input → 确定的 Output
AI 产品
Input → 概率分布
当行为不能被事先写死,
产品到底怎样被定义
2024 · THE EXPERIMENT

AI 产品开发,
越来越像一连串实验。

假设 原型 Eval 下一次实验
PRD 描述我们想要什么。
Eval 判断我们有没有靠近。
2024 · THE CONVERGENCE
Product Design R&D

AI 正在把三个职能,
推向同一个问题:

谁能最快把判断
变成一个可验证的版本
2025 · THE TURN

人和组织,必须一起转身

愿意试、愿意负责、愿意改错
组织允许实验、缩短反馈、留下学习
如果可以用实验验证,
不该等待共识
2026 · THE ACTION

Agent 不再只是回答问题。

回答 调用 修改 主动发起
它开始调用工具、修改状态、
联系客户、代表企业表达。
交出去的不是一个功能,
是一部分行动权
盲点 · THE BLIND SPOT

Product、Design、R&D
都在公司内部。

但最难的规则、例外和判断,
往往不在会议室里。
FIELD · THE FOURTH CIRCLE
Product Design R&D Field

2024 我说,
三个圆会融合

两年后,它长出了第四个圆——Field
Product × Design × R&D × Field
而把这三个圆焊进客户现场的角色,
今天有了名字:FDE
生产环境 · PRODUCTION

企业 Agent 难在模型之外

数据 不完整
系统 彼此割裂
流程 充满例外
权限 必须收紧
判断 没有写进 SOP
Demo 证明模型能做。
生产证明组织敢用。
OPENAI PRESENCE · MANAGED DEPLOYMENT

Presence 不是一个
注册账号就能用的产品。

Policies · Evals · Approved Actions · Escalation
Limited GA · Managed Deployment
每一次部署,都由 FDE 或合作伙伴带进生产。
从现场长成产品 · HOW IT GREW

它不是先被定义,
再被交付。

内部支持
先做自己的零号客户
FDE 部署
把真实例外带回系统
Presence
把重复判断封装成产品
先在现场做十遍,
再给第十一次起一个产品名
FORWARD DEPLOYED ENGINEER

FDE 站在交付与产品之间。

Customer Core Product FDE 上方交付动作 · 下方产品回流
Discovery · System Design · Build · Rollout
进入现场,把 Agent 跑起来;回到产品,把重复问题留下来。
它的成功,不只看项目交付,
还看反馈有没有改变产品路线
不是谁 · WHAT IT IS NOT

它不是售前,也不只是实施。

销售让客户决定买不买
实施让既有产品装得上
咨询解决这一次的问题
FDE交付这一次,也让下一次不再从零开始
产品化的驻场工程。
最后一公里 · THE LAST MILE

它不是替产品
补最后一公里。

它在最后一公里里,
寻找产品
现场 · THE EARLIEST PRD

对复杂企业 Agent 来说,
生产现场,可能才是最早的 PRD

规则 · 例外 · 判断 · 边界
需求不是先被写出来,
而是先在现实里发生
例外 · THE DARK MATTER

Edge case 不是噪声。

没写进文档的规则
资深员工的暗知识
跨系统才会发生的例外
也是产品真正的暗物质
核心飞轮 · FIELD TO PRODUCT

一次现场判断,怎样变成下一次产品能力?

可复用系统 现场例外 人的判断 Eval 可复用产品能力 SLA / 授权 再次上线
每转一圈,下一次就少从零开始一点
从经验到资产 · TACIT TO EXPLICIT

一条判断只存在于
资深员工脑中

它是经验,还不是组织能力。
写出来 / 测起来
能被复现、验证和传递,
才开始成为资产
判断的产品化 · EVAL AS PRD

Eval 是 AI 时代的新 PRD。

PRD 说:我们想要什么。
Eval 说:什么才算做对。
一份 PRD 会在文档里积灰。
一套 Eval,每一次提交都在跑
共同事实 · SHARED TRUTH

Eval 不只是模型的成绩单。

现场 产品 研发 销售 客户
它是五方共用的事实语言
没有共同的尺子,组织只能靠职位和音量做决定。
没有尺子 · ORGANIZATIONAL DISTORTION

“客户觉得它没听懂。”

现场这个场景经常失败
产品意图识别不够好
研发换个模型试试
没有 Eval,问题每传一层,
就离真实失败远一点
证据的后果 · FROM EVIDENCE TO PROMISE

Eval 不是终点。

Eval我们知道什么叫做对
Release Gate我们知道何时能上线
SLA我们敢为结果承诺
Approved Action我们敢交出一部分行动权
证据越厚,授权才可能越深
产品化测试 · THE TEST

项目做完以后,

有没有把一次人力劳动,
变成下一次可复用的软件资产
没有
它仍然是咨询
FDE 才成为产品发现引擎
迭代速度 · THREE CLOCKS
2 周2 月6 月

同一个产品迭代,
走着三只不同的钟

2 周 能力
2 月 结果
6 月 组织
快,不只是一种速度
2 WEEKS · EXPERIMENT
0

做出可验证版本。

Question → Prototype → User Signal
不问“大家是否同意”。先问:
它能不能工作
2 MONTHS · EVIDENCE
0

让结果在真实业务里反复成立。

跨时间 · 跨样本 · 跨场景
它是否稳定创造结果
6 MONTHS · INSTITUTION
0

把证据写进产品、流程、指标和组织。

半年以后,遇到同类问题还要不要找回同一个人?
这次迭代,能不能沉淀下来
三种成熟度 · THREE MATURITIES

两周看能力,
两月看结果,
六个月看组织。

Experiment → Evidence → Institution
迭代的终点,不是更快发布。
是让每一次迭代都沉淀下来
不是速度竞赛 · BEYOND SHIPPING

真正的 AI Native,
不只是发版更快。

发布次数组织记忆
发版更快,却反复犯同一种错,只是高频失忆
分水岭是:
现场学到的东西,能不能留下来
收敛 · THE SAME WORD

两位 CEO,
用了同一个词。

“High-agency people are the winners
of the advances in AI.”
Mati Staniszewski · ElevenLabs CEO
“Hyper high-agency people
who really deeply care.”
Bret Taylor · Sierra CEO / OpenAI 董事长
个人系统 · THE HUMAN SYSTEM

High Agency 是发动机,
不是完整答案。

Agency
主动出手
客户理解
判断方向
Care
守住标准
内观
及时改错
看清楚,敢下注,肯负责,会改错
方向 · DIRECTION

理解客户在前,
主动行动在后。

方向正确 × AI 加速 = 更快接近结果
方向错误 × AI 加速 = 更快制造破坏
Agency 没有判断力,
是被放大的负资产
标准 · CARE

Care 是:

指标还没报警,
客户也没有投诉,
你仍然觉得:
这里不对
校准 · INTROSPECTION

越是行动快的人,
越需要内观

不是不断问“我做得够不够多”,而是不断问:
什么证据,会证明我错了
环境 · THE SYSTEM AROUND PEOPLE

低 Agency,
有时是组织制造出来的

三级审批
跨部门等待
失败只追责、不留学习
然后,组织开始抱怨:
“团队为什么不主动?”
先环境,后评价 · ORDER MATTERS

管理者的顺序不能反。

1砍掉无意义审批
2降低第一个实验的成本
3缩短用户反馈到产品修改的距离
4再判断一个人愿不愿意主动行动
先改环境,再评价人
尺子的两面 · THE INNER MEASURE

同一把尺子,
向外叫 Eval,向内叫内观

Agent / Product Human / Self
Eval 让我们看见系统的偏差。
内观让我们承认自己的偏差。
一个决定产品能不能进化,
一个决定我们自己能不能进化
不只是功能 · THE NEW OBJECT

产品经理的工作对象变了。

过去主要定义:页面 · 功能 · 流程
现在还要定义:判断 · 证据 · 承诺 · 边界 · 学习
不只是产品做什么,
还包括组织怎样知道它做对了
PM OUTPUTS · FOUR LAYERS

四层新交付物

产品边界授权 · 披露 · 问责 · 撤销
产品承诺SLA · 计价条件 · 事故等级
产品证据Eval · Scorecard · 结果规格
产品关系场景选择题 · 人格说明书 · 记忆规则
每向上一层,都需要更厚的证据
MONDAY MORNING · EIGHT QUESTIONS

周一早上,先问这八个问题。

判断从哪里来
我的判断来自哪里?
它进入过真实场景吗?
什么证据会推翻我?
团队对“好”有共同语言吗?
学习怎样留下
这次错误变成下一条 Eval 了吗?
这次交付增加下次成功概率了吗?
Agent 得到了什么行动权?
这份托付怎样被收回?
AI NATIVE · FOUR PROPERTIES

真正的 AI Native 组织:

能把决策快速变成实验
能让现场知识持续回流
能把人的判断产品化
能让学习穿越人员变化
它不是产出更多,
是更少重复支付同一笔学费
MOAT · WHAT COMPOUNDS

当功能越来越容易复制,

真正不断变厚的是:
生产里的 edge case
失败中形成的判断
持续增长的 Eval
客户愿意交出的权限
团队敢签下的结果承诺
护城河,不只是代码。
是一套不断变厚的判断系统
2024 → 2025 → 2026

三年以后,我对产品经理的答案

2024
亲手做原型,写高质量 Eval
2025
用实验代替等待,用内观修正自己
2026
让现场判断进入产品,让这次学习成为下次能力
下一代 PM 的价值,
是把不确定性压缩成证据
合影页 · 欢迎拍照

让学习留下来

01 进入现场 找到真实例外
02 写出判断 让暗知识显性化
03 变成 Eval 让团队拥有共同事实
04 形成证据 跨时间、样本与场景成立
05 写进产品 能力、承诺、边界一起变厚
06 改变组织 下一次不再从零开始
你的工作不是保证每次都成功,
而是让每次交付都增加下一次成功的概率

智能体会继续进化。

模型可以远程调用。
但责任、判断,以及没有写进文档的例外,
仍然需要有人到场
下一次,
希望人和组织没有掉队
谢谢 · 姚光华 Colin · 声网 AI 产品线负责人
01 / 48