MY THREE YEARS IN AI PRODUCT · 2024 — 2026

当智能体开始行动, 人和组织怎样跟上

我的 AI 产品管理三年观察
WHEN AGENTS BEGIN TO ACT
姚光华 Colin · 声网 AI 产品线负责人
开场 · THE TENSION三年母版
开场 · THE TENSION

模型可以远程调用。

责任判断
以及没有写进文档的例外——

必须有人到场。

02 / 48
全场主线 · THE LEARNING SYSTEM三年母版
全场主线 · THE LEARNING SYSTEM

模型能力会持续外溢。
工具会持续变便宜。

现场 证据 组织能力

真正稀缺的是:

一套把现场判断变成证据、
再把证据写进产品和组织的系统。
03 / 48
2024 → 2025 → 2026第一幕 · 同一场转身
2024 → 2025 → 2026

三次演讲,问的是同一个问题。

2024

职能融合

AI 改变产品怎样被做出来

2025

共同转身

AI 改变人和组织怎样做决定

2026

行动与责任

AI 改变行动权怎样被交付

04 / 48
2024 · UNCERTAINTY第一幕 · 同一场转身
2024 · UNCERTAINTY

产品经理还知道
60 天后能发布什么吗?

传统软件
Input 确定的 Output
AI 产品
Input p = .61 p = .27 p = .12
当行为不能被事先写死,产品到底怎样被定义?
05 / 48
2024 · THE EXPERIMENT第一幕 · 同一场转身
2024 · THE EXPERIMENT

AI 产品开发,越来越像一连串实验。

01假设这次改动应该更好
02原型最快做出可运行版本
03Eval用同一把尺子判断好坏
04下一次实验带着证据继续

PRD 描述我们想要什么

Eval 判断我们有没有靠近

06 / 48
2024 · THE CONVERGENCE第一幕 · 同一场转身
2024 · THE CONVERGENCE

Product × Design × R&D

2024 · 原始 SLIDE 37 · 重绘 Product Design R&D AI 正在把三个职能,推向同一个问题。
谁能最快把判断
变成一个可验证的版本?
PRODUCT DESIGN R&D
07 / 48
2025 · THE TURN第一幕 · 同一场转身
2025 · THE TURN

人和组织,必须一起转身。

HUMAN ORGANIZATION 只有一条转向 → 断裂

愿意试、愿意负责、愿意改错

组织

允许实验、缩短反馈、留下学习

如果可以用实验验证,就不该等待共识。
08 / 48
2026 · THE ACTION第一幕 · 同一场转身
2026 · THE ACTION

Agent 不再只是回答问题。

回答 调用工具 修改状态 主动发起 进入企业系统

它开始调用工具、修改状态、联系客户、代表企业表达

交出去的不是一个功能,是一部分行动权。
09 / 48
盲点 · THE BLIND SPOT第二幕 · 第四个圆
盲点 · THE BLIND SPOT

Product、Design、R&D 都在公司内部。

INSIDE THE COMPANY THE REAL FIELD

但最难的规则、例外和判断,

往往不在会议室里。
10 / 48
FIELD · THE FOURTH CIRCLE第二幕 · 第四个圆
FIELD · THE FOURTH CIRCLE

2026,要给那张图加上第四个圆。

PRODUCT DESIGN R&D FIELD 可验证的真实结果

Product × Design × R&D × Field

真正把三个职能焊在一起的,
不只是 AI,是客户现场。
11 / 48
生产环境 · PRODUCTION第二幕 · 第四个圆
生产环境 · PRODUCTION

企业 Agent 难在模型之外。

数据 系统 流程 权限 例外
数据不完整
系统彼此割裂
流程充满例外
权限必须收紧
判断没有写进 SOP
DEMO证明模型能做
生产证明组织敢用
12 / 48
OPENAI PRESENCE · MANAGED DEPLOYMENT第二幕 · 第四个圆
OPENAI PRESENCE · MANAGED DEPLOYMENT

Presence 不是一个注册账号就能用的产品。

PRESENCE POLICIES EVALS APPROVED ACTIONS ESCALATION 每一次部署,都由 FDE 或合作伙伴带进生产
LIMITED GA MANAGED DEPLOYMENT NOT SELF-SERVE
13 / 48
从现场长成产品 · HOW IT GREW第二幕 · 第四个圆
从现场长成产品 · HOW IT GREW

它不是先被定义,再被交付。

阶段 01内部支持先做自己的零号客户
阶段 02FDE 部署把真实例外带回系统
阶段 03Presence把重复判断封装成产品
先在现场做十遍,再给第十一次起一个产品名。
14 / 48
FORWARD DEPLOYED ENGINEER第二幕 · 第四个圆
FORWARD DEPLOYED ENGINEER

FDE 站在交付与产品之间。

Customer Core Product FDE Discovery · System Design · Build · Rollout Eval-driven Feedback · 产品回流

进入现场,把 Agent 跑起来;
回到产品,把重复问题留下来。

它的成功,不只看项目交付,
还看反馈有没有改变产品路线。
15 / 48
不是谁 · WHAT IT IS NOT第二幕 · 第四个圆
不是谁 · WHAT IT IS NOT

它不是售前,也不只是实施。

销售 实施 咨询 FDE 当前项目 下一次产品
销售让客户决定买不买
实施让既有产品装得上
咨询解决这一次的问题
FDE交付这一次,也让下一次不再从零开始
被产品化的驻场工程。
16 / 48
最后一公里 · THE LAST MILE
它不是替产品补最后一公里。 它在最后一公里里,寻找产品

模型在这里撞上真实系统、权限、政策和例外——撞击要留下痕迹。

17 / 48
现场 · THE EARLIEST PRD第二幕 · 第四个圆
现场 · THE EARLIEST PRD

对复杂企业 Agent 来说,
生产现场,可能才是最早的 PRD。

PRD · 由现场写入
§1 规则 客户没写进文档的那条
§2 例外 跨系统才会发生的那种
§3 判断 八年老员工的直觉瞬间
§4 边界 绝不能自动化的红线
需求不是先被写出来,
而是先在现实里发生。
18 / 48
例外 · THE DARK MATTER第三幕 · 现场判断 → 产品能力
例外 · THE DARK MATTER

Edge case 不是噪声。

标准流程 没写进文档的规则 资深员工的暗知识 跨系统的例外

它让每一条「标准流程」
在现实里不断偏转。

它是产品真正的暗物质。
19 / 48
核心飞轮 · FIELD TO PRODUCT第三幕 · 现场判断 → 产品能力
核心飞轮 · FIELD TO PRODUCT

一次现场判断,怎样变成下一次产品能力?

现场例外 人的判断 EVAL / SCORECARD 可复用产品能力 SLA / 授权边界 再次进入生产 REUSABLE SYSTEM
01现场例外 → 人的判断
02判断 → Eval / Scorecard
03Eval → 能力 → SLA / 授权
04再次进入生产,带回新例外
每转一圈,
下一次就少从零开始一点。
20 / 48
从经验到资产 · TACIT TO EXPLICIT第三幕 · 现场判断 → 产品能力
从经验到资产 · TACIT TO EXPLICIT

一条判断只存在于资深员工脑中——

TACIT · 经验 写出来 / 测起来 EXPLICIT · 组织系统
能被复现、验证和传递,才开始成为资产。
21 / 48
判断的产品化 · EVAL AS PRD第三幕 · 现场判断 → 产品能力
判断的产品化 · EVAL AS PRD

Eval 是 AI 时代的新 PRD。

PRD 我们想要什么 一份文档,评审完就开始积灰
EVAL 什么才算做对 一组判据,每一次提交都在跑
每次提交重新运行
22 / 48
共同事实 · SHARED TRUTH第三幕 · 现场判断 → 产品能力
共同事实 · SHARED TRUTH

Eval 不只是模型的成绩单。

现场 产品 研发 销售 客户 同一把尺子 · 同一组案例
它是五方共用的事实语言。

没有共同的尺子,
组织只能靠职位和音量做决定。

23 / 48
没有尺子 · ORGANIZATIONAL DISTORTION第三幕 · 现场判断 → 产品能力
没有尺子 · ORGANIZATIONAL DISTORTION

「客户觉得它没听懂。」

这个场景经常失败 现场 意图识别不够好 产品 换个模型试试 研发 每传一层,字数更短,含义更偏
没有 Eval,问题每传一层,就离真实失败远一点。
24 / 48
证据的后果 · FROM EVIDENCE TO PROMISE第三幕 · 现场判断 → 产品能力
证据的后果 · FROM EVIDENCE TO PROMISE

Eval 不是终点。

Eval

我们知道什么叫做对

Release Gate

我们知道何时能上线

SLA

我们敢为结果承诺

Approved Action

我们敢交出一部分行动权

证据越厚,授权才可能越深。
25 / 48
产品化测试 · THE TEST第三幕 · 现场判断 → 产品能力
产品化测试 · THE TEST

项目做完以后——

有没有把一次人力劳动,
变成下一次可复用的软件资产?
PROJECT DONE → 归零 没有 · 它仍然是咨询 EVAL MODULE PLAYBOOK 下一次,从更高起点开始

没有 它仍然是咨询

 FDE 才成为产品发现引擎

26 / 48
学习速度 · THREE CLOCKS第四幕 · 三只钟
学习速度 · THREE CLOCKS

同一个学习飞轮,转着三只不同的钟。

学习 回路 2 周 · 能力 2 月 · 结果 6 月 · 组织
2 周能力它能不能工作
2 月结果它是否稳定创造结果
6 月组织学习能不能留下来
快,不只是一种速度。
27 / 48
2 WEEKS · EXPERIMENT第四幕 · 三只钟
2 周
做出可验证版本。
不问「大家是否同意」。先问:
它能不能工作?
28 / 48
2 MONTHS · EVIDENCE第四幕 · 三只钟
2 月
让结果在真实业务里反复成立。
跨时间 · 跨样本 · 跨场景
它是否稳定创造结果?
29 / 48
6 MONTHS · INSTITUTION第四幕 · 三只钟
6 月
把证据写进产品、流程、指标和组织。
半年以后,遇到同类问题还要不要找回同一个人?
这次学习能不能留下来?
30 / 48
三种成熟度 · THREE MATURITIES第四幕 · 三只钟
三种成熟度 · THREE MATURITIES

两周看能力,两月看结果,六个月看组织。

LEARNING THAT STAYS
EXPERIMENT → EVIDENCE → INSTITUTION
速度的终点,不是更快发布。
是更快学会,而且不再忘掉。
31 / 48
不是速度竞赛 · BEYOND SHIPPING第四幕 · 三只钟
不是速度竞赛 · BEYOND SHIPPING

真正的 AI Native,不只是发版更快。

发布次数 组织记忆 学习回路接入

发版更快,却反复犯同一种错,
只是高频失忆

分水岭是:现场学到的东西,能不能留下来。
32 / 48
收敛 · THE SAME WORD第五幕 · 一起转身
收敛 · THE SAME WORD

两位 CEO,用了同一个词。

ELEVENLABS CEO High-agency people are the winners of the advances in AI.” Mati Staniszewski
SIERRA CEO · OPENAI 董事长 “Hyper high-agency people who really deeply care.” Bret Taylor
33 / 48
个人系统 · THE HUMAN SYSTEM第五幕 · 一起转身
个人系统 · THE HUMAN SYSTEM

High Agency 是发动机,不是完整答案。

ENGINE AGENCY 只驱动第一段 方向 标准 校准
Agency主动出手
客户理解判断方向
Care守住标准
内观及时改错
看清楚,敢下注,肯负责,会改错。
34 / 48
方向 · DIRECTION第五幕 · 一起转身
方向 · DIRECTION

理解客户在前,主动行动在后。

方向正确 × AI 加速 → 更快接近结果 方向错误 × AI 加速 → 更快制造破坏
Agency 没有判断力,是被放大的负资产。
35 / 48
标准 · CARE第五幕 · 一起转身
标准 · CARE

Care 是——

指标 OK 告警 0 投诉 0 SLA 达标 一处微小的裂缝

指标还没报警,
客户也没有投诉——

你仍然觉得:
这里不对。
36 / 48
校准 · INTROSPECTION第五幕 · 一起转身
校准 · INTROSPECTION

越是行动快的人,越需要内观。

偏差被速度放大 内观 · 重新校准

不是不断问「我做得够不够多」,而是不断问:

什么证据,会证明我错了?
37 / 48
环境 · THE SYSTEM AROUND PEOPLE第五幕 · 一起转身
环境 · THE SYSTEM AROUND PEOPLE

低 Agency,有时是组织制造出来的。

三级审批 · 跨部门等待 · 失败只追责 …等待 小实验 · 快反馈 · 失败留下证据
然后,组织开始抱怨:「团队为什么不主动?」
38 / 48
先环境,后评价 · ORDER MATTERS第五幕 · 一起转身
先环境,后评价 · ORDER MATTERS

管理者的顺序不能反。

1砍掉无意义审批
2降低第一个实验的成本
3缩短用户反馈到产品修改的距离
4判断一个人愿不愿意主动行动
先改环境,再评价人。
39 / 48
尺子的两面 · THE INNER MEASURE
同一把尺子, 向外叫 Eval,向内叫内观

Eval 让我们看见系统的偏差。内观让我们承认自己的偏差。
一个决定产品能不能进化,一个决定我们自己能不能进化。

40 / 48
不只是功能 · THE NEW OBJECT第六幕 · PM 的新工作
不只是功能 · THE NEW OBJECT

产品经理的工作对象变了。

过去主要定义

页面 · 功能 · 流程

现在还要定义

判断 · 证据 · 承诺 · 边界 · 学习

不只是产品做什么,
还包括组织怎样知道它做对了。
41 / 48
PM OUTPUTS · FOUR LAYERS第六幕 · PM 的新工作
PM OUTPUTS · FOUR LAYERS

四层新交付物

01产品关系场景选择题 · 人格说明书 · 记忆规则WHY STAY
02产品证据Eval · Scorecard · 结果规格WHAT'S RIGHT
03产品承诺SLA · 计价条件 · 事故等级WHAT WE SIGN
04产品边界授权 · 披露 · 问责 · 撤销HOW FAR
每向上一层,都需要更厚的证据。
42 / 48
MONDAY MORNING · EIGHT QUESTIONS第六幕 · PM 的新工作
MONDAY MORNING · EIGHT QUESTIONS

周一早上,先问这八个问题。

判断从哪里来
Q1我的判断来自哪里?
Q2它进入过真实场景吗?
Q3什么证据会推翻我?
Q4团队对「好」有共同语言吗?
学习怎样留下
Q5这次错误变成下一条 Eval 了吗?
Q6这次交付增加下次成功概率了吗?
Q7Agent 得到了什么行动权?
Q8这份托付怎样被收回?
43 / 48
AI NATIVE · FOUR PROPERTIES第六幕 · PM 的新工作
AI NATIVE · FOUR PROPERTIES

真正的 AI Native 组织:

决策 → 实验 现场知识回流 判断产品化 学习穿越人员变化
它不是产出更多,
是更少重复支付同一笔学费。
44 / 48
MOAT · WHAT COMPOUNDS第六幕 · PM 的新工作
MOAT · WHAT COMPOUNDS

当功能越来越容易复制——

一层层沉积的判断地质
生产里的 edge case
失败中形成的判断
持续增长的 Eval
客户愿意交出的权限
团队敢签下的结果承诺
护城河,不只是代码。
是一套不断变厚的判断系统。
45 / 48
2024 → 2025 → 2026第六幕 · PM 的新工作
2024 → 2025 → 2026

三年以后,我对产品经理的答案

2024 亲手做原型 写高质量 Eval
2025 用实验代替等待 用内观修正自己
2026 让现场判断进入产品 让这次学习成为下次能力
下一代 PM 的价值,是把不确定性压缩成证据。
46 / 48
合影页 · 欢迎拍照ONE PAGE TO TAKE HOME
合影页 · 欢迎拍照

让学习留下来

01 进入现场 02 写出判断 03 变成 EVAL 04 形成证据 05 写进产品 06 改变组织

找到真实例外 · 让暗知识显性化

让团队拥有共同事实 · 跨时间样本场景成立

能力承诺边界一起变厚 · 下一次不再从零开始

你的工作不是保证每次都成功,
而是让每次交付都增加下一次成功的概率。
47 / 48

智能体会继续进化。

模型可以远程调用。
但责任、判断,以及没有写进文档的例外,
仍然需要有人到场。

下一次,
希望人和组织没有掉队。

谢谢
姚光华 Colin · 声网 AI 产品线负责人
48 / 48